多模态图像、视频、语音等跨模态能力

图像理解

模型识别并解释图像内容的能力。

图像理解涵盖物体识别、场景描述、图表解析、文档 OCR 等,是多模态模型的核心输入能力,广泛用于自动标注、内容审核与无障碍辅助。

相关术语