多模态图像、视频、语音等跨模态能力

多模态模型

能同时处理文本、图像、音频等多种输入输出形式的模型。

多模态模型将视觉、听觉编码器与语言模型融合,支持看图说话、图文理解、语音交互等。GPT-5、Gemini、Claude 等旗舰模型均已原生支持图像输入。

相关术语