能同时处理文本、图像、音频等多种输入输出形式的模型。
多模态模型将视觉、听觉编码器与语言模型融合,支持看图说话、图文理解、语音交互等。GPT-5、Gemini、Claude 等旗舰模型均已原生支持图像输入。