多模态图像、视频、语音等跨模态能力

语音识别(STT)

将语音转换为文本的技术,用于转写、字幕与语音输入。

语音识别用于会议转写、字幕与语音输入,主流方案已支持实时流式识别与多说话人区分,按音频时长计费。

相关术语