多模态图像、视频、语音等跨模态能力

声音克隆

用少量样本复制特定人声的音色与风格。

声音克隆通过说话人嵌入与条件生成实现,少量录音即可合成相似语音,用于有声内容与个性化助手;也带来深度伪造风险,需配合使用授权与内容检测。

相关术语