阿里云发布了 Qwen-Audio-3.0-TTS 实时语音合成模型,包含两个版本:Flash(面向实时交互,首包延迟约 300ms)和 Plus(面向高质量生成,自然度和音色还原度更优)。在全球第三方权威榜单 Artificial Analysis 中,Qwen-Audio-3.0-TTS-Plus 斩获冠军。

本次更新聚焦四个生产环境核心问题:更广的语言覆盖、更自然的指令控制、更精细的标签控制,以及在参考音频不清晰时的鲁棒性。
核心能力概览

多语种与方言全面升级
16 种语言覆盖,WER/CER 指标领先
Qwen-Audio-3.0-TTS 面向全球多语种场景进行了专项优化,覆盖中文、英文、日语、韩语、德语等 16 种语言。
在 WER/CER(词/字错误率,越低越好)评测中,Flash 版本平均仅为 3.87,Plus 版本为 3.96,16 种语言中有 10 种取得最佳表现。

在说话人相似度(SS)方面,Plus 版本在所有 16 种语言中均排名第一,平均 SS 达到 82.75;Flash 版本为 80.44。这表明在多种语言环境下都具备极强的音色还原能力。

20 种中文方言
通过更高质量的方言数据和专门的方言强化训练,模型有效缓解了"方言特色弱化"问题。目前支持 20 种高质量方言,覆盖广东、重庆、东北、四川、上海等主流方言区,使合成语音在韵律、声调和口语化表达上更接近母语者。
Free-style 自然语言指令控制
Qwen-Audio-3.0-TTS 支持用自然语言灵活定义情绪、角色、场景、语速等维度。无需掌握专业声学知识,即可通过自然语言指令控制语音风格——客服需要温和耐心,直播需要热情感染,有声书需要角色代入。
细粒度标签控制
模型还支持在文本中直接嵌入结构化标签(如 [gasp]、[giggles]、[angry]),对语气、情绪和呼吸类细节进行精准调控。适合叙事、游戏、影视配音等需要精确控制非语言细节的场景。
复杂声学鲁棒性
真实业务中,参考音频往往来自复杂环境。Qwen-Audio-3.0-TTS 通过针对性的真实声学仿真训练,将语音增强能力原生注入复刻流程:
- 高混响场景:有效抑制混响干扰,合成更干净清晰
- 高噪声场景:抗噪能力更强,语音质量显著优于前代
即使参考条件不佳,合成语音依然保持高质量。
精品音色库
配套的精品音色库将模型能力沉淀为开箱即用的资源,覆盖:
- 指令风格音色
- 20 种方言音色
- 细粒度控制音色
- 14+ 款小语种音色
面向严肃创作场景,音频输出品质从 24kHz 跃升至 48kHz,单次语音合成支持长达 3 分钟,满足长文本播报需求。
总结
Qwen-Audio-3.0-TTS 从"能说话"到"会表达",在以下方面表现突出:
- 自然语言描述角色、情绪、场景,合成结果随指令变化
- 支持上下文驱动的语气选择,同一文本不同情绪
- 支持耳语、笑场、情绪转折等细粒度表达
-
长文本中保持节奏、清晰度和音色一致性
-
Qwen-Audio-3.0-TTS-Plus:https://www.qianwenai.com/models/qwen-audio-3.0-tts-plus
- Qwen-Audio-3.0-TTS-Flash:https://www.qianwenai.com/models/qwen-audio-3.0-tts-flash