Qwen-Audio-3.0-TTS 发布,强化实时语音、多语种方言、指令控声与复杂环境音色复刻。
原文标题:从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布
原文作者:阿里云开发者
冷月清谈:
怜星夜思:
2、多方言 TTS 真能解决本地化问题吗,还是只是在“学口音”?
3、用自然语言控制情绪和角色,会不会比传统标签控制更适合普通开发者?
4、参考音频很嘈杂也能复刻音色,这种能力在实际应用里该怎么划安全边界?
原文内容
Qwen-Audio-3.0-TTS 实时语音合成模型发布。本次发布包含两个版本:
-
Flash:面向实时交互,首包延迟在 300ms 左右。
-
Plus:面向高质量生成,在自然度和音色还原度上表现更佳。
核心亮点一:多语种与方言全面升级
无论是出海业务还是下沉市场,Qwen-Audio-3.0-TTS都能提供完美融入当地语境的听觉体验。
多语种精准合成,指标全面领先
Qwen-Audio-3.0-TTS 面向全球多语种场景进行了专项优化,覆盖中文、英文、日语、韩语、德语等 16 种语言。
WER/CER(越低越好)
Qwen-Audio-3.0-TTS 系列展现了最强的整体多语言可懂度,在 16 种语言中有 10 种取得了最佳的 WER/CER 表现。Flash 版本的平均 WER/CER 最低,仅为 3.87;Plus 版本也极具竞争力,得分为 3.96。两者在平均表现上均优于其他系统。
评测基于CV3-Eval的multilingual benchmark
中文方言正宗度显著提升
通过更高质量的方言数据、更丰富的种类覆盖,以及专门的方言强化训练阶段,Qwen-Audio-3.0-TTS 模型有效缓解了通用语音强化学习中容易出现的“方言特色弱化”问题。
目前模型支持 20 种高质量方言(覆盖广东、重庆、东北、甘肃、贵州、浙江、河北、河南、湖北、湖南、江西、宁波、宁夏、青岛、陕西、山西、山东、上海、四川、云南),使合成语音在韵律、声调和口语化表达上更接近母语者,还原各地语言的真实韵味。
核心亮点二:
Free-style 自由指令,
用自然语言“导演”声音
不同场景对语音风格的需求差异很大——客服需要温和耐心,直播需要热情感染,有声书需要角色代入。
Qwen-Audio-3.0-TTS 支持 Free-style 自然语言指令控制。无需掌握专业声学或标注知识,即可通过自然语言灵活定义情绪、角色、场景、语速等维度,让合成结果与预期高度一致。
核心亮点三:
细粒度标签控制,精确到呼吸和情绪
[gasp]、[giggles]、[angry]),直接对语气、情绪和 breath 类细节进行精准调控。
这种方式特别适合需要精确控制非语言细节的叙事、游戏、影视配音等场景,标签与语音自然融合,可灵活组合构建复杂情感表达。
核心亮点四:
复杂声学鲁棒性,无惧嘈杂环境的音色复刻
真实业务中,参考音频往往来自复杂环境。Qwen-Audio-3.0-TTS 对此做了专项优化,通过针对性的真实声学仿真训练,将语音增强能力原生注入复刻流程。
模型能够在嘈杂环境中自动“过滤干扰、保留音色”,复杂场景下的复刻清晰度和感知质量显著提升。即使参考条件不佳,合成语音依然保持高质量。
-
高混响场景:有效抑制混响干扰,合成更干净清晰。
-
高噪声场景:抗噪能力更强,语音质量显著优于前代。
Also in this release:精品音色库
Qwen-Audio-3.0-TTS 配套的精品音色库,将模型在多语种、多方言、指令控制和细粒度表达上的能力沉淀为开箱即用的音色资源。音色库覆盖指令风格音色、
面向严肃创作场景,我们将音频输出品质从 24kHz 跃升至 48K。同时,单次语音合成支持长达 3 分钟,轻松满足长文本播报需求。
(注:部分方言、小语种精品音色及 48K 高清音频输出功能目前在阿里云百炼平台正陆续上线中,其中 48K 功能预计于 7月24日 正式开放,具体请以控制台实际展示为准。)
核心亮点
-
可直接用自然语言描述角色、情绪、场景和语气,合成结果会随指令变化。
-
支持上下文驱动的语气选择,同一句文本在不同场景下可以读出不同情绪。
-
支持耳语、笑场、情绪转折等细粒度表达,声音更接近真实说话。
-
长文本中能保持节奏、清晰度和音色一致性。
-
角色化表达覆盖电台主持、心理咨询、科幻 AI 等场景。
Qwen-Audio-3.0-TTS 现已全面开放。
从“能说话”到“会表达”,技术的边界正在被不断拓宽。我们诚邀广大开发者接入体验,共同探索语音合成的更多可能性。如果您在应用落地中有任何反馈或建议,欢迎通过技术交流群与我们探讨。
参考链接:





