Qwen-Audio-3.0-TTS 发布:主打低延迟、多语种方言与可控语音表达

Qwen-Audio-3.0-TTS 发布,强化实时语音、多语种方言、指令控声与复杂环境音色复刻。

原文标题:从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

原文作者:阿里云开发者

冷月清谈:

阿里云发布 Qwen-Audio-3.0-TTS 实时语音合成模型,包含 Flash 与 Plus 两个版本:Flash 面向实时交互,首包延迟约 300ms;Plus 更侧重自然度和音色还原。此次更新重点解决生产环境中的多语种覆盖、自然语言指令控制、细粒度标签控制,以及复杂参考音频下的音色复刻鲁棒性。模型支持 16 种语言,并在多语言可懂度和说话人相似度评测中表现突出;中文方言方面覆盖 20 种方言,强调韵律、声调和口语化表达的还原。新版本还支持用自然语言描述角色、情绪、场景和语速,也可通过标签控制呼吸、笑声、愤怒等细节,适合客服、有声书、游戏配音、影视叙事等场景。此外,配套音色库、48kHz 输出和最长 3 分钟单次合成能力也在陆续开放。

怜星夜思:

1、TTS 做到“会表达”以后,客服、有声书、短视频配音这些行业会先被改变吗?
2、多方言 TTS 真能解决本地化问题吗,还是只是在“学口音”?
3、用自然语言控制情绪和角色,会不会比传统标签控制更适合普通开发者?
4、参考音频很嘈杂也能复刻音色,这种能力在实际应用里该怎么划安全边界?

原文内容

Qwen-Audio-3.0-TTS 实时语音合成模型发布。本次发布包含两个版本:

  • Flash:面向实时交互,首包延迟在 300ms 左右。
  • Plus:面向高质量生成,在自然度和音色还原度上表现更佳。
本次更新,我们把精力放在了开发者在生产环境中真正会遇到的四个问题上:更广的语言覆盖更自然的指令控制更精细的标签控制,以及在参考音频不清晰时的鲁棒性

目前,在全球第三方权威榜单 Artificial Analysis 中,Qwen-Audio-3.0-TTS-Plus 斩获冠军

以下是具体的更新内容与数据表现。
能力总览
在展开细节之前,先快速看一下 Qwen-Audio-3.0-TTS 的核心能力矩阵:

核心亮点一:多语种与方言全面升级

无论是出海业务还是下沉市场,Qwen-Audio-3.0-TTS都能提供完美融入当地语境的听觉体验。

多语种精准合成,指标全面领先

Qwen-Audio-3.0-TTS 面向全球多语种场景进行了专项优化,覆盖中文、英文、日语、韩语、德语等 16 种语言

WER/CER(越低越好)

Qwen-Audio-3.0-TTS 系列展现了最强的整体多语言可懂度,在 16 种语言中有 10 种取得了最佳的 WER/CER 表现。Flash 版本的平均 WER/CER 最低,仅为 3.87;Plus 版本也极具竞争力,得分为 3.96。两者在平均表现上均优于其他系统。

评测基于CV3-Eval的multilingual benchmark

说话人相似度(越高越好)

Qwen-Audio-3.0-TTS 在说话人相似度上展现出了显著且稳定的优势。其中 Plus 版本在所有 16 种语言中均排名第一,平均 SS(Speaker Similarity)达到了 82.75;Flash 版本紧随其后,得分为 80.44。这表明它们在多种语言环境下,都具备极强且鲁棒的音色还原能力。

评测基于CV3-Eval的multilingual benchmark

中文方言正宗度显著提升

通过更高质量的方言数据、更丰富的种类覆盖,以及专门的方言强化训练阶段,Qwen-Audio-3.0-TTS 模型有效缓解了通用语音强化学习中容易出现的“方言特色弱化”问题。

目前模型支持 20 高质量方言(覆盖广东、重庆、东北、甘肃、贵州、浙江、河北、河南、湖北、湖南、江西、宁波、宁夏、青岛、陕西、山西、山东、上海、四川、云南),使合成语音在韵律、声调和口语化表达上更接近母语者,还原各地语言的真实韵味。

核心亮点二:

Free-style 自由指令,

用自然语言“导演”声音

不同场景对语音风格的需求差异很大——客服需要温和耐心,直播需要热情感染,有声书需要角色代入。

Qwen-Audio-3.0-TTS 支持 Free-style 自然语言指令控制。无需掌握专业声学或标注知识,即可通过自然语言灵活定义情绪、角色、场景、语速等维度,让合成结果与预期高度一致。

核心亮点三:

细粒度标签控制,精确到呼吸和情绪

除了自由文本指令,模型还支持在文本中直接嵌入结构化标签(如 [gasp][giggles][angry]),直接对语气、情绪和 breath 类细节进行精准调控。
这种方式特别适合需要精确控制非语言细节的叙事、游戏、影视配音等场景,标签与语音自然融合,可灵活组合构建复杂情感表达。

核心亮点四:

复杂声学鲁棒性,无惧嘈杂环境的音色复刻

真实业务中,参考音频往往来自复杂环境。Qwen-Audio-3.0-TTS 对此做了专项优化,通过针对性的真实声学仿真训练,将语音增强能力原生注入复刻流程。
模型能够在嘈杂环境中自动“过滤干扰、保留音色”,复杂场景下的复刻清晰度和感知质量显著提升。即使参考条件不佳,合成语音依然保持高质量。
  • 高混响场景有效抑制混响干扰,合成更干净清晰。

  • 高噪声场景抗噪能力更强,语音质量显著优于前代。

Also in this release:精品音色库

Qwen-Audio-3.0-TTS 配套的精品音色库,将模型在多语种多方言指令控制细粒度表达上的能力沉淀为开箱即用的音色资源。音色库覆盖指令风格音色、

20 种方言音色、细粒度控制音色以及 14+ 款小语种音色,帮助业务方快速上线不同场景的声音方案。

面向严肃创作场景,我们将音频输出品质从 24kHz 跃升至 48K同时,单次语音合成支持长达 3 分钟,轻松满足长文本播报需求。

(注:部分方言、小语种精品音色及 48K 高清音频输出功能目前在阿里云百炼平台正陆续上线中,其中 48K 功能预计于 7月24日 正式开放,具体请以控制台实际展示为准。)

核心亮点

  • 可直接用自然语言描述角色、情绪、场景和语气,合成结果会随指令变化。

  • 支持上下文驱动的语气选择,同一句文本在不同场景下可以读出不同情绪。

  • 支持耳语、笑场、情绪转折等细粒度表达,声音更接近真实说话。

  • 长文本中能保持节奏、清晰度和音色一致性。

  • 角色化表达覆盖电台主持、心理咨询、科幻 AI 等场景。

Qwen-Audio-3.0-TTS 现已全面开放。

从“能说话”到“会表达”,技术的边界正在被不断拓宽。我们诚邀广大开发者接入体验,共同探索语音合成的更多可能性。如果您在应用落地中有任何反馈或建议,欢迎通过技术交流群与我们探讨。

参考链接:

[1]Qwen-Audio-3.0-TTS-Plus

https://www.qianwenai.com/models/qwen-audio-3.0-tts-plus

[2]Qwen-Audio-3.0-TTS-Flash:

https://www.qianwenai.com/models/qwen-audio-3.0-tts-flash

千问AI平台-Agent而生,驱动AI生产力
扫描下方二维码,直达千问AI平台体验


点击阅读原文即可体验!

关于“嘈杂音频也能复刻音色的安全边界”,我觉得必须有授权机制。技术越强,越不能默认谁上传一段录音就能克隆谁的声音,不然诈骗和冒充的风险太高。

1 个赞

短视频配音应该会最先被卷爆吧。以前大家还在用那几个固定 AI 声音,一听就知道是模板。以后如果能直接说“来个东北味儿但别太夸张的吐槽风”,那剪辑号真的能一天换十个声线。

3 个赞

我觉得回答“TTS 会先改变哪些行业”这个问题,客服肯定是第一波。因为客服本来就需要稳定、低成本、可规模化,声音只要足够自然,再加上情绪别太机械,很多简单咨询就能自动化掉。

3 个赞

我老家方言只要 AI 一开口,我爸妈三秒就能听出是不是“外地人装本地人”。所以这个问题我建议别看榜单,看本地大爷大妈的表情,那个才是真 benchmark。

2 个赞