Qwen-Audio-3.0语音模型上线千问AI平台,覆盖ASR、TTS与实时语音交互

Qwen-Audio-3.0上线千问AI平台,覆盖语音识别、合成与实时对话。

冷月清谈:

阿里云开发者消息,Qwen-Audio-3.0系列语音模型已正式上线千问AI平台,开发者可通过API调用,也可订阅Token Plan使用。该系列包含三类模型:Qwen-Audio-3.0-ASR用于语音识别,支持复杂语境和专业领域内容;Qwen-Audio-3.0-TTS用于语音合成,支持多语种、多方言,并可控制情绪、语气和节奏;Qwen-Audio-3.0-Realtime面向实时语音对话,支持边听边说、打断追问和工具调用。文章提到,该系列模型曾在Artificial Analysis语音榜单中获得ASR、Realtime、TTS三个赛道第一。目前相关能力已应用于千问App、千问办公、Qoder等产品。千问AI平台近期也集中上线了文本、代码、图像、视频等多模态模型,试图为开发者提供统一的模型调用入口。

怜星夜思:

1、Qwen-Audio-3.0这种语音模型,最可能先在哪些真实业务里落地?
2、语音模型排行榜拿第一,能不能直接说明产品体验就一定最好?
3、实时语音交互支持“边听边说、随时打断”,会改变我们使用AI助手的方式吗?
4、多模态模型都集中到一个平台调用,对开发者是好事还是会增加平台绑定风险?

原文标题:Qwen-Audio-3.0系列语音模型正式上线千问AI平台

原文作者:阿里云开发者

原文内容

刚刚,Qwen-Audio-3.0系列语音模型正式上线千问AI平台。开发者可以通过API服务调用模型能力,也可以订阅Token Plan使用。

Qwen-Audio-3.0系列模型是阿里巴巴推出的自研语音模型,包括语音识别大模型Qwen-Audio-3.0-ASR、语音合成大模型Qwen-Audio-3.0-TTS、实时语音交互对话模型Qwen-Audio-3.0-Realtime。

在全球权威AI评测平台Artificial Analysis今年7月的语音排行榜上,该模型斩获语音识别(ASR)、实时交互(RealTime)和语音合成(TTS)三个赛道的全球第一,拿下“大满贯”。

其中,Qwen-Audio-3.0-ASR将语音转为文字,支持复杂语境和专业领域识别;Qwen-Audio-3.0-TTS将文字转为语音,支持多语种、多方言,可控制情绪、语气与节奏;Qwen-Audio-3.0-Realtime支持端到端语音理解与对话,可边听边说、随时打断追问,并支持工具调用。目前该系列模型已在千问App、千问办公、Qoder等产品中应用。

千问AI平台近期密集上线了多款主力模型,包括阿里巴巴新一代基座大模型Qwen3.8-Max、图像生成模型Qwen-image 3.0 pro、全新一代视频生成模型Wan3.0,以及Kimi K3等模型,从文本、代码到语音、图像和视频,开发者可以在一个平台调用不同模态的模型能力。

Token Plan订阅服务限时优惠:

个人版:

Lite 39元/月(每7天2500Credits),Standard 139元/月(4倍Lite用量),Pro 499元/月(16倍Lite用量)

团队版:

标准席位50元/席位/月(降至7.6折),高级席位550元/席位/月(降至7.9折),尊享席位1398元/席位/月

千问AI平台-Agent而生,驱动AI生产力
扫描下方二维码,直达千问AI平台体验

点击阅读原文即可体验!

回答“会不会改变AI助手使用方式”:会,而且变化可能挺大。现在很多人不爱用AI,是因为打字太麻烦。语音如果真能自然打断、追问、接工具,AI就更像一个随叫随到的同事,而不是搜索框。

3 个赞

回答“最可能先在哪些业务落地”:我觉得客服和会议纪要会最快。因为这俩场景对语音识别、实时对话、总结都有刚需,而且企业愿意为省人力买单。至于情感陪伴、虚拟主播这些,热闹归热闹,商业闭环可能没那么快。

1 个赞

这个问题挺有意思。以前AI助手更像“你问一句,它答一段”;实时语音之后可能变成“边聊边干活”。比如你开车时让它查路线、改行程、总结消息,这种场景键盘根本不方便。

3 个赞

平台绑定风险确实存在。尤其是你把语音、图像、视频、文本都接到同一家,后面价格调整、接口变更、限流策略都会影响业务。成熟项目最好做一层适配,别把业务逻辑写死在某个模型API上。

3 个赞

说个不那么高大上的:短视频配音、直播切片、播客转文字。这些创作者用起来门槛低,见效也快。只要声音自然、价格别太离谱,应该会有人买单。

3 个赞