AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单
阿里巴巴近日发布新一代语音合成大模型 Qwen-Audio-3.0-TTS,支持细粒度情绪标签、16 种语言和 20 种方言,并能在嘈杂环境中进行语音克隆。其 Plus 版本在全球权威榜单 Artificial Analysis 上获得冠军,Flash 版本则实现 300 毫秒级首包延迟,兼顾实时交互与高品质生成。
2026 年 7 月 20 日,阿里巴巴发布了 Qwen-Audio-3.0-TTS,一款在语音合成技术上实现系统性升级的大模型。它不仅让机器“能说话”,更让机器“会表达”——通过细粒度控制、多语种与方言支持、抗噪语音克隆等能力,将合成语音的质量推向了新高度。目前,Qwen-Audio-3.0-TTS-Plus 在第三方权威榜单 Artificial Analysis 上夺冠,其预览版 Fun-Realtime-TTS 也曾在一个月前登顶该榜单。

细粒度控制:从整段情绪到单个字符
上一代版本已支持“自由风格模式”(Freestyle),用户可以在提示词中加入“资深客服”“足球解说员”等角色设定,整体控制情绪、场景和语速。新模型更进一步,引入了结构化标签——用户直接在文本中嵌入 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)这类标记,精度从整段情绪细化到“哪个字后面该倒吸一口气”。这对于叙事、游戏配音、有声内容等需要精确控制细节的场景尤其有用。

多语种与方言:覆盖 16 种语言、20 种方言
面向全球多语种场景,Qwen-Audio-3.0-TTS 进行了专项优化,支持中、英、日、韩、德等 16 种语言,新增了阿拉伯语、越南语、马来语和菲律宾语。根据 CV3-Eval 的基准测试:
- 在 16 种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS 家族在 10 种语言上取得最好成绩(SOTA),其中韩语和马来语的领先幅度最大。
- 在 16 种语言的“说话人相似度”评测中,Plus 版本包揽全部最优,Flash 版本则拿下了 15 项第二,其中马来语、西班牙语和阿拉伯语的领先优势最为明显。
针对方言场景,研究团队专门设计了强化训练,防止模型因数据混杂而滑向普通话腔。最终模型覆盖广东、重庆、东北、陕西、上海、四川、云南等 20 种方言,在韵律、声调和口语表达上接近母语者水平。

抗噪语音克隆与高品质输出
传统的语音克隆往往要求参考音频在安静环境下录制。Qwen-Audio-3.0-TTS 通过真实声学仿真训练,在克隆流程中嵌入了语音增强能力,即便在高噪声、高混响条件下也能过滤干扰、只保留目标音色。面向严肃创作场景(如影视配音、有声书),模型内置了开箱即用的精品音色库,并将输出音频采样率从 24kHz 提升到 48kHz——接近录音棚和影视配音的规格。单次语音合成最长可达 3 分钟。
开放调用
即日起,两款模型(实时交互的 Flash 版本,首包延迟约 300 毫秒;高质量生成的 Plus 版本)已在阿里云百炼平台开放调用。
关键要点
- 细粒度情感控制:通过
[gasp]等标记,将情绪控制精确到单个字符,适用于叙事、游戏配音等场景。 - 多语言覆盖:支持 16 种语言,Plus 版本在说话人相似度评测中全胜,Flash 版本紧随其后。
- 20 种方言:通过强化训练保留母语者口音,避免模型滑向普通话腔。
- 抗噪语音克隆:在嘈杂或混响环境中仍能准确提取音色,降低使用门槛。
- 高品质输出:输出 48kHz 音频,单次最长 3 分钟,适合专业创作。