您的位置:首页 >位列 Artificial Analysis 榜首 阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS
发布于2026-08-01 阅读(0)
扫一扫,手机访问
语音合成领域又迎来一位重量级选手。阿里千问正式发布了全新的大模型——Qwen-Audio-3.0-TTS,一口气推出了两个版本:一个是面向实时交互场景的Flash版本,首包延时控制在300ms级别;另一个则是追求高质量生成的Plus版本。
官方透露,这次的新模型在几个关键维度上实现了系统性突破:细粒度标签控制、自由风格指令遵循、多语种与方言覆盖,以及复杂声学环境下的鲁棒性。用一句话总结,就是让AI说话从“能发声”真正进化到了“会表达”。在全球第三方权威榜单Artificial Analysis上,Qwen-Audio-3.0-TTS-Plus直接拿下了冠军。

具体到功能层面,Qwen-Audio-3.0-TTS支持在文本中嵌入结构化标签。用户可以在文本里直接写[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)这样的标记,从而对语气、情绪甚至呼吸细节进行精准调控。
除此之外,Qwen-Audio-3.0-TTS还配套了一个开箱即用的精品音色库。这个音色库把模型在多语种、多方言、指令控制和细粒度表达上的能力,沉淀成了可直接调用的音色资源。后续会陆续上架指令风格音色、20种方言音色、细粒度控制音色,以及14种以上的小语种音色。音频输出方面,也从24KHz直接提升到了48KHz——这相当于从电话和普通语音助手的音质,跃升到了录音棚、影视配音的规格。单次语音合成时长可达3分钟。
针对全球多语种场景,Plus版本做了专项优化,覆盖了中、英、日、韩、德等16种语言,并且新增了阿拉伯语、越南语、马来语、菲律宾语。方言方面,支持广东、重庆、东北、陕西、上海、四川、云南等20种方言。

售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9