位列 Artificial Analysis 榜首 阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS
阿里千问近日发布语音合成大模型,包含闪速版与增强版两大版本。增强版在人工智能分析榜单夺冠,支持细粒度标签控制、十六种语言、二十种方言,音频采样率提升至四十八千赫兹,单次合成最长三分钟。
语音合成领域又迎来一位重量级选手。阿里千问正式发布了全新的大模型——Qwen-Audio-3.0-TTS,一口气推出了两个版本:一个是面向实时交互场景的Flash版本,首包延时控制在300ms级别;另一个则是追求高质量生成的Plus版本。
官方透露,这次的新模型在几个关键维度上实现了系统性突破:细粒度标签控制、自由风格指令遵循、多语种与方言覆盖,以及复杂声学环境下的鲁棒性。用一句话总结,就是让AI说话从“能发声”真正进化到了“会表达”。在全球第三方权威榜单Artificial Analysis上,Qwen-Audio-3.0-TTS-Plus直接拿下了冠军。

具体到功能层面,Qwen-Audio-3.0-TTS支持在文本中嵌入结构化标签。用户可以在文本里直接写[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)这样的标记,从而对语气、情绪甚至呼吸细节进行精准调控。
除此之外,Qwen-Audio-3.0-TTS还配套了一个开箱即用的精品音色库。这个音色库把模型在多语种、多方言、指令控制和细粒度表达上的能力,沉淀成了可直接调用的音色资源。后续会陆续上架指令风格音色、20种方言音色、细粒度控制音色,以及14种以上的小语种音色。音频输出方面,也从24KHz直接提升到了48KHz——这相当于从电话和普通语音助手的音质,跃升到了录音棚、影视配音的规格。单次语音合成时长可达3分钟。
针对全球多语种场景,Plus版本做了专项优化,覆盖了中、英、日、韩、德等16种语言,并且新增了阿拉伯语、越南语、马来语、菲律宾语。方言方面,支持广东、重庆、东北、陕西、上海、四川、云南等20种方言。

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















