商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > Qwen3-TTS 全家桶开源上线

Qwen3-TTS 全家桶开源上线

  发布于2026-08-22 阅读(0)

扫一扫,手机访问

聊聊通义实验室刚放出的Qwen3-TTS。这套全新的语音合成系统,在音色复刻、个性化定制和拟真语音生成这些方向上,都拿出了不少硬货。最值得一提的是,它支持用自然语言指令来精细调控语音——这意味着你不再需要面对一堆复杂的参数面板,直接说“我想要更活泼一点、语速快一些”就能生效,对开发者也好、普通用户也好,门槛都低了很多。

技术层面,核心引擎是自研的Qwen3-TTS-Tokenizer-12Hz多码本语音编码器,它做到了对原始语音的高保真压缩,同时保留住了语气、停顿、呼吸这些副语言细节,连录音环境里的微妙声学特征也不放过。更关键的是,它没有走流行的“LM+DiT”级联路线,而是用了轻量级的非DiT解码架构,效率更高,也更直接。在此基础上引入的Dual-Track双轨流式建模机制,实现了真正的低延迟生成——首个字符敲进去,首帧音频就已经出来了。

目前整个模型系列已经开源,参数规模有1.7B和0.6B两个版本。1.7B版本追求极致的控制力和生成效果,0.6B版本则在效率和质量之间找到了很好的平衡点。原生支持10种主流语言,还覆盖了多种地域性方言音色——从中文、英语到日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语、意大利语,全球化应用场景基本一网打尽。

值得注意的是,它的上下文感知能力也很强。模型能够根据文本语义和用户指令,动态调整语调、节奏和情绪表达。哪怕输入文本里有些错别字、标点不全、或者说口语化表达,模型依然能保持稳定的合成表现,鲁棒性做得很到位。

模型规格一览

1.7B 模型

0.6B 模型

核心优势

  • 高保真语音表征能力:自研编码器兼顾了声学压缩与高维语义建模,副语言线索和环境声学特征都被完整捕获。配合非DiT轻量解码,实时性和还原度都不妥协。
  • 端到端统一建模范式:采用离散多码本语言模型架构,直接建模语音全维度信息,彻底摆脱传统级联范式的性能瓶颈和误差累积问题,泛化性、生成速度和上限表现都有了质的提升。
  • 毫秒级流式响应:Dual-Track混合框架让单模型同时支持流式和非流式模式,首个字符输入即可输出首段音频,端到端延迟低至97ms——实时对话、虚拟助手这类强交互场景,用起来很顺手。
  • 语义驱动的智能调控:用自然语言描述就能控制音色、情感、语速、韵律。文本理解模块自动匹配语气起伏和情绪张力,最终呈现出来的效果,可以说是“所思即所闻”。

综合性能评测

在音色克隆、音色创造、可控语音生成等关键任务上,Qwen3-TTS的表现相当抢眼,多项指标刷新了开源和闭源模型的纪录:

  • 音色创造任务中,指令遵循准确率和语音表现力都超过了MiniMax-Voice-Design闭源方案,大幅领先其他开源竞品;
  • 音色控制方面,平均词错率只有2.34%,跨语言泛化能力出色。风格一致性控制得分达到了75.4分(InstructTTS-Eval)。超长文本合成场景下,连续生成10分钟语音,中英文词错率分别稳定在2.36%和2.81%;
  • 音色克隆任务,中英文语音稳定性全面优于MiniMax和SeedTTS。在10类语种评估中,平均词错率1.835%,说话人相似度0.789,双优成绩超越了MiniMax和ElevenLabs。跨语种音色迁移能力也不弱于CosyVoice3,达到了当前的SOTA水平。

Tokenizer 重构性能

在LibriSpeech test-clean数据集上的语音重建质量评估,也验证了编码器的实力:

  • 感知语音质量(PESQ)宽带得分3.21,窄带得分3.68;
  • 短时客观可懂度(STOI)达到0.96,UTMOS主观质量评分4.16;
  • 说话人相似度指标拿下0.95分——近乎无损地保留了原始说话人的身份特征,对比效果立竿见影。

总结一下,Qwen3-TTS在语音合成的核心环节都拿出了实打实的进步:编码更加高效,架构更加直接,控制更加灵活,表现也更加稳定。对于正在寻找高质量语音合成方案的团队来说,这套开源模型的推出,意味着又多了一个值得深度研究的选择。

本文转载于:https://www.php.cn/faq/2021800.html?uid=1246273 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注