发布于2026-08-22 阅读(0)
扫一扫,手机访问
聊聊通义实验室刚放出的Qwen3-TTS。这套全新的语音合成系统,在音色复刻、个性化定制和拟真语音生成这些方向上,都拿出了不少硬货。最值得一提的是,它支持用自然语言指令来精细调控语音——这意味着你不再需要面对一堆复杂的参数面板,直接说“我想要更活泼一点、语速快一些”就能生效,对开发者也好、普通用户也好,门槛都低了很多。
技术层面,核心引擎是自研的Qwen3-TTS-Tokenizer-12Hz多码本语音编码器,它做到了对原始语音的高保真压缩,同时保留住了语气、停顿、呼吸这些副语言细节,连录音环境里的微妙声学特征也不放过。更关键的是,它没有走流行的“LM+DiT”级联路线,而是用了轻量级的非DiT解码架构,效率更高,也更直接。在此基础上引入的Dual-Track双轨流式建模机制,实现了真正的低延迟生成——首个字符敲进去,首帧音频就已经出来了。
目前整个模型系列已经开源,参数规模有1.7B和0.6B两个版本。1.7B版本追求极致的控制力和生成效果,0.6B版本则在效率和质量之间找到了很好的平衡点。原生支持10种主流语言,还覆盖了多种地域性方言音色——从中文、英语到日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语、意大利语,全球化应用场景基本一网打尽。
值得注意的是,它的上下文感知能力也很强。模型能够根据文本语义和用户指令,动态调整语调、节奏和情绪表达。哪怕输入文本里有些错别字、标点不全、或者说口语化表达,模型依然能保持稳定的合成表现,鲁棒性做得很到位。
1.7B 模型

0.6B 模型


在音色克隆、音色创造、可控语音生成等关键任务上,Qwen3-TTS的表现相当抢眼,多项指标刷新了开源和闭源模型的纪录:


在LibriSpeech test-clean数据集上的语音重建质量评估,也验证了编码器的实力:

总结一下,Qwen3-TTS在语音合成的核心环节都拿出了实打实的进步:编码更加高效,架构更加直接,控制更加灵活,表现也更加稳定。对于正在寻找高质量语音合成方案的团队来说,这套开源模型的推出,意味着又多了一个值得深度研究的选择。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9