发布于2026-08-23 阅读(0)
扫一扫,手机访问
Inworld AI 最近放了个大招——正式推出了全新的语音合成模型 Inworld TTS-1.5。按照官方说法,这玩意儿是目前业界延迟最低、音质最好的实时语音 AI 解决方案。听起来挺唬人,但看看具体数据,确实有点东西。
TTS-1.5 Max 版本的首字响应延迟(P90)被压缩到了 250 毫秒以内,而更轻量的 Mini 版本更是直接干到了 130 毫秒以下——相比上一代,提速整整 4 倍。更关键的是,Max 版本在保持这种超低延迟的同时,竟然能输出过去只有在高延迟场景下才能达到的音频保真度。它的推理速度已经逼近 Mini 版本,但人声表现却更有层次感和情绪张力。这才是真正的杀手锏。

升级之后的 TTS-1.5,在语音表现力上提升了 30%,词级错误率下降了 40%。那些让开发者头疼的幻听(hallucination)、断句卡顿、音色失真等问题,也得到了明显缓解。最终生成的语音高度拟人——情感表达自然细腻,语境理解精准稳定,听感上几乎分辨不出是机器在说话。
多语言能力也没落下,支持语种已经扩展到了 15 种。成本方面更是碾压级的优势:相比主流竞品,单位算力成本降低了超过 25 倍。具体来说,TTS-1.5 Mini 每分钟调用费用只要 0.005 美元,TTS-1.5 Max 也仅仅 0.01 美元/分钟。这个价格,基本等于白送了。

版本定位也很清晰:TTS-1.5 Max 覆盖绝大多数交互场景需求,而 TTS-1.5 Mini 则专门为那些对端到端延迟极度敏感的应用——比如实时对话、游戏 NPC 语音——做了深度优化。一句话总结:场景不同,各取所需。
下一篇:如何在微博发长文
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9