Inworld AI 最近放了个大招——正式推出了全新的语音合成模型 Inworld TTS-1.5。按照官方说法,这玩意儿是目前业界延迟最低、音质最好的实时语音 AI 解决方案。听起来挺唬人,但看看具体数据,确实有点东西。

TTS-1.5 Max 版本的首字响应延迟(P90)被压缩到了 250 毫秒以内,而更轻量的 Mini 版本更是直接干到了 130 毫秒以下——相比上一代,提速整整 4 倍。更关键的是,Max 版本在保持这种超低延迟的同时,竟然能输出过去只有在高延迟场景下才能达到的音频保真度。它的推理速度已经逼近 Mini 版本,但人声表现却更有层次感和情绪张力。这才是真正的杀手锏。

升级之后的 TTS-1.5,在语音表现力上提升了 30%,词级错误率下降了 40%。那些让开发者头疼的幻听(hallucination)、断句卡顿、音色失真等问题,也得到了明显缓解。最终生成的语音高度拟人——情感表达自然细腻,语境理解精准稳定,听感上几乎分辨不出是机器在说话。

多语言能力也没落下,支持语种已经扩展到了 15 种。成本方面更是碾压级的优势:相比主流竞品,单位算力成本降低了超过 25 倍。具体来说,TTS-1.5 Mini 每分钟调用费用只要 0.005 美元,TTS-1.5 Max 也仅仅 0.01 美元/分钟。这个价格,基本等于白送了。

版本定位也很清晰:TTS-1.5 Max 覆盖绝大多数交互场景需求,而 TTS-1.5 Mini 则专门为那些对端到端延迟极度敏感的应用——比如实时对话、游戏 NPC 语音——做了深度优化。一句话总结:场景不同,各取所需。

本文转载于:https://www.php.cn/faq/2018160.html?uid=1246273 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。