今天,小米正式放出了 MiMo-V2.5-ASR —— 这是他们语音模型的听觉基座,主打全链路能力。从官方公布的信息来看,这款模型在方言、中英混说、强噪声、多人对话这些真实场景里,都宣称达到了业界领先水平。

具体来说,能处理的能力覆盖了这么几块:

目前这个模型已经开放了 API,可以在 Token Plan 里直接调用。定价方面,按音频转写时长计费:国内是 0.5 元/小时,海外 0.074 美元/小时。坦白讲,这个价格放在当前市场里,性价比相当有竞争力。

附上官方接入文档,有需要的可以直接参考:https://mimo.mi.com/docs/zh-CN/quick-start/usage-guide/audio/Speech-Recognition

本文转载于:https://www.itren.com/digital/187554.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。