今天,小米正式放出了 MiMo-V2.5-ASR —— 这是他们语音模型的听觉基座,主打全链路能力。从官方公布的信息来看,这款模型在方言、中英混说、强噪声、多人对话这些真实场景里,都宣称达到了业界领先水平。
具体来说,能处理的能力覆盖了这么几块:
中文方言:粤语、吴语、闽南语、四川话等常见方言都能识别,不是摆设。
中英文混说:Code-Switch 场景下自由切换,不需要提前设置语种。
歌曲识别:中英文歌词都能抓,伴奏和人声混在一起也能高精度转写。
强噪声环境:高噪音、远场拾音这些硬骨头,模型保持了不错的鲁棒性。
多人说话:交叉对话场景下还能准确定位和转录,挺考验底层的。
知识关联:古诗词、专业术语、人名地名这类需要背景知识的内容,也能精准识别。
原生标点:基于韵律和语义直接输出标点,转写完就能直接用,省了后处理。
目前这个模型已经开放了 API,可以在 Token Plan 里直接调用。定价方面,按音频转写时长计费:国内是 0.5 元/小时,海外 0.074 美元/小时。坦白讲,这个价格放在当前市场里,性价比相当有竞争力。

附上官方接入文档,有需要的可以直接参考:https://mimo.mi.com/docs/zh-CN/quick-start/usage-guide/audio/Speech-Recognition