6月10日,手机智能体领域迎来了一次硬核的“大考”——AgentCLUE-Mobile手机GUI Agent基准测评成绩正式出炉。结果出来后,最引人注目的是中兴的gui手机智能体,直接拿下了断层第一,领先幅度相当惊人,第二名被远远甩在了后面。

这次测评的核心非常明确:就是看这些智能体能不能在实际的手机APP里帮用户自动完成操作——比如点外卖、订车票、查信息之类的典型任务。说白了,就是考验AI在真实手机环境下的“动手能力”。

手机AI天花板 中兴gui手机智能体全方位断层第一

具体成绩上,中兴的产品拿到了91.29分,而排在第二位的智谱AI旗下Open-AutoGLM只得到了73.11分——差距超过了18分。这在同类技术评测里,优势是断崖式的。

背后支撑中兴这次成绩的,是它自研的Nebula-Pilot V1.0 27B模型,并且采用的是API调用的运行方式。有意思的是,这次测评中,前几名全都是API调用方案,整体得分明显高于本地部署的模型。从数据上看,本地部署方案中,得分最高的是阿里的MAI-UI,拿到了65.91分;而字节的UI-TARS成绩更惨,只有30.19分。这个细节非常耐人寻味——API调用的灵活性和资源利用效率,在手机场景下确实占了明显优势。

手机AI天花板 中兴gui手机智能体全方位断层第一

从机构排名来看,中兴通讯稳居榜首,智谱AI和阿里巴巴紧随其后,分别拿下了二、三名。阶跃星辰和字节跳动的产品则排在更靠后的位置。不同方案之间的差距,归根结底还是模型能力和调用方式的差异导致的。中兴的大模型在界面理解、控件识别、连续操作这些关键环节上都表现得更加稳定扎实。

现在,大家对手机智能体的期待其实越来越高——谁都希望它能自动跑腿、帮忙处理那些重复性的操作,让自己省点力气。这次的测评结果说明,中兴在手机端智能交互的技术储备上是实打实的,无论是模型能力还是整体方案都显得相当成熟。

从不同调用方案的对比来看

API调用方案的整体表现明显优于本地部署的模型。中兴采用的API方案稳定性和灵活性都更强,这也是它能取得高分的核心原因之一。

手机AI天花板 中兴gui手机智能体全方位断层第一

手机AI天花板 中兴gui手机智能体全方位断层第一

手机AI天花板 中兴gui手机智能体全方位断层第一

手机AI天花板 中兴gui手机智能体全方位断层第一

可以预期的是,接下来这类手机智能体的产品会越来越多。大家手里的手机,使用体验也会变得更省心、更聪明。

本文转载于:https://m.mydrivers.com/newsview/1128621.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。