展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > AI大模型周榜:kimi-k3登顶前端开发榜

AI大模型周榜:kimi-k3登顶前端开发榜

IT之家 7 月 27 日消息,Arena 平台刚刚发布了 2026 年第 30 周的 AI 大模型排行数据,统计周期为 7 月 20 日至 7 月 26 日。来看看这一周有哪些值得关注的变化。 本周国产模型表现相当亮眼。月之暗面旗下的 kimi-k3 蝉联前端开发榜全球第一,同时在代码榜杀入 To

IT之家 7 月 27 日消息,Arena 平台刚刚发布了 2026 年第 30 周的 AI 大模型排行数据,统计周期为 7 月 20 日至 7 月 26 日。来看看这一周有哪些值得关注的变化。

AI大模型周榜:kimi-k3登顶前端开发榜

本周国产模型表现相当亮眼。月之暗面旗下的 kimi-k3 蝉联前端开发榜全球第一,同时在代码榜杀入 Top 10,算是本期最大亮点。整体来看,Anthropic 旗下多款 Claude 新模型集中入榜,头部梯队集中在 1500 分区间,竞争非常胶着。国产模型在多个细分赛道持续突破,不少模型进入对应榜单的头部序列,整体竞争力稳步提升。

综合榜

综合榜头部格局保持稳定。claude-fable-5 以 1508 分继续蝉联榜首,Anthropic 旗下多款 Claude 系列模型占据前 6 名位置,其中 claude-opus-4-6-thinking、claude-opus-4-7-thinking 等多款新模型完成入榜。前 7 名模型的 ELO 分差均在 30 分以内,在误差范围内视为并列竞争状态。Meta 的 muse-spark-1.1 和 muse-spark 分别位列第 7 和第 8,谷歌的 gemini-3.1-pro-preview 上升 2 位来到第 9,前 10 名整体竞争十分胶着。

国产模型在综合榜中整体处于中上游位置,梯队相对完整:月之暗面 kimi-k3 位列第 11 名,ELO 1485 分,较上周下降 2 位,是当前排名最高的国产模型;阿里 qwen3.7-max-preview 位列第 20 名,ELO 1475 分,较上周下降 2 位;智谱 glm-5.1 此前排名第 27,本周位列第 31 名;智谱 glm-5.2 (max) 此前排名第 30,本周排名不变。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入/输出上下文
1claude-fable-5Anthropic1508 ±615817$10 / $501M
2claude-opus-4-6-thinkingAnthropic1505 ±464435$5 / $251M
3claude-opus-4-7-thinkingAnthropic1502 ±451943$5 / $251M
4claude-opus-4-6Anthropic1498 ±668145$5 / $251M
5claude-opus-5-highAnthropic1495 ±85417$5 / $251M
6claude-opus-4-7Anthropic1493 ±453093$5 / $251M
7muse-spark-1.1Meta1493 ±79573$1.25 / $4.25N/A
8muse-sparkMeta1488 ±613497N/AN/A
9 ↑2gemini-3.1-pro-preview谷歌1486 ±386298$2 / $121.05M
10 ↓2gemini-3-pro谷歌1486 ±441242$2 / $121.05M

— 以下为 Top 10 外的国产模型 —

排名模型厂商分数 (±CI)票数价格 ($/M) 输入/输出上下文
11 ↓2kimi-k3 预发布月之暗面1485 ±103569$3 / $151.05M
20 ↓2qwen3.7-max-preview阿里1475 ±103698$1.48 / $4.431M
30glm-5.2 (max)智谱1469 ±619623$1.40 / $4.401M
31 ↓4glm-5.1智谱1469 ±532221$1.40 / $4.40202.8K

代码榜

代码榜头部依然由 Anthropic 旗下模型主导。claude-opus-4-7-thinking 以 1553 分守住榜首位置,前 5 名全部为 Anthropic Claude 系列模型,分差均在 5 分以内,竞争十分接近。本期最大亮点是国产模型 kimi-k3 排名上升 2 位来到第 8 名,以 1530 分跻身代码榜 Top 10,与周边头部模型的分差也在 30 分的统计误差范围内,完全具备第一梯队的竞争力。

国产模型在代码榜中分布广泛,多个模型进入中上游序列,表现稳定:月之暗面 kimi-k3 排名第 8 名,ELO 1530 分,较上周上升 2 位,是排名最高的国产代码模型;阿里 qwen3.7-max-preview 排名第 15 名,ELO 1525 分,较上周下降 3 位;智谱 glm-5.1 排名第 21 名,ELO 1520 分,较上周下降 4 位;小米 mimo-v2.5-pro 排名第 24 名,ELO 1519 分,与上周排名相同;月之暗面 kimi-k2.6 排名第 28 名,ELO 1515 分,较上周下降 2 位;百度 ernie-5.1 此前排名第 27,本周来到第 31 位。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入/输出上下文
1claude-opus-4-7-thinkingAnthropic1553 ±714800$5 / $251M
2claude-fable-5Anthropic1551 ±104278$10 / $501M
3 ↑2claude-opus-4-6-thinkingAnthropic1550 ±616646$5 / $251M
4 ↑1claude-opus-4-7Anthropic1549 ±615069$5 / $251M
5 ↓1claude-opus-4-6Anthropic1548 ±618952$5 / $251M
6claude-opus-5-highAnthropic1540 ±171405$5 / $251M
7 ↓1claude-opus-4-8-thinkingAnthropic1535 ±89039$5 / $251M
8 ↑2kimi-k3 预发布月之暗面1530 ±20948$3 / $151.05M
9 ↓1muse-spark-1.1Meta1530 ±122860$1.25 / $4.25N/A
10 ↑1claude-opus-4-5-20251101-thinking-32kAnthropic1530 ±77606$5 / $25200K

— 以下为 Top 10 外的国产模型 —

排名模型厂商分数 (±CI)票数价格 ($/M) 输入/输出上下文
15 ↓3qwen3.7-max-preview阿里1525 ±181113$1.48 / $4.431M
21 ↓4glm-5.1智谱1520 ±79070$1.4 / $4.4202.8K
24mimo-v2.5-pro小米1519 ±711974$0.44 / $0.871.05M
28 ↓2kimi-k2.6月之暗面1515 ±710342$0.95 / $4262.1K
31 ↓4ernie-5.1百度1514±710243

前端开发榜

前端开发榜迎来历史性突破。国产模型 kimi-k3 以 1682 分卫冕榜首位置(上周 1679 分),超过了此前排名第一的 claude-opus-5-high,成为全球当前前端开发能力最强的大模型。Anthropic 的 claude-opus-5-high 以 1673 分紧随其后位列第 2,claude-fable-5 落到第 3 名,OpenAI 的 gpt-5.6-sol-xhigh 排在第 4 名。前 4 名之外的模型分数差距开始拉开,智谱的 glm-5.2 (max) 也进入了第 5 名,继续扩大国产模型在前端开发赛道的优势。

国产模型在前端开发榜中形成了庞大的梯队,近半数席位被国产模型占据,整体表现亮眼:月之暗面 kimi-k3 登顶榜首,ELO 1682 分,与上周排名相同,是本期榜单最大亮点;智谱 glm-5.2 (max) 排在第 5 名,ELO 1587 分,较上周下降 1 位;字节跳动 seed-2.1-pro-preview 排在第 15 名,ELO 1529 分,较上周下降 1 位;智谱 glm-5.1 排在第 18 名,ELO 1518 分,较上周下降 3 位;腾讯 hy3 排在第 19 名,ELO 1518 分;阿里 qwen3.7-max-20260517 排在第 20 名,ELO 1517 分;月之暗面 kimi-k2.6 排在第 21 名,ELO 1510 分,较上周下降 3 位;Minimax minimax-m3 排在第 24 名,ELO 1493 分;阿里 qwen3.6-max-preview 排在第 28 名,ELO 1478 分;小米 mimo-v2.5-pro 排在第 29 名,ELO 1474 分;月之暗面 kimi-k2.7-code 排在第 30 名,ELO 1473 分。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入/输出上下文
1kimi-k3 预发布月之暗面1682 ±133776$3 / $151.05M
2claude-opus-5-highAnthropic1673 ±142392$5 / $251M
3 ↓1claude-fable-5Anthropic1629 ±105721$10 / $501M
4 ↓1gpt-5.6-sol-xhigh (codex-harness)OpenAI1625 ±105242$5 / $301.05M
5 ↓1glm-5.2 (max)智谱1587 ±95700$1.4 / $4.41M
6 ↑1claude-opus-4-8-thinkingAnthropic1568 ±88247$5 / $251M
7 ↑1claude-opus-4-7Anthropic1559 ±711050$5 / $251M
8 ↑1claude-opus-4-7-thinkingAnthropic1557 ±711661$5 / $251M
9 ↓3grok-4.5SpaceXAI1549 ±113314$2 / $6500K
10 ↑1claude-opus-4-6-thinkingAnthropic1546 ±613607$5 / $251M

— 以下为 Top 10 外的国产模型 —

排名模型厂商分数 (±CI)票数价格 ($/M) 输入/输出上下文
15 ↓1seed-2.1-pro-preview 预发布字节跳动1529 ±104916N/AN/A
18 ↓3glm-5.1智谱1518 ±86737$1.4 / $4.4202.8K
19hy3腾讯1518 ±171490$0.13 / $0.53262.1K
20qwen3.7-max-20260517阿里1517 ±87267$1.48 / $4.431M
21 ↓3kimi-k2.6月之暗面1510 ±89263$0.95 / $4262.1K

智能体榜

智能体榜头部由 Claude Fable 5 (High) 以 12.72% 的净提升度守住榜首,该模型的可控性也达到了 14.62%,位列全榜第一。OpenAI 的 GPT 5.6 Sol (xHigh) 以 10.12% 的净提升度紧随其后排在第 2,Anthropic 的 Claude Opus 4.8 (Thinking) 排在第 3 名。国产模型 kimi-k3 排名第 4,净提升度 9.71%,其任务确认成功率达到了 14.0%,是榜单所有头部模型中最高的表现,任务完成反馈表现突出。

国产模型在智能体榜中覆盖了从头部到中下游的大量席位,梯队十分完整:月之暗面 kimi-k3 排名第 4 名,净提升度 9.71%,任务确认成功率 14.0%,是排名最高的国产智能体模型;智谱 GLM 5.2 (Max) 排名第 10 名,净提升度 6.5%,任务确认成功率 8.65%;智谱 GLM 5.1 排名第 17 名,净提升度 1.43%;阿里 Qwen3.7 Max 排名第 19 名,净提升度 0.09%;阿里 Qwen3.7 Plus 排名第 21 名,净提升度 0.76%,工具幻觉率仅 0.3% 为全榜最低;月之暗面 Kimi K2.7 Code 排名第 22 名,净提升度 1.02%;深度求索 DeepSeek V4 Pro 排名第 24 名,净提升度 1.19%;腾讯 Hy3 排名第 25 名,净提升度 2.23%;月之暗面 Kimi K2.6 排名第 26 名,净提升度 2.57%;Minimax Minimax M3 排名第 27 名,净提升度 3.1%;小米 Mimo V2.5 Pro 排名第 28 名,净提升度 3.39%。

排名模型厂商净提升度 (±CI)任务确认成功率好评/差评比可控性会话数
1Claude Fable 5 (High)Anthropic12.72% ±2.0%10.67%23.94%14.62%23549
2GPT 5.6 Sol (xHigh)OpenAI10.12% ±1.69%7.25%23.53%9.71%15991
3Claude Opus 4.8 (Thinking)Anthropic9.75% ±1.39%8.9%19.42%9.78%34147
4Kimi K3月之暗面9.71% ±1.52%14.0%20.3%6.52%11490
5Claude Sonnet 5 (High)Anthropic8.66% ±1.89%8.14%16.88%6.2%24359
6 ↓2GPT 5.5 (xHigh)OpenAI8.41% ±0.87%6.65%11.08%8.18%40667
7 ↑1Claude Opus 4.7 (Thinking)Anthropic7.94% ±1.24%5.67%11.55%8.62%35151
8 ↑1Claude Opus 4.7Anthropic7.67% ±1.25%4.97%12.48%8.95%35672
9 ↓1GPT 5.5 (High)OpenAI7.61% ±0.81%6.2%9.8%8.77%65859
10 ↑1GLM 5.2 (Max)智谱6.5% ±1.0%8.65%12.94%4.71%38221

— 以下为 Top 10 外的国产模型 —

排名模型厂商净提升度 (±CI)任务确认成功率好评/差评比可控性会话数
17GLM 5.1智谱1.43% ±0.78%1.12%0.99%0.15%57532
19Qwen3.7 Max阿里0.09% ±1.07%1.84%5.73%0.02%15992

AI 生图 & AI 视频榜

AI 生图榜头部格局稳定,OpenAI 的 gpt-image-2 (medium) 以 1385 分继续稳居第一,字节跳动 seedream-5.0-pro 作为排名最高的国产模型,排在第 11 名,ELO 1231 分,整体表现处于中上游位置。

AI 视频榜方面,谷歌 gemini-omni-flash 守住榜首,字节跳动 dreamina-seedance-2.0-720p 排在第 2 名,阿里 happyhorse-1.0 排在第 4 名,国产视频模型直接占据了前 4 名中的两个席位,后续字节跳动、阿里、MiniMax 的多款模型也分布在榜单中下游,形成了完整的国产视频模型梯队,竞争力处于全球第一梯队。

整体来看,本周 Arena 榜单最大的突破来自国产模型在前端开发赛道登顶,kimi-k3 同时在代码榜和智能体榜进入头部序列,体现出国产模型在工程开发、智能体实际应用场景的快速进步。Anthropic 大量新模型集中入榜后,头部竞争的胶着程度进一步提升,后续几周的分数和排名变化值得持续关注。下周随着更多国产新模型完成数据积累更新,有望在更多细分榜单中看到新的突破。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。