158 6721 8818

0574-27676908

新闻动态

新闻动态

AI 大模型周榜:Kimi K3 登顶前端开发榜

作者:宁波海曙光信电子科技有限公司 浏览: 发表时间:2026-07-21 15:58:31

AI 大模型周榜:国产 Kimi K3 首次杀入综合榜 Top 10,登顶前端开发榜

 来源:IT之家 

IT之家 7 月 20 日消息,Arena(arena.ai)平台发布了 2026-29 期大模型排行榜,统计周期为 2026 年 7 月 13 日 ~2026 年 7 月 19 日。

本周榜单迎来大规模新模型集中入榜,其中最受关注的是国产模型 kimi-k3 的突出表现:它不仅首次杀入综合榜 Top 10,更直接登顶前端开发榜榜首,在细分能力上实现了对多数海外头部模型的反超。

整体来看,多款国产模型在多个榜单的前列位置站稳脚跟,梯队完整度进一步提升。

综合榜

综合榜头部位置由 Claude、Meta、谷歌、OpenAI 等厂商的新模型主导,第一名依然由 claude-fable-5 占据,ELO 为 1507 分。Anthropic 旗下多款思考版本模型集中入驻 Top 5,彼此之间分差全部在 15 分以内,在误差范围内属于并列第一梯队。

本周最大的亮点是国产模型 kimi-k3 凭借 1486 分的 ELO 排名来到第 9 位,首次跻身综合榜 Top 10,和第 8 名的 gemini-3-pro、第 10 名的 gpt-5.6-sol-xhigh 分数完全一致,属于第一梯队的边缘位置。

国产模型在综合榜分布于中上游位置,梯队表现稳定:

  • 月之暗面 kimi-k3 排名第 9 位,ELO 1486 分,较上周上升 1 位,首次进入 Top 10;
  • 阿里 qwen3.7-max-preview 排名第 18 位,ELO 1475 分,排名持平;
  • 智谱 glm-5.1 排名第 27 位,ELO 1471 分,较上周下降 2 位;
  • 智谱 glm-5.2 (max) 排名第 30 位,ELO 1468 分,排名持平。

  • 代码榜

  • 代码榜榜首位置发生变动,claude-opus-4-7-thinking 从第 2 位升至第 1 位,ELO 分数为 1553 分,把此前排名第一的 claude-fable-5 挤到第 2 位,后者分数降至 1551 分。两者仅有 2 分的差距,完全在置信区间范围内,属于并列第一梯队。Anthropic 的多款思考模型几乎包揽了榜单前 7 的所有位置,整体统治力依然强劲。
  • 而国产模型 kimi-k3 首次进入代码榜 Top 10,排名第 10 位,ELO 1529 分,和第 9 名的模型分数仅差 1 分,表现相当接近第一梯队。
  • 国产模型在代码榜覆盖多段位梯队,表现均衡:
  • 月之暗面 kimi-k3 排名第 10 位,ELO 1529 分,首次进入代码榜 Top 10;
  • 阿里 qwen3.7-max-preview 排名第 12 位,ELO 1527 分;
  • 智谱 glm-5.1 排名第 17 位,ELO 1521 分,较上周上升 1 位;
  • 小米 mimo-v2.5-pro 排名第 24 位,ELO 1518 分,较上周下降 1 位;
  • 月之暗面 kimi-k2.6 排名第 26 位,ELO 1515 分,较上周下降 1 位;
  • 百度 ernie-5.1 排名第 27 位,ELO 1514 分,较上周下降 1 位;

前端开发榜

前端开发榜呈现出前所未有的格局,国产模型 kimi-k3 直接以 1679 分的高 ELO 稳居第一名,大幅领先第二名 claude-fable-5 的 1631 分,分差达到 48 分,优势十分明显。

第四名同样由国产模型 glm-5.2 (max) 拿下,ELO 1587 分,超过了多款 Claude、OpenAI 的旗舰模型。这意味着国产大模型在前端开发这一细分场景的能力已经走在了全球最前列。

国产模型在前端开发榜占据头部和中上游多个位置,覆盖完整梯队:

  • 月之暗面 kimi-k3 排名第 1 位,ELO 1679 分,排名稳居第一;
  • 智谱 glm-5.2 (max) 排名第 4 位,ELO 1587 分,排名保持在前五;
  • 字节跳动 seed-2.1-pro-preview 排名第 14 位,ELO 1534 分,首次入驻榜单前半区;
  • 智谱 glm-5.1 排名第 15 位,ELO 1526 分,表现稳定;
  • 阿里 qwen3.7-max-20260517 排名第 17 位,ELO 1516 分;
  • 月之暗面 kimi-k2.6 排名第 18 位,ELO 1515 分;

智能体榜

智能体榜本周全部是全新入榜模型,排名第一的是 Claude Fable 5 (High),净提升度 13.94%,同时拥有 30.65% 的最高好评 / 差评比,工具幻觉率仅 1.33% 属于较低水平。第二名 GPT 5.6 Sol (xHigh) 的可控性数值最高,达到 17.26%。头部三款模型的净提升度差距都明显大于各自的置信区间,属于表现分层的清晰格局。

国产模型 GLM 5.2 (Max) 杀入榜单 Top 10 位列第 9,净提升度为 6.24%,它的 Bash 恢复速度仅 4.45,远好于头部平均水平,命令出错后能快速恢复,表现突出。

国产模型在智能体榜覆盖靠前和中间多个位置,工具相关能力表现亮眼:

  • 智谱 glm-5.2 (max) 排名第 9 位,净提升度 6.24%,任务确认成功率 8.72%;
  • 智谱 glm-5.1 排名第 16 位,净提升度 1.19%;
  • 阿里 qwen3.7 Plus 排名第 18 位,净提升度 0.61%,工具幻觉率仅 0.19%;
  • 月之暗面 kimi-k2.7-code 排名第 20 位,净提升度 0.76%;
  • 阿里 qwen3.7 Max 排名第 21 位,净提升度 0.81%;
  • 深度求索 deepseek-v4-pro 排名第 22 位,净提升度 1.11%;

AI 生图 & AI 视频榜

AI 生图榜本周整体格局稳定,OpenAI 的 gpt-image-2 (medium) 依然以 1385 分的 ELO 稳居第一,字节跳动 seedream-5.0-pro 作为最高排名的国产模型位列第 11 位,ELO 1231 分,紧随多款海外头部生图模型之后。

而在 AI 视频榜,谷歌 gemini-omni-flash 位列榜首;字节跳动的 dreamina-seedance-2.0-720p 稳居第二名,ELO 分数 1482 分,表现远超多数海外视频生成模型;同时阿里 happyhorse-1.0 也拿下第 4 位,国产力量在 AI 视频生成第一梯队已经占据了重要席位

本周 Arena 榜单的最大亮点就是国产模型的多点突破,尤其是 kimi-k3 首次冲进综合榜 Top 10,并且直接登顶前端开发榜,证明国产大模型不仅在通用能力上追平第一梯队,在特定工程类任务场景已经形成了领先优势。同时字节、阿里、智谱等厂商的多款模型也在代码、生图、视频、智能体多个榜单的前半区站稳脚跟。

下周预计将有更多用户评测数据进一步积累,部分新入榜模型的排名和分数还可能出现小幅变动,值得关注后续国产模型能否在更多细分榜单拿下榜首位置。



AI 大模型周榜:Kimi K3 登顶前端开发榜
Arena 平台发布 2026 第 29 期大模型榜单,统计周期 7 月 13 日 - 19 日。国产 Kimi K3 拿到综合榜第 9 名,首次闯进前十,同时登顶前端开发榜单。阿里、智谱多款国产模型稳定上榜,国内大模型整体梯队实力持续上涨。
长按图片保存/分享
0

相关新闻

产品中心

产品中心

快速导航

联系我们

手机:158 6721 8818(微信)

电话:0574-27676908

地址:海曙区东渡路29号8楼D01

版权所有© 2025 宁波海曙光信电子科技有限公司   浙ICP备14008261号 

版权所有© 2025 宁波海曙光信电子科技有限公司   浙ICP备14008261号 

客服中心
手机号
158 6721 8818(微信)
服务热线
0574-27676908
上班时间
周一到周五
E-mail地址
9090683@qq.com
添加微信好友,详细了解产品
使用企业微信
“扫一扫”加入群聊
复制成功!
添加微信好友,详细了解产品
我知道了