AI 大模型周榜:国产 Kimi K3 首次杀入综合榜 Top 10,登顶前端开发榜

AI 新资讯21小时前发布
982 0 0
熊猫办公

7 月 20 日消息,Arena(arena.ai)平台发布了 2026-29 期大模型排行榜,统计周期为 2026 年 7 月 13 日 ~2026 年 7 月 19 日。

本周榜单迎来大规模新模型集中入榜,其中最受关注的是国产模型 kimi-k3 的突出表现:它不仅首次杀入综合榜 Top 10,更直接登顶前端开发榜榜首,在细分能力上实现了对多数海外头部模型的反超。

整体来看,多款国产模型在多个榜单的前列位置站稳脚跟,梯队完整度进一步提升。

综合榜

综合榜头部位置由 Claude、Meta、谷歌、OpenAI 等厂商的新模型主导,第一名依然由 claude-fable-5 占据,ELO 为 1507 分。Anthropic 旗下多款思考版本模型集中入驻 Top 5,彼此之间分差全部在 15 分以内,在误差范围内属于并列第一梯队。

本周最大的亮点是国产模型 kimi-k3 凭借 1486 分的 ELO 排名来到第 9 位,首次跻身综合榜 Top 10,和第 8 名的 gemini-3-pro、第 10 名的 gpt-5.6-sol-xhigh 分数完全一致,属于第一梯队的边缘位置。

国产模型在综合榜分布于中上游位置,梯队表现稳定:

  • 月之暗面 kimi-k3 排名第 9 位,ELO 1486 分,较上周上升 1 位,首次进入 Top 10;

  • 阿里 qwen3.7-max-preview 排名第 18 位,ELO 1475 分,排名持平;

  • 智谱 glm-5.1 排名第 27 位,ELO 1471 分,较上周下降 2 位;

  • 智谱 glm-5.2 (max) 排名第 30 位,ELO 1468 分,排名持平。

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 — 🇺🇸 claude-fable-5 Anthropic 1507 ±7 8819 $10 / $50 1M
2 — 🇺🇸 claude-opus-4-6-thinking Anthropic 1504 ±4 61003 $5 / $25 1M
3 — 🇺🇸 claude-opus-4-7-thinking Anthropic 1503 ±4 48292 $5 / $25 1M
4 — 🇺🇸 claude-opus-4-6 Anthropic 1498 ±4 64747 $5 / $25 1M
5 — 🇺🇸 claude-opus-4-7 Anthropic 1494 ±4 49467 $5 / $25 1M
6 — 🇺🇸 muse-spark-1.1 Meta 1493 ±8 5729 $1.25 / $4.25 N/A
7 — 🇺🇸 muse-spark Meta 1487 ±6 13572 N/A N/A
8 ↑1 🇺🇸 gemini-3-pro 谷歌 1486 ±4 41290 $2 / $12 1.05M
9 ↑1 🇨🇳 kimi-k3 月之暗面 1486 ±11 3024 $3 / $15 1.05M
10 ↓2 🇺🇸 gpt-5.6-sol-xhigh OpenAI 1486 ±9 4095 N/A N/A
— 以下为 Top 10 外的国产模型 —
18 ↓1 🇨🇳 qwen3.7-max-preview 阿里 1475 ±10 3717 $1.48 / $4.43 1M
27 ↓2 🇨🇳 glm-5.1 智谱 1471 ±5 28606 $1.4 / $4.4 202.8K
30 — 🇨🇳 glm-5.2 (max) 智谱 1468 ±6 15642 $1.4 / $4.4 1M

代码榜

代码榜榜首位置发生变动,claude-opus-4-7-thinking 从第 2 位升至第 1 位,ELO 分数为 1553 分,把此前排名第一的 claude-fable-5 挤到第 2 位,后者分数降至 1551 分。两者仅有 2 分的差距,完全在置信区间范围内,属于并列第一梯队。Anthropic 的多款思考模型几乎包揽了榜单前 7 的所有位置,整体统治力依然强劲。

而国产模型 kimi-k3 首次进入代码榜 Top 10,排名第 10 位,ELO 1529 分,和第 9 名的模型分数仅差 1 分,表现相当接近第一梯队。

国产模型在代码榜覆盖多段位梯队,表现均衡:

  • 月之暗面 kimi-k3 排名第 10 位,ELO 1529 分,首次进入代码榜 Top 10;

  • 阿里 qwen3.7-max-preview 排名第 12 位,ELO 1527 分;

  • 智谱 glm-5.1 排名第 17 位,ELO 1521 分,较上周上升 1 位;

  • 小米 mimo-v2.5-pro 排名第 24 位,ELO 1518 分,较上周下降 1 位;

  • 月之暗面 kimi-k2.6 排名第 26 位,ELO 1515 分,较上周下降 1 位;

  • 百度 ernie-5.1 排名第 27 位,ELO 1514 分,较上周下降 1 位;

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 ↑1 🇺🇸 claude-opus-4-7-thinking Anthropic 1553 ±7 13772 $5 / $25 1M
2 ↓1 🇺🇸 claude-fable-5 Anthropic 1551 ±12 2459 $10 / $50 1M
3 — 🇺🇸 claude-opus-4-6-thinking Anthropic 1550 ±6 15751 $5 / $25 1M
4 ↑1 🇺🇸 claude-opus-4-6 Anthropic 1549 ±6 17906 $5 / $25 1M
5 ↓1 🇺🇸 claude-opus-4-7 Anthropic 1548 ±7 14088 $5 / $25 1M
6 — 🇺🇸 claude-opus-4-8-thinking Anthropic 1535 ±8 8002 $5 / $25 1M
7 — 🇺🇸 claude-opus-4-8 Anthropic 1533 ±8 8172 $5 / $25 1M
8 — 🇺🇸 muse-spark-1.1 Meta 1532 ±15 1718 $1.25 / $4.25 N/A
9 — 🇺🇸 claude-opus-4-5-20251101-thinking-32k Anthropic 1530 ±7 7614 $5 / $25 200K
10 🇨🇳 kimi-k3 月之暗面 1529 ±22 798 $3 / $15 1.05M
— 以下为 Top 10 外的国产模型 —
12 ↑1 🇨🇳 qwen3.7-max-preview 阿里 1527 ±18 1123 $1.48 / $4.43 1M
17 ↑1 🇨🇳 glm-5.1 智谱 1521 ±8 8056 $1.4 / $4.4 202.8K
24 ↓1 🇨🇳 mimo-v2.5-pro 小米 1518 ±7 10969 $0.44 / $0.87 1.05M
26 ↓1 🇨🇳 kimi-k2.6 月之暗面 1515 ±7 10359 $0.95 / $4 262.1K
27 ↓1 🇨🇳 ernie-5.1 百度 1514 ±7 10403 N/A N/A

前端开发榜

前端开发榜呈现出前所未有的格局,国产模型 kimi-k3 直接以 1679 分的高 ELO 稳居第一名,大幅领先第二名 claude-fable-5 的 1631 分,分差达到 48 分,优势十分明显。

第四名同样由国产模型 glm-5.2 (max) 拿下,ELO 1587 分,超过了多款 Claude、OpenAI 的旗舰模型。这意味着国产大模型在前端开发这一细分场景的能力已经走在了全球最前列。

国产模型在前端开发榜占据头部和中上游多个位置,覆盖完整梯队:

  • 月之暗面 kimi-k3 排名第 1 位,ELO 1679 分,排名稳居第一;

  • 智谱 glm-5.2 (max) 排名第 4 位,ELO 1587 分,排名保持在前五;

  • 字节跳动 seed-2.1-pro-preview 排名第 14 位,ELO 1534 分,首次入驻榜单前半区;

  • 智谱 glm-5.1 排名第 15 位,ELO 1526 分,表现稳定;

  • 阿里 qwen3.7-max-20260517 排名第 17 位,ELO 1516 分;

  • 月之暗面 kimi-k2.6 排名第 18 位,ELO 1515 分;

排名 模型 厂商 分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文
1 — 🇨🇳 kimi-k3 月之暗面 1679 ±17 1757 $3 / $15 1.05M
2 — 🇺🇸 claude-fable-5 Anthropic 1631 ±13 2505 $10 / $50 1M
3 — 🇺🇸 gpt-5.6-sol-xhigh (codex-harness) OpenAI 1618 ±13 2542 $5 / $30 1.05M
4 — 🇨🇳 glm-5.2 (max) 智谱 1587 ±10 4722 $1.4 / $4.4 1M
5 — 🇺🇸 claude-opus-4-8-thinking Anthropic 1562 ±9 7309 $5 / $25 1M
6 — 🇺🇸 grok-4.5 SpaceXAI 1558 ±13 2214 $2 / $6 500K
7 — 🇺🇸 claude-opus-4-7-thinking Anthropic 1558 ±7 10534 $5 / $25 1M
8 — 🇺🇸 claude-opus-4-7 Anthropic 1555 ±7 9976 $5 / $25 1M
9 — 🇺🇸 claude-opus-4-6-thinking Anthropic 1542 ±6 12919 $5 / $25 1M
10 — 🇺🇸 claude-sonnet-5-high Anthropic 1542 ±12 2959 $2 / $10 1M
— 以下为 Top 10 外的国产模型 —
14 — 🇨🇳 seed-2.1-pro-preview 字节跳动 1534 ±10 3909 N/A N/A
15 — 🇨🇳 glm-5.1 智谱 1526 ±9 5870 $1.4 / $4.4 202.8K
17 — 🇨🇳 qwen3.7-max-20260517 阿里 1516 ±8 6455 $1.48 / $4.43 1M
18 — 🇨🇳 kimi-k2.6 月之暗面 1515 ±7 9321 $0.95 / $4 262.1K

智能体榜

智能体榜本周全部是全新入榜模型,排名第一的是 Claude Fable 5 (High),净提升度 13.94%,同时拥有 30.65% 的最高好评 / 差评比,工具幻觉率仅 1.33% 属于较低水平。第二名 GPT 5.6 Sol (xHigh) 的可控性数值最高,达到 17.26%。头部三款模型的净提升度差距都明显大于各自的置信区间,属于表现分层的清晰格局。

国产模型 GLM 5.2 (Max) 杀入榜单 Top 10 位列第 9,净提升度为 6.24%,它的 Bash 恢复速度仅 4.45,远好于头部平均水平,命令出错后能快速恢复,表现突出。

国产模型在智能体榜覆盖靠前和中间多个位置,工具相关能力表现亮眼:

  • 智谱 glm-5.2 (max) 排名第 9 位,净提升度 6.24%,任务确认成功率 8.72%;

  • 智谱 glm-5.1 排名第 16 位,净提升度 1.19%;

  • 阿里 qwen3.7 Plus 排名第 18 位,净提升度 0.61%,工具幻觉率仅 0.19%;

  • 月之暗面 kimi-k2.7-code 排名第 20 位,净提升度 0.76%;

  • 阿里 qwen3.7 Max 排名第 21 位,净提升度 0.81%;

  • 深度求索 deepseek-v4-pro 排名第 22 位,净提升度 1.11%;

排名 模型 厂商 净提升度 (±CI) 任务确认成功率 好评 / 差评比 可控性 会话数
1 — 🇺🇸 Claude Fable 5 (High) Anthropic 13.94% ±1.56% 17.27% 30.65% 12.07% 16059
2 — 🇺🇸 GPT 5.6 Sol (xHigh) OpenAI 10.94% ±3.76% 10.93% 17.64% 17.26% 7881
3 — 🇺🇸 Claude Opus 4.8 (Thinking) Anthropic 9.28% ±1.35% 7.82% 17.96% 10.15% 33392
4 — 🇺🇸 GPT 5.5 (xHigh) OpenAI 8.26% ±0.87% 6.88% 12.61% 6.7% 36289
5 — 🇺🇸 Claude Sonnet 5 (High) Anthropic 8.0% ±1.71% 10.33% 13.9% 4.92% 23640
6 — 🇺🇸 Claude Opus 4.7 (Thinking) Anthropic 7.73% ±1.22% 5.22% 11.36% 9.17% 34357
7 — 🇺🇸 Claude Opus 4.7 Anthropic 7.63% ±1.22% 5.28% 13.38% 7.56% 34950
8 — 🇺🇸 GPT 5.5 (High) OpenAI 7.16% ±0.75% 6.42% 7.61% 8.72% 61455
9 — 🇨🇳 GLM 5.2 (Max) 智谱 6.24% ±1.1% 8.72% 12.59% 4.1% 31993
10 — 🇺🇸 GPT 5.5 OpenAI 6.05% ±0.72% 4.33% 5.53% 7.99% 62335
— 以下为 Top 10 外的国产模型 —
16 — 🇨🇳 GLM 5.1 智谱 1.19% ±0.82% 0.78% 0.53% 0.62% 51362
18 — 🇨🇳 Qwen3.7 Plus 阿里 0.61% ±1.38% 1.1% 4.04% 2.73% 10048
20 — 🇨🇳 Kimi K2.7 Code 月之暗面 0.76% ±2.01% 4.51% 1.38% 10.78% 7468

AI 生图 & AI 视频榜

AI 生图榜本周整体格局稳定,OpenAI 的 gpt-image-2 (medium) 依然以 1385 分的 ELO 稳居第一,字节跳动 seedream-5.0-pro 作为最高排名的国产模型位列第 11 位,ELO 1231 分,紧随多款海外头部生图模型之后。

而在 AI 视频榜,谷歌 gemini-omni-flash 位列榜首;字节跳动的 dreamina-seedance-2.0-720p 稳居第二名,ELO 分数 1482 分,表现远超多数海外视频生成模型;同时阿里 happyhorse-1.0 也拿下第 4 位,国产力量在 AI 视频生成第一梯队已经占据了重要席位

本周 Arena 榜单的最大亮点就是国产模型的多点突破,尤其是 kimi-k3 首次冲进综合榜 Top 10,并且直接登顶前端开发榜,证明国产大模型不仅在通用能力上追平第一梯队,在特定工程类任务场景已经形成了领先优势。同时字节、阿里、智谱等厂商的多款模型也在代码、生图、视频、智能体多个榜单的前半区站稳脚跟。

下周预计将有更多用户评测数据进一步积累,部分新入榜模型的排名和分数还可能出现小幅变动,值得关注后续国产模型能否在更多细分榜单拿下榜首位置。

© 版权声明

相关文章