能力榜单
用多个独立第三方榜单交叉验证「谁的模型好」——不依赖平台自说自话。快照日期见各榜脚注,均为每周抓取存档。
OpenRouter 调用量 Top10
快照 2026-08-31 · 7 日窗口数据口径:按 OpenRouter API 实际 token 处理量(含 prompt+completion)排名,反映开发者采用而非质量;不反映全市场流量。环比为与上一周 token 量变化。
LMArena Elo 榜
快照 2026-08-27| # | 模型 | 厂商 | Elo | 备注 |
|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 1508 | |
| 2 | Claude Opus 4.6 (high) | Anthropic | 1504 | |
| 3 | Claude Opus 4.7 (high) | Anthropic | 1502 | |
| 4 | Kimi K3 (open) | Moonshot AI | 1500 | coding #1 · open weight |
| 4 | Gemini 3.1 Pro Preview | 1500 | science leader | |
| 6 | Grok 4.5 | xAI | 1499 | cheapest frontier output |
| 7 | GLM-5.3 | Z.ai | — | 本周新入榜 |
| 8 | ERNIE 5.1 | 百度 | 1468 |
数据口径:全球用户匿名两两盲测投票,Elo 机制计分,反映真实使用偏好(全球用户对匿名模型两两盲测投票,按 Elo 机制计算排名,反映真实使用偏好。国产模型补充参考:百度 ernie-5.1 Elo 1468。)。
AA 智能指数
快照 2026-08-28| # | 模型 | 厂商 | 智能指数 | 备注 |
|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 63 | |
| 2 | Claude Fable 5 | Anthropic | 62.1 | |
| 3 | Grok 4.6 | xAI | 60.9 | |
| 4 | Kimi K3 (Max) | Moonshot AI | 57 | 开源权重最高排名 |
| 4 | GLM-5.3-Flash | Z.ai | 57 | 追平 Claude Opus 4.8 |
| 6 | GPT-5.5 (xhigh) | OpenAI | 54 |
数据口径:综合 10 项权威基准(GDPval-AA / Terminal-Bench / GPQA Diamond / SciCode 等)加权,综合 10 项权威评测基准(GDPval-AA、Terminal-Bench、GPQA Diamond、SciCode 等)加权,覆盖数学/科学/编程/推理。当前快照共 183 款模型。中国模型:Kimi K3 (Max) 57 分(189 款中第 4,开源权重最高排名);GLM-5.3-Flash 57 分追平 Claude Opus 4.8。