MAAS / WEEKLY

能力榜单

用多个独立第三方榜单交叉验证「谁的模型好」——不依赖平台自说自话。快照日期见各榜脚注,均为每周抓取存档。

OpenRouter 调用量 Top10

快照 2026-08-31 · 7 日窗口
1
DeepSeek V4 Flash 0731deepseek12.2T tokens+5%
2
Ox Alphastealth (GLM-5.3-Flash 匿名)9.75T tokens+44%
3
GPT-5.6 Lunaopenai8.48T tokens+89%
4
GLM 5.3 Flashz-ai8.14T tokens新上榜
5
MiMo-V2.5xiaomi8.08T tokens+17%
6
Hy3tencent6.41T tokens+17%
7
DeepSeek V4 Flash 0423deepseek5.15T tokens+7%
8
Nemotron 3 Ultra (free)nvidia4.93T tokens+4%
9
Hy4 previewtencent4.01T tokens新上榜
10
Gemini 3.7 Flashgoogle3.85T tokens+91%

数据口径:按 OpenRouter API 实际 token 处理量(含 prompt+completion)排名,反映开发者采用而非质量;不反映全市场流量。环比为与上一周 token 量变化。

LMArena Elo 榜

快照 2026-08-27
#模型厂商Elo备注
1Claude Fable 5Anthropic1508
2Claude Opus 4.6 (high)Anthropic1504
3Claude Opus 4.7 (high)Anthropic1502
4Kimi K3 (open)Moonshot AI1500coding #1 · open weight
4Gemini 3.1 Pro PreviewGoogle1500science leader
6Grok 4.5xAI1499cheapest frontier output
7GLM-5.3Z.ai本周新入榜
8ERNIE 5.1百度1468

数据口径:全球用户匿名两两盲测投票,Elo 机制计分,反映真实使用偏好(全球用户对匿名模型两两盲测投票,按 Elo 机制计算排名,反映真实使用偏好。国产模型补充参考:百度 ernie-5.1 Elo 1468。)。

AA 智能指数

快照 2026-08-28
#模型厂商智能指数备注
1Claude Opus 5Anthropic63
2Claude Fable 5Anthropic62.1
3Grok 4.6xAI60.9
4Kimi K3 (Max)Moonshot AI57开源权重最高排名
4GLM-5.3-FlashZ.ai57追平 Claude Opus 4.8
6GPT-5.5 (xhigh)OpenAI54

数据口径:综合 10 项权威基准(GDPval-AA / Terminal-Bench / GPQA Diamond / SciCode 等)加权,综合 10 项权威评测基准(GDPval-AA、Terminal-Bench、GPQA Diamond、SciCode 等)加权,覆盖数学/科学/编程/推理。当前快照共 183 款模型。中国模型:Kimi K3 (Max) 57 分(189 款中第 4,开源权重最高排名);GLM-5.3-Flash 57 分追平 Claude Opus 4.8。