2026大语言模型综合能力排行榜
用 Arena 2026-08-01 与 Artificial Analysis 近月公开数据,按编码、长文、中文/开源、Agent 分场景给 S/A/B,并附可拖拽修订的 LLM 天梯模板。

怎么排
数据截止 2026-08-05。按编码、长文、中文/开源、Agent 分场景标 S/A/B,主要参考 Arena(arena.ai)2026-08-01 快照与 Artificial Analysis Intelligence Index。公开数字见下表。
来源说明
Arena 与 Artificial Analysis 加权不同,名次不必对齐;公开数字如下。
| 来源 | 模型 / 档位 | 公开数字(约) | 怎么读 |
|---|---|---|---|
| Arena Text Overall | Claude Fable 5 | 1509±6 Elo,总体第 1 | 人气总榜顶端 |
| Arena Text Overall | Claude Opus 4.6 / 4.7(thinking) | 约 1505 / 1502 | 紧跟;同代非 thinking 也在前十附近 |
| Arena Text Overall | Qwen3.8-max | 1496±10(Preliminary) | 进总体前五;票薄、区间宽,当上升信号 |
| Arena Text Overall | Gemini 3 / 3.1 Pro Preview、Kimi K3-max、GPT-5.6 Sol(xhigh) | 大致 1483–1486 | 置信区间重叠严重,不宜强行排名次 |
| Arena Text Overall | DeepSeek V4 Pro | 约 1458 Elo | 离闭源前排有距离;价与自托管另算 |
| AA Intelligence Index | Claude Opus 5(max) | ≈61 | 合成指数顶端附近 |
| AA Intelligence Index | Opus 5(xhigh)、Claude Fable 5 | Fable ≈60 | 与 Opus max 咬得很紧 |
| AA Intelligence Index | GPT-5.6 Sol(max) | ≈59 | 贴着 Anthropic 前排 |
| AA Intelligence Index | Kimi K3(max) / DeepSeek V4 Pro(max) | ≈57 / ≈44 | 开源阵营内差距明显 |
七月补充:Kimi K3 上线并开源、GPT-5.6 家族陆续进 Arena——票薄名次不稳。中文不套用 SuperCLUE 2026-05 旧分,改看 Arena 上 Qwen / Kimi / DeepSeek / GLM / 豆包相对位置。
按场景分 S / A / B
分档是编辑意见,未经官方认证:
- S:这个场景里,公开榜和我们日常用法都靠得住,可以当默认主力候选。
- A:某一块特别强,或性价比/开源可控性突出,但短板也清楚(票少 preliminary、贵、慢、或缺模态)。
- B:能干活,适合保底或专项;一张截图不够升成全公司唯一默认。
下面四张表按场景切开。「依据」只复述上文的 Arena / AA 线索和编辑分档理由,不另发明基准分。
编码与前端交付
Arena Code/WebDev Overall(Aug 1)上,Opus 5-max 约 1705 Elo 居首;Kimi K3-max 约 1676;Qwen3.8-max WebDev 约 1668(Preliminary);GPT-5.6 Sol 约 1620。Text Coding 子榜上 Fable 5 约 1553±9,仍属第一梯队。WebDev 名次推不出「万事第一」。
| 梯队 | 模型 | 依据 / 榜单线索 | 备注 |
|---|---|---|---|
| S | Claude Opus 5(max/high) | WebDev Overall ≈1705 居首 | 默认主力候选;注意 max/high 与聊天框档位不是同一行 |
| S | Claude Fable 5 | WebDev 前五;Text Coding ≈1553±9 | 编码交付与人气子榜都靠得住 |
| 介于 S 与 A | Kimi K3-max | WebDev ≈1676;Fullstack 子榜曾压过一众闭源旗舰 | 前端交付、页面级改版优先 A/B;别据此当成综合第一 |
| A | GPT-5.6 Sol(xhigh,含 Codex harness) | WebDev ≈1620 | 团队已有 OpenAI 栈时做 A/B,不必立刻换掉旧默认 |
| A | Qwen3.8-max | WebDev ≈1668(Preliminary) | 票少、参考价值有限;用通义的团队可以并行试 |
| B | GLM-5.2-max | WebDev 前十五可见 | 国内接口兼容与成本保底 |
| B | DeepSeek V4 Flash / Pro 系 | 总榜与工程成本 | 便宜、可 MIT 自托管;闭源旗舰仍更稳时当流量底座 |
长上下文写作、综述与多模态辅读
Overall、Creative Writing、Instruction Following 这类人气维度上,Claude 系一直靠前;Gemini / GPT 在长上下文、多模态和产品集成上各有卖点。选型前先问清楚:你优化的是「盲测观感」,还是「任务通过率」。
| 梯队 | 模型 | 依据 / 榜单线索 | 备注 |
|---|---|---|---|
| S | Claude Fable 5 / Opus 4.x–5 系 | Overall 与写作/指令跟随类人气维度靠前 | 长文修订、按规范改、少「油腻套话」——体验部分标为编辑意见 |
| A | Gemini 3 / 3.1 Pro Preview | Text Overall 约 1483–1486 一带 | 长上下文与多模态文档流是常见卖点 |
| A | Gemini 3.5 / 3.6 Flash | 同系 Flash 产品线 | 又快又便宜的草稿机,往往比 Pro 更合理 |
| A | GPT-5.5 / 5.6 家族 | Sol 档 AA 指数贴 Anthropic 前排;Arena 人气名次会错位 | 工具生态与产品集成面宽;先弄清自己在优化什么 |
| B | Grok 4.5 等 | 部分 Agent / 文档向子榜更活跃 | 主 Text 总榜未必天天第一;有实时检索等需求再抬档 |
中文业务与开源可控
不套 SuperCLUE 五月分。看 Arena 上 Qwen / Kimi / DeepSeek / GLM / 豆包的相对位置,再叠业务语料。开源「榜上第二」外推不了「机房里跑得起」。
| 梯队 | 模型 | 依据 / 榜单线索 | 备注 |
|---|---|---|---|
| A | Qwen3.8-max / Qwen3.7 系 | Arena Overall 前五(票少、参考价值有限) | 中文产品迭代常见默认;Preliminary 不宜当最终结论 |
| A | Kimi K3 | 开源权重 + 编码榜强势 | 中文业务与可控栈很常见;注意 MoE 体积与多机成本 |
| A | DeepSeek V4 Pro / Flash | Arena ≈1458;AA max ≈44 | MIT、价低、可私有化——比的是「单位美元吞吐量」,闭源 S 不是免费替身 |
| B | GLM-5.x、MiMo、豆包 / Seed 等 | Arena 能刷到名次 | 国内接口兼容与成本保底;升 S 前先用自己的工单/客服/合同语料打一轮 |
工具调用与 Agent 向
AA Intelligence Index 对 agentic 任务加权更高;Computer-use / 多步工具链是 Anthropic 产品侧的重点。具体子分若没独立复核,这里不编造百分数。最常见翻车:把「能跑通 demo」当成「能值守生产」。
| 梯队 | 模型 | 依据 / 榜单线索 | 备注 |
|---|---|---|---|
| S | Claude Opus 5 / Fable 5 | AA 指数顶端附近(Opus 5-max ≈61;Fable ≈60) | 多步工具链默认候选;子分未独立复核就不写假百分数 |
| A | GPT-5.6 Sol | 指数与 harness 条目紧咬 | 已有 OpenAI agent / Codex 栈时,优先并行评测 |
| A | Kimi K3 | 浏览、前端交付与开源可控 | 需要自托管 agent 栈时很有竞争力 |
| B | 价低的 Flash / Luna / 开源小档 | 成本与吞吐导向 | 适合路由层、预分类、高并发粗加工,不适合当唯一生产默认 |
读榜时容易踩的五个坑
- 风格偏好外推不了正确性:Arena 是人类盲选「更爱哪段」。语气讨喜、排版漂亮的模型,严谨推理题上未必领先。
- Preliminary 与宽置信区间:票少的模型(比如部分 max 新条目只有数千票)名次可以一天跳三档。看到 ±15~20 的区间,先当票数还在涨、名次不稳。
- 污染与刷题:公开静态集(MMLU-Pro、GPQA 等)年年被吐槽污染;没有日期和复现说明的「满分截图」,我们直接忽略。
- 闭源 API 不等于聊天框同款:同一品牌下 chat-latest、thinking、max effort、codex-harness 在榜上是不同行。采购合同写错档位,等于买了另一只模型。
- 开源权重的隐藏成本:K3 这类超大 MoE,权重体积和多机推理成本会把「榜上第二」变成「机房里跑不起」。DeepSeek / GLM 在「能落地」上可能反而更 S。
用模板改我们的版本
上面是 OBPAI 极客团队的编辑意见。模板「AI 大语言模型 (LLM) 综合能力天梯图」(ID 1785671363439)提供可拖拽图块,你可以自行拖拽做出你心中的模型排行榜。
互动体验:拖拽排位《AI 大语言模型 (LLM) 综合能力天梯图》
AI 大语言模型 (LLM) 综合能力天梯图
嵌入步骤见 如何嵌入互动天梯图。
八月初公开榜怎么读
2026 年 8 月初:人气总榜仍是 Anthropic 前排扎堆;合成智力指数上 Opus 5、Fable 5、GPT-5.6 Sol 咬得很紧;编码交付榜上,Kimi K3 和 Opus 5 都得认真 A/B。选型时先定场景——编码、长文、中文还是 agent——再决定能不能接受闭源和账单。名次会周更,以你自己拖过的那张天梯为准。
AI 大语言模型 (LLM) 综合能力天梯图
想打造自己的个性化天梯图并开放给读者嵌入吗?