返回博客列表
OBPAI 极客团队2026/8/436 阅读

2026大语言模型综合能力排行榜

用 Arena 2026-08-01 与 Artificial Analysis 近月公开数据,按编码、长文、中文/开源、Agent 分场景给 S/A/B,并附可拖拽修订的 LLM 天梯模板。

大语言模型LLM天梯Arena榜单模型选型AI
2026大语言模型综合能力排行榜 - 天梯图与数据榜单

怎么排

数据截止 2026-08-05。按编码、长文、中文/开源、Agent 分场景标 S/A/B,主要参考 Arena(arena.ai)2026-08-01 快照与 Artificial Analysis Intelligence Index。公开数字见下表。

来源说明

Arena 与 Artificial Analysis 加权不同,名次不必对齐;公开数字如下。

来源模型 / 档位公开数字(约)怎么读
Arena Text OverallClaude Fable 51509±6 Elo,总体第 1人气总榜顶端
Arena Text OverallClaude Opus 4.6 / 4.7(thinking)约 1505 / 1502紧跟;同代非 thinking 也在前十附近
Arena Text OverallQwen3.8-max1496±10(Preliminary)进总体前五;票薄、区间宽,当上升信号
Arena Text OverallGemini 3 / 3.1 Pro Preview、Kimi K3-max、GPT-5.6 Sol(xhigh)大致 1483–1486置信区间重叠严重,不宜强行排名次
Arena Text OverallDeepSeek V4 Pro约 1458 Elo离闭源前排有距离;价与自托管另算
AA Intelligence IndexClaude Opus 5(max)≈61合成指数顶端附近
AA Intelligence IndexOpus 5(xhigh)、Claude Fable 5Fable ≈60与 Opus max 咬得很紧
AA Intelligence IndexGPT-5.6 Sol(max)≈59贴着 Anthropic 前排
AA Intelligence IndexKimi K3(max) / DeepSeek V4 Pro(max)≈57 / ≈44开源阵营内差距明显

七月补充:Kimi K3 上线并开源、GPT-5.6 家族陆续进 Arena——票薄名次不稳。中文不套用 SuperCLUE 2026-05 旧分,改看 Arena 上 Qwen / Kimi / DeepSeek / GLM / 豆包相对位置。

按场景分 S / A / B

分档是编辑意见,未经官方认证:

  • S:这个场景里,公开榜和我们日常用法都靠得住,可以当默认主力候选。
  • A:某一块特别强,或性价比/开源可控性突出,但短板也清楚(票少 preliminary、贵、慢、或缺模态)。
  • B:能干活,适合保底或专项;一张截图不够升成全公司唯一默认。

下面四张表按场景切开。「依据」只复述上文的 Arena / AA 线索和编辑分档理由,不另发明基准分。

编码与前端交付

Arena Code/WebDev Overall(Aug 1)上,Opus 5-max 约 1705 Elo 居首;Kimi K3-max 约 1676;Qwen3.8-max WebDev 约 1668(Preliminary);GPT-5.6 Sol 约 1620。Text Coding 子榜上 Fable 5 约 1553±9,仍属第一梯队。WebDev 名次推不出「万事第一」。

梯队模型依据 / 榜单线索备注
SClaude Opus 5(max/high)WebDev Overall ≈1705 居首默认主力候选;注意 max/high 与聊天框档位不是同一行
SClaude Fable 5WebDev 前五;Text Coding ≈1553±9编码交付与人气子榜都靠得住
介于 S 与 AKimi K3-maxWebDev ≈1676;Fullstack 子榜曾压过一众闭源旗舰前端交付、页面级改版优先 A/B;别据此当成综合第一
AGPT-5.6 Sol(xhigh,含 Codex harness)WebDev ≈1620团队已有 OpenAI 栈时做 A/B,不必立刻换掉旧默认
AQwen3.8-maxWebDev ≈1668(Preliminary)票少、参考价值有限;用通义的团队可以并行试
BGLM-5.2-maxWebDev 前十五可见国内接口兼容与成本保底
BDeepSeek V4 Flash / Pro 系总榜与工程成本便宜、可 MIT 自托管;闭源旗舰仍更稳时当流量底座

长上下文写作、综述与多模态辅读

Overall、Creative Writing、Instruction Following 这类人气维度上,Claude 系一直靠前;Gemini / GPT 在长上下文、多模态和产品集成上各有卖点。选型前先问清楚:你优化的是「盲测观感」,还是「任务通过率」。

梯队模型依据 / 榜单线索备注
SClaude Fable 5 / Opus 4.x–5 系Overall 与写作/指令跟随类人气维度靠前长文修订、按规范改、少「油腻套话」——体验部分标为编辑意见
AGemini 3 / 3.1 Pro PreviewText Overall 约 1483–1486 一带长上下文与多模态文档流是常见卖点
AGemini 3.5 / 3.6 Flash同系 Flash 产品线又快又便宜的草稿机,往往比 Pro 更合理
AGPT-5.5 / 5.6 家族Sol 档 AA 指数贴 Anthropic 前排;Arena 人气名次会错位工具生态与产品集成面宽;先弄清自己在优化什么
BGrok 4.5 等部分 Agent / 文档向子榜更活跃主 Text 总榜未必天天第一;有实时检索等需求再抬档

中文业务与开源可控

不套 SuperCLUE 五月分。看 Arena 上 Qwen / Kimi / DeepSeek / GLM / 豆包的相对位置,再叠业务语料。开源「榜上第二」外推不了「机房里跑得起」。

梯队模型依据 / 榜单线索备注
AQwen3.8-max / Qwen3.7 系Arena Overall 前五(票少、参考价值有限)中文产品迭代常见默认;Preliminary 不宜当最终结论
AKimi K3开源权重 + 编码榜强势中文业务与可控栈很常见;注意 MoE 体积与多机成本
ADeepSeek V4 Pro / FlashArena ≈1458;AA max ≈44MIT、价低、可私有化——比的是「单位美元吞吐量」,闭源 S 不是免费替身
BGLM-5.x、MiMo、豆包 / Seed 等Arena 能刷到名次国内接口兼容与成本保底;升 S 前先用自己的工单/客服/合同语料打一轮

工具调用与 Agent 向

AA Intelligence Index 对 agentic 任务加权更高;Computer-use / 多步工具链是 Anthropic 产品侧的重点。具体子分若没独立复核,这里不编造百分数。最常见翻车:把「能跑通 demo」当成「能值守生产」。

梯队模型依据 / 榜单线索备注
SClaude Opus 5 / Fable 5AA 指数顶端附近(Opus 5-max ≈61;Fable ≈60)多步工具链默认候选;子分未独立复核就不写假百分数
AGPT-5.6 Sol指数与 harness 条目紧咬已有 OpenAI agent / Codex 栈时,优先并行评测
AKimi K3浏览、前端交付与开源可控需要自托管 agent 栈时很有竞争力
B价低的 Flash / Luna / 开源小档成本与吞吐导向适合路由层、预分类、高并发粗加工,不适合当唯一生产默认

读榜时容易踩的五个坑

  1. 风格偏好外推不了正确性:Arena 是人类盲选「更爱哪段」。语气讨喜、排版漂亮的模型,严谨推理题上未必领先。
  2. Preliminary 与宽置信区间:票少的模型(比如部分 max 新条目只有数千票)名次可以一天跳三档。看到 ±15~20 的区间,先当票数还在涨、名次不稳。
  3. 污染与刷题:公开静态集(MMLU-Pro、GPQA 等)年年被吐槽污染;没有日期和复现说明的「满分截图」,我们直接忽略。
  4. 闭源 API 不等于聊天框同款:同一品牌下 chat-latest、thinking、max effort、codex-harness 在榜上是不同行。采购合同写错档位,等于买了另一只模型。
  5. 开源权重的隐藏成本:K3 这类超大 MoE,权重体积和多机推理成本会把「榜上第二」变成「机房里跑不起」。DeepSeek / GLM 在「能落地」上可能反而更 S。

用模板改我们的版本

上面是 OBPAI 极客团队的编辑意见。模板「AI 大语言模型 (LLM) 综合能力天梯图」(ID 1785671363439)提供可拖拽图块,你可以自行拖拽做出你心中的模型排行榜。

互动体验:拖拽排位《AI 大语言模型 (LLM) 综合能力天梯图

AI 大语言模型 (LLM) 综合能力天梯图

Unranked pool(0)
All items have been ranked!

嵌入步骤见 如何嵌入互动天梯图

八月初公开榜怎么读

2026 年 8 月初:人气总榜仍是 Anthropic 前排扎堆;合成智力指数上 Opus 5、Fable 5、GPT-5.6 Sol 咬得很紧;编码交付榜上,Kimi K3 和 Opus 5 都得认真 A/B。选型时先定场景——编码、长文、中文还是 agent——再决定能不能接受闭源和账单。名次会周更,以你自己拖过的那张天梯为准。

榜单开放与生成

AI 大语言模型 (LLM) 综合能力天梯图

想打造自己的个性化天梯图并开放给读者嵌入吗?

全屏高清制作
文章来源:OBPAI TierList