返回博客列表
商务合作
填了邮箱才会在更新后收到通知
OBPAI 极客团队•2026/9/24•0 阅读

2026年全球编程大模型排行榜

2026-09-24 整理。Terminal-Bench 4.0 官方榜:GPT-6 Astra(max)配 Codex 解决率 58.2%。同一套 mini-SWE-agent 2.0.0 在 SWE-bench Verified 上另表。

编程大模型Terminal-BenchSWE-benchGPT-62026
2026年全球编程大模型排行榜 - 天梯图与数据榜单

2026-09-24 整理。主表照抄 Terminal-Bench 4.0 官方榜,榜单记录更新于 2026-09-21。一行是一次提交:模型、推理档位和代理一起计分。GPT-6 Astra(max)配 Codex,解决率 58.2%,95% 区间半宽 2.8 个百分点。Fable 5.1(max)配 Claude Code 是 57.9%,半宽 3.8 个百分点,两行的区间叠在一起。编程产品见 AI 编程助手。人气盲测见 大语言模型综合能力。接口标价见 大模型 API 价格。

2026年全球编程大模型天梯

Terminal-Bench 4.0 官方榜

这一表是该榜当时全部 27 行。并列名次按原榜保留。花费是这次评测的总账单,按 total_cost_usd 四舍五入到美元。GLM-5.3(max)配 Claude Code 排在第 16,解决率 41.8%。Grok 4.7(xhigh)配 Grok Build 的提交日是 2026-09-21,解决率 37.6%。

#模型档位代理机构解决率95% 半宽花费Token提交日
1GPT-6 AstramaxCodexOpenAI58.2%±2.8$3,2671.5BSep 3, 2026
2Fable 5.1maxClaude CodeAnthropic57.9%±3.8$6,2442.7BSep 1, 2026
2GPT-6 AstraxhighCodexOpenAI57.9%±2.7$2,3511.2BSep 3, 2026
2GPT-6 AstrahighCodexOpenAI57.9%±3.0$2,2691.2BSep 3, 2026
2Fable 5.1xhighClaude CodeAnthropic57.9%±3.4$4,8722.3BSep 1, 2026
6Fable 5.1highClaude CodeAnthropic54.5%±3.4$3,9852.2BSep 1, 2026
7GPT-6 AstramediumCodexOpenAI54.2%±2.7$1,9151.1BSep 3, 2026
8Fable 5.1mediumClaude CodeAnthropic53.9%±3.4$2,8331.6BSep 1, 2026
8Opus 5xhighClaude CodeAnthropic53.9%±3.2$6,0866.9BJul 24, 2026
10Opus 5maxClaude CodeAnthropic51.8%±3.4$5,9696.5BJul 24, 2026
11GPT-6 AstralowCodexOpenAI50.6%±2.8$1,557889.8MSep 3, 2026
12Opus 5highClaude CodeAnthropic50.3%±3.7$4,6625.5BJul 24, 2026
13Opus 5mediumClaude CodeAnthropic44.9%±3.8$3,1923.7BJul 24, 2026
14Fable 5maxClaude CodeAnthropic44.5%±3.9$7,2653.8BJun 9, 2026
15Fable 5.1lowClaude CodeAnthropic43.3%±3.6$2,3591.3BSep 1, 2026
16GLM-5.3maxClaude CodeZ.ai41.8%±3.2$2,7288.7BAug 14, 2026
17Grok 4.7xhighGrok BuildxAI37.6%±3.5$3,6835.5BSep 21, 2026
18GPT-5.6 SolmaxCodexOpenAI37.3%±3.8$2,5424.4BJun 26, 2026
19Opus 5lowClaude CodeAnthropic34.9%±3.9$2,3942.7BJul 24, 2026
20Opus 4.8maxClaude CodeAnthropic23.6%±3.6$6,4816.4BMay 28, 2026
21GPT-5.6 TerramaxCodexOpenAI21.5%±3.2$1,7345.7BJun 26, 2026
22Grok 4.6highGrok BuildxAI20.3%±3.1$3,5924.0BAug 12, 2026
23Gemini 3.8 Flashhighmini-SWE-agentGoogle19.1%±3.4$1,82917.2BSep 2, 2026
24GPT-5.6 LunamaxCodexOpenAI17.3%±2.9$34711.6BJun 26, 2026
25Grok 4.5highGrok BuildxAI12.4%±2.6$2,0943.4BJul 16, 2026
25Sonnet 5maxClaude CodeAnthropic12.4%±3.1$9,60421.6BJun 30, 2026
27Gemini 3.7 Flashhighmini-SWE-agentGoogle11.2%±2.5$1,26211.1BAug 13, 2026

SWE-bench Verified:同一代理 mini-SWE-agent 2.0.0

官方总榜把不同代理叠在一起。下面只留 bash-only、且代理版本为 mini-SWE-agent 2.0.0 的提交,再按解决率从高到低排。Claude 4.5 Opus(high)76.80%,平均花费 $0.75,提交日 2026-02-17。MiniMax M2.5(high)和 Gemini 3 Flash(high)都是 75.80%。Kimi K2.5(high)70.80%,平均 $0.15。DeepSeek V3.2(high)70.00%。

#模型档位解决率平均花费提交日
1Claude 4.5 Opushigh76.80%$0.752026-02-17
2Gemini 3 Flashhigh75.80%$0.362026-02-17
3MiniMax M2.5high75.80%$0.072026-02-17
4Claude 4.6 Opus—75.60%$0.552026-02-17
5GLM 5high72.80%$0.532026-02-17
6GPT 5.2high72.80%$0.472026-02-17
7GPT 5.2 Codex—72.80%$0.452026-02-19
8Claude 4.5 Sonnethigh71.40%$0.662026-02-17
9Kimi K2.5high70.80%$0.152026-02-17
10DeepSeek V3.2high70.00%$0.452026-02-17
11Gemini 3 Prohigh69.60%$0.962026-02-26
12GPT 5 mini—56.20%$0.052026-02-17

LiveCodeBench 默认窗口(止于 2025-05-01)

默认榜写出 454 题,题目日期从 2024-08-01 到 2025-05-01。o4-mini(high)Pass@1 为 80.2,Easy 99.1,Hard 63.5。DeepSeek-R1-0528 排在第 5,Pass@1 为 73.1。这张表的模型代际停在窗口截止日,后面发布的 Astra、Fable 5.1、Opus 5 不在上面。

#模型档位Pass@1EasyMediumHard
1o4-minihigh80.299.189.463.5
2o3high75.899.184.457.1
3o4-minimedium74.298.286.552.7
4Gemini 2.5 Pro06-0573.699.187.250.2
5DeepSeek-R1-0528—73.198.785.250.7
6Gemini 2.5 Pro05-0671.898.282.350.2
7EXAONE 4.0 32B—7098.482.346.2
8OpenReasoning-Nemotron-32B—69.898.381.446.3

这篇怎么排

整理日 2026-09-24。主表是 Terminal-Bench 页内标题为 Terminal-Bench 4.0 的官方榜,榜单记录更新于 2026-09-21。27 行全部收录。解决率、95% 区间半宽、花费、Token、提交日从该榜 JSON 照抄。花费取 total_cost_usd,四舍五入到美元。第二张表只收 SWE-bench Verified、bash-only、代理为 mini-SWE-agent 2.0.0 的行,按解决率从高到低重排,名次是这 12 行内部的顺序。第三张表是 LiveCodeBench 默认窗口,题目日期 2024-08-01 至 2025-05-01,共 454 题,模型代际停在 2025 年 5 月,不并进主表。

来源快照口径权重
Terminal-Bench 4.0 官方榜页抓取 2026-09-24;榜单 updated_at 2026-09-21终端任务解决率。一行是模型 + 推理档位 + 代理。GPT-6 Astra(max)+ Codex 58.2%(±2.8),n_trials 330。榜上 27 行全收主
SWE-bench Verified(bash-only)页抓取 2026-09-24;本表各行提交日 2026-02-17 至 2026-02-26只留 mini-SWE-agent 2.0.0。Claude 4.5 Opus(high)76.80%,平均 $0.75。官方总榜还混有别的代理,那些行不进这张表辅
LiveCodeBench默认窗口 2024-08-01 至 2025-05-01;抓取 2026-09-24竞赛编程 Pass@1。o4-mini(high)80.2。窗口截止后的模型不在这张默认榜上辅(旧窗口)

互动体验:拖拽排位《2026年全球编程大模型天梯榜》

榜单开放与生成

2026年全球编程大模型天梯榜

想打造自己的个性化天梯图并开放给读者嵌入吗?

全屏高清制作
文章来源:OBPAI TierList