返回博客列表
Сотрудничество
Укажите email в аккаунте, чтобы получить письмо после обновления
Команда OBPAI•2026/9/24•0 阅读

Модели для программирования 2026

Снимок 2026-09-24. Terminal-Bench 4.0: GPT-6 Astra (max) с Codex — 58,2%. Вторая таблица — mini-SWE-agent 2.0.0 на SWE-bench Verified.

модели для кодаTerminal-BenchSWE-benchGPT-62026
Модели для программирования 2026 - 天梯图与数据榜单

Сборка 2026-09-24. Главная таблица снята с официального борда Terminal-Bench 4.0; запись борда обновлена 21 сентября 2026. Строка — одна сдача: модель, усилие рассуждения и агент считаются вместе. GPT-6 Astra (max) с Codex решает 58,2% задач; полуширина 95% равна 2,8 пункта. Fable 5.1 (max) с Claude Code — 57,9%, полуширина 3,8 пункта, интервалы пересекаются. Продукты для кода: ИИ-помощники для программирования. Слепые голоса: способности LLM. Прайс API: цены API моделей.

2026年全球编程大模型天梯

Официальный борд Terminal-Bench 4.0

Здесь все 27 строк того борда. Совместные места оставлены как напечатано. Стоимость — счёт этого прогона, не прайс за миллион токенов. GLM-5.3 (max) с Claude Code — 16-е место, 41,8%. Grok 4.7 (xhigh) с Grok Build сдан 21 сентября 2026, 37,6%.

#模型档位代理机构解决率95% 半宽花费Token提交日
1GPT-6 AstramaxCodexOpenAI58.2%±2.8$3,2671.5BSep 3, 2026
2Fable 5.1maxClaude CodeAnthropic57.9%±3.8$6,2442.7BSep 1, 2026
2GPT-6 AstraxhighCodexOpenAI57.9%±2.7$2,3511.2BSep 3, 2026
2GPT-6 AstrahighCodexOpenAI57.9%±3.0$2,2691.2BSep 3, 2026
2Fable 5.1xhighClaude CodeAnthropic57.9%±3.4$4,8722.3BSep 1, 2026
6Fable 5.1highClaude CodeAnthropic54.5%±3.4$3,9852.2BSep 1, 2026
7GPT-6 AstramediumCodexOpenAI54.2%±2.7$1,9151.1BSep 3, 2026
8Fable 5.1mediumClaude CodeAnthropic53.9%±3.4$2,8331.6BSep 1, 2026
8Opus 5xhighClaude CodeAnthropic53.9%±3.2$6,0866.9BJul 24, 2026
10Opus 5maxClaude CodeAnthropic51.8%±3.4$5,9696.5BJul 24, 2026
11GPT-6 AstralowCodexOpenAI50.6%±2.8$1,557889.8MSep 3, 2026
12Opus 5highClaude CodeAnthropic50.3%±3.7$4,6625.5BJul 24, 2026
13Opus 5mediumClaude CodeAnthropic44.9%±3.8$3,1923.7BJul 24, 2026
14Fable 5maxClaude CodeAnthropic44.5%±3.9$7,2653.8BJun 9, 2026
15Fable 5.1lowClaude CodeAnthropic43.3%±3.6$2,3591.3BSep 1, 2026
16GLM-5.3maxClaude CodeZ.ai41.8%±3.2$2,7288.7BAug 14, 2026
17Grok 4.7xhighGrok BuildxAI37.6%±3.5$3,6835.5BSep 21, 2026
18GPT-5.6 SolmaxCodexOpenAI37.3%±3.8$2,5424.4BJun 26, 2026
19Opus 5lowClaude CodeAnthropic34.9%±3.9$2,3942.7BJul 24, 2026
20Opus 4.8maxClaude CodeAnthropic23.6%±3.6$6,4816.4BMay 28, 2026
21GPT-5.6 TerramaxCodexOpenAI21.5%±3.2$1,7345.7BJun 26, 2026
22Grok 4.6highGrok BuildxAI20.3%±3.1$3,5924.0BAug 12, 2026
23Gemini 3.8 Flashhighmini-SWE-agentGoogle19.1%±3.4$1,82917.2BSep 2, 2026
24GPT-5.6 LunamaxCodexOpenAI17.3%±2.9$34711.6BJun 26, 2026
25Grok 4.5highGrok BuildxAI12.4%±2.6$2,0943.4BJul 16, 2026
25Sonnet 5maxClaude CodeAnthropic12.4%±3.1$9,60421.6BJun 30, 2026
27Gemini 3.7 Flashhighmini-SWE-agentGoogle11.2%±2.5$1,26211.1BAug 13, 2026

SWE-bench Verified, один агент: mini-SWE-agent 2.0.0

Публичный борд SWE-bench складывает разных агентов. Ниже оставлены только bash-only сдачи на mini-SWE-agent 2.0.0, по убыванию доли. Claude 4.5 Opus (high) — 76,80%, средние $0,75, дата 17 февраля 2026. MiniMax M2.5 (high) и Gemini 3 Flash (high) оба на 75,80%. Kimi K2.5 (high) — 70,80%, средние $0,15. DeepSeek V3.2 (high) — 70,00%.

#模型档位解决率平均花费提交日
1Claude 4.5 Opushigh76.80%$0.752026-02-17
2Gemini 3 Flashhigh75.80%$0.362026-02-17
3MiniMax M2.5high75.80%$0.072026-02-17
4Claude 4.6 Opus—75.60%$0.552026-02-17
5GLM 5high72.80%$0.532026-02-17
6GPT 5.2high72.80%$0.472026-02-17
7GPT 5.2 Codex—72.80%$0.452026-02-19
8Claude 4.5 Sonnethigh71.40%$0.662026-02-17
9Kimi K2.5high70.80%$0.152026-02-17
10DeepSeek V3.2high70.00%$0.452026-02-17
11Gemini 3 Prohigh69.60%$0.962026-02-26
12GPT 5 mini—56.20%$0.052026-02-17

Окно LiveCodeBench по умолчанию (до 1 мая 2025)

Борд по умолчанию пишет 454 задачи с 1 августа 2024 по 1 мая 2025. У o4-mini (high) Pass@1 равен 80,2, Easy 99,1, Hard 63,5. DeepSeek-R1-0528 — 5-е место, 73,1. Это поколение обрывается на конце окна. Astra, Fable 5.1 и Opus 5 вышли позже и на этом борде отсутствуют.

#模型档位Pass@1EasyMediumHard
1o4-minihigh80.299.189.463.5
2o3high75.899.184.457.1
3o4-minimedium74.298.286.552.7
4Gemini 2.5 Pro06-0573.699.187.250.2
5DeepSeek-R1-0528—73.198.785.250.7
6Gemini 2.5 Pro05-0671.898.282.350.2
7EXAONE 4.0 32B—7098.482.346.2
8OpenReasoning-Nemotron-32B—69.898.381.446.3

Как ранжировали

Сборка 2026-09-24. Главная таблица — публичный борд с заголовком Terminal-Bench 4.0 на tbench.ai. Запись борда обновлена 21 сентября 2026. Все 27 строк. Доля решений, полуширина 95%, стоимость, токены и дата сдачи сняты с JSON этого борда. Стоимость — total_cost_usd, округление до доллара. Вторая таблица — только строки SWE-bench Verified с bash-only и mini-SWE-agent 2.0.0, по убыванию доли. Эти места внутренние для 12 строк. Третья — окно по умолчанию LiveCodeBench, задачи с 1 августа 2024 по 1 мая 2025 (454 задачи). Это поколение обрывается в мае 2025 и не входит в главный порядок.

ИсточникСнимокЧто меряетВес
Официальный борд Terminal-Bench 4.0Снятие 2026-09-24; updated_at 21.09.2026Доля решённых терминальных задач. Строка = модель + усилие + агент. GPT-6 Astra (max) + Codex 58,2% (±2,8), 330 испытаний. Все 27 строкГлавн.
SWE-bench Verified (bash-only)Снятие 2026-09-24; даты строк 17–26.02.2026Только mini-SWE-agent 2.0.0. Claude 4.5 Opus (high) 76,80%, средние $0,75. Другие агенты публичного борда сюда не входятДоп.
LiveCodeBenchОкно 01.08.2024–01.05.2025; снятие 2026-09-24Pass@1 на конкурсных задачах. o4-mini (high) 80,2. Моделей после окна на этом борде нетДоп. (старое окно)

互动体验:拖拽排位《Модели для кода 2026》

榜单开放与生成

Модели для кода 2026

想打造自己的个性化天梯图并开放给读者嵌入吗?

全屏高清制作
文章来源:OBPAI TierList