Модели для программирования 2026
Снимок 2026-09-24. Terminal-Bench 4.0: GPT-6 Astra (max) с Codex — 58,2%. Вторая таблица — mini-SWE-agent 2.0.0 на SWE-bench Verified.

Сборка 2026-09-24. Главная таблица снята с официального борда Terminal-Bench 4.0; запись борда обновлена 21 сентября 2026. Строка — одна сдача: модель, усилие рассуждения и агент считаются вместе. GPT-6 Astra (max) с Codex решает 58,2% задач; полуширина 95% равна 2,8 пункта. Fable 5.1 (max) с Claude Code — 57,9%, полуширина 3,8 пункта, интервалы пересекаются. Продукты для кода: ИИ-помощники для программирования. Слепые голоса: способности LLM. Прайс API: цены API моделей.

Официальный борд Terminal-Bench 4.0
Здесь все 27 строк того борда. Совместные места оставлены как напечатано. Стоимость — счёт этого прогона, не прайс за миллион токенов. GLM-5.3 (max) с Claude Code — 16-е место, 41,8%. Grok 4.7 (xhigh) с Grok Build сдан 21 сентября 2026, 37,6%.
| # | 模型 | 档位 | 代理 | 机构 | 解决率 | 95% 半宽 | 花费 | Token | 提交日 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra | max | Codex | OpenAI | 58.2% | ±2.8 | $3,267 | 1.5B | Sep 3, 2026 |
| 2 | Fable 5.1 | max | Claude Code | Anthropic | 57.9% | ±3.8 | $6,244 | 2.7B | Sep 1, 2026 |
| 2 | GPT-6 Astra | xhigh | Codex | OpenAI | 57.9% | ±2.7 | $2,351 | 1.2B | Sep 3, 2026 |
| 2 | GPT-6 Astra | high | Codex | OpenAI | 57.9% | ±3.0 | $2,269 | 1.2B | Sep 3, 2026 |
| 2 | Fable 5.1 | xhigh | Claude Code | Anthropic | 57.9% | ±3.4 | $4,872 | 2.3B | Sep 1, 2026 |
| 6 | Fable 5.1 | high | Claude Code | Anthropic | 54.5% | ±3.4 | $3,985 | 2.2B | Sep 1, 2026 |
| 7 | GPT-6 Astra | medium | Codex | OpenAI | 54.2% | ±2.7 | $1,915 | 1.1B | Sep 3, 2026 |
| 8 | Fable 5.1 | medium | Claude Code | Anthropic | 53.9% | ±3.4 | $2,833 | 1.6B | Sep 1, 2026 |
| 8 | Opus 5 | xhigh | Claude Code | Anthropic | 53.9% | ±3.2 | $6,086 | 6.9B | Jul 24, 2026 |
| 10 | Opus 5 | max | Claude Code | Anthropic | 51.8% | ±3.4 | $5,969 | 6.5B | Jul 24, 2026 |
| 11 | GPT-6 Astra | low | Codex | OpenAI | 50.6% | ±2.8 | $1,557 | 889.8M | Sep 3, 2026 |
| 12 | Opus 5 | high | Claude Code | Anthropic | 50.3% | ±3.7 | $4,662 | 5.5B | Jul 24, 2026 |
| 13 | Opus 5 | medium | Claude Code | Anthropic | 44.9% | ±3.8 | $3,192 | 3.7B | Jul 24, 2026 |
| 14 | Fable 5 | max | Claude Code | Anthropic | 44.5% | ±3.9 | $7,265 | 3.8B | Jun 9, 2026 |
| 15 | Fable 5.1 | low | Claude Code | Anthropic | 43.3% | ±3.6 | $2,359 | 1.3B | Sep 1, 2026 |
| 16 | GLM-5.3 | max | Claude Code | Z.ai | 41.8% | ±3.2 | $2,728 | 8.7B | Aug 14, 2026 |
| 17 | Grok 4.7 | xhigh | Grok Build | xAI | 37.6% | ±3.5 | $3,683 | 5.5B | Sep 21, 2026 |
| 18 | GPT-5.6 Sol | max | Codex | OpenAI | 37.3% | ±3.8 | $2,542 | 4.4B | Jun 26, 2026 |
| 19 | Opus 5 | low | Claude Code | Anthropic | 34.9% | ±3.9 | $2,394 | 2.7B | Jul 24, 2026 |
| 20 | Opus 4.8 | max | Claude Code | Anthropic | 23.6% | ±3.6 | $6,481 | 6.4B | May 28, 2026 |
| 21 | GPT-5.6 Terra | max | Codex | OpenAI | 21.5% | ±3.2 | $1,734 | 5.7B | Jun 26, 2026 |
| 22 | Grok 4.6 | high | Grok Build | xAI | 20.3% | ±3.1 | $3,592 | 4.0B | Aug 12, 2026 |
| 23 | Gemini 3.8 Flash | high | mini-SWE-agent | 19.1% | ±3.4 | $1,829 | 17.2B | Sep 2, 2026 | |
| 24 | GPT-5.6 Luna | max | Codex | OpenAI | 17.3% | ±2.9 | $347 | 11.6B | Jun 26, 2026 |
| 25 | Grok 4.5 | high | Grok Build | xAI | 12.4% | ±2.6 | $2,094 | 3.4B | Jul 16, 2026 |
| 25 | Sonnet 5 | max | Claude Code | Anthropic | 12.4% | ±3.1 | $9,604 | 21.6B | Jun 30, 2026 |
| 27 | Gemini 3.7 Flash | high | mini-SWE-agent | 11.2% | ±2.5 | $1,262 | 11.1B | Aug 13, 2026 |
SWE-bench Verified, один агент: mini-SWE-agent 2.0.0
Публичный борд SWE-bench складывает разных агентов. Ниже оставлены только bash-only сдачи на mini-SWE-agent 2.0.0, по убыванию доли. Claude 4.5 Opus (high) — 76,80%, средние $0,75, дата 17 февраля 2026. MiniMax M2.5 (high) и Gemini 3 Flash (high) оба на 75,80%. Kimi K2.5 (high) — 70,80%, средние $0,15. DeepSeek V3.2 (high) — 70,00%.
| # | 模型 | 档位 | 解决率 | 平均花费 | 提交日 |
|---|---|---|---|---|---|
| 1 | Claude 4.5 Opus | high | 76.80% | $0.75 | 2026-02-17 |
| 2 | Gemini 3 Flash | high | 75.80% | $0.36 | 2026-02-17 |
| 3 | MiniMax M2.5 | high | 75.80% | $0.07 | 2026-02-17 |
| 4 | Claude 4.6 Opus | — | 75.60% | $0.55 | 2026-02-17 |
| 5 | GLM 5 | high | 72.80% | $0.53 | 2026-02-17 |
| 6 | GPT 5.2 | high | 72.80% | $0.47 | 2026-02-17 |
| 7 | GPT 5.2 Codex | — | 72.80% | $0.45 | 2026-02-19 |
| 8 | Claude 4.5 Sonnet | high | 71.40% | $0.66 | 2026-02-17 |
| 9 | Kimi K2.5 | high | 70.80% | $0.15 | 2026-02-17 |
| 10 | DeepSeek V3.2 | high | 70.00% | $0.45 | 2026-02-17 |
| 11 | Gemini 3 Pro | high | 69.60% | $0.96 | 2026-02-26 |
| 12 | GPT 5 mini | — | 56.20% | $0.05 | 2026-02-17 |
Окно LiveCodeBench по умолчанию (до 1 мая 2025)
Борд по умолчанию пишет 454 задачи с 1 августа 2024 по 1 мая 2025. У o4-mini (high) Pass@1 равен 80,2, Easy 99,1, Hard 63,5. DeepSeek-R1-0528 — 5-е место, 73,1. Это поколение обрывается на конце окна. Astra, Fable 5.1 и Opus 5 вышли позже и на этом борде отсутствуют.
| # | 模型 | 档位 | Pass@1 | Easy | Medium | Hard |
|---|---|---|---|---|---|---|
| 1 | o4-mini | high | 80.2 | 99.1 | 89.4 | 63.5 |
| 2 | o3 | high | 75.8 | 99.1 | 84.4 | 57.1 |
| 3 | o4-mini | medium | 74.2 | 98.2 | 86.5 | 52.7 |
| 4 | Gemini 2.5 Pro | 06-05 | 73.6 | 99.1 | 87.2 | 50.2 |
| 5 | DeepSeek-R1-0528 | — | 73.1 | 98.7 | 85.2 | 50.7 |
| 6 | Gemini 2.5 Pro | 05-06 | 71.8 | 98.2 | 82.3 | 50.2 |
| 7 | EXAONE 4.0 32B | — | 70 | 98.4 | 82.3 | 46.2 |
| 8 | OpenReasoning-Nemotron-32B | — | 69.8 | 98.3 | 81.4 | 46.3 |
Как ранжировали
Сборка 2026-09-24. Главная таблица — публичный борд с заголовком Terminal-Bench 4.0 на tbench.ai. Запись борда обновлена 21 сентября 2026. Все 27 строк. Доля решений, полуширина 95%, стоимость, токены и дата сдачи сняты с JSON этого борда. Стоимость — total_cost_usd, округление до доллара. Вторая таблица — только строки SWE-bench Verified с bash-only и mini-SWE-agent 2.0.0, по убыванию доли. Эти места внутренние для 12 строк. Третья — окно по умолчанию LiveCodeBench, задачи с 1 августа 2024 по 1 мая 2025 (454 задачи). Это поколение обрывается в мае 2025 и не входит в главный порядок.
| Источник | Снимок | Что меряет | Вес |
|---|---|---|---|
| Официальный борд Terminal-Bench 4.0 | Снятие 2026-09-24; updated_at 21.09.2026 | Доля решённых терминальных задач. Строка = модель + усилие + агент. GPT-6 Astra (max) + Codex 58,2% (±2,8), 330 испытаний. Все 27 строк | Главн. |
| SWE-bench Verified (bash-only) | Снятие 2026-09-24; даты строк 17–26.02.2026 | Только mini-SWE-agent 2.0.0. Claude 4.5 Opus (high) 76,80%, средние $0,75. Другие агенты публичного борда сюда не входят | Доп. |
| LiveCodeBench | Окно 01.08.2024–01.05.2025; снятие 2026-09-24 | Pass@1 на конкурсных задачах. o4-mini (high) 80,2. Моделей после окна на этом борде нет | Доп. (старое окно) |
互动体验:拖拽排位《Модели для кода 2026》
Модели для кода 2026
想打造自己的个性化天梯图并开放给读者嵌入吗?