Сводный рейтинг больших языковых моделей 2026
На основе открытых данных Arena по состоянию на 2026-08-01 и публичных данных Artificial Analysis за последние месяцы выставляем оценки S/A/B по сценариям: кодинг, длинный контекст, китайские/открытые модели, агенты. В комплекте — редактируемый перетаскиваемый шаблон LLM-тир-листа.

Как ранжировали
Данные актуальны на 2026-08-05По сценариям — кодинг, длинные тексты, китайские/открытые модели, агенты — выставлены оценки S/A/B. Основные источники: снимок Arena (arena.ai) от 1 августа 2026 года и индекс Artificial Analysis Intelligence. Публичные цифры — в таблице ниже.
Пояснение к источникам
Arena и Artificial Analysis по-разному взвешивают результаты, поэтому позиции в рейтингах могут не совпадать; публичные цифры приведены ниже.
| Источник | Модель / уровень | Публичные цифры (приблизительно) | Как читать |
|---|---|---|---|
| Arena Text Overall | Claude Fable 5 | 1509±6 Elo, №1 в общем зачёте | Вершина общего рейтинга популярности |
| Arena Text Overall | Claude Opus 4.6 / 4.7 (thinking) | примерно 1505 / 1502 | следом идёт; не-thinking версия того же поколения тоже держится рядом с топ-10 |
| Arena Text Overall | Qwen3.8-max | 1496±10 (Preliminary) | проходит в общий топ-5; голосов мало, интервал широкий — расцениваем как сигнал роста |
| Arena Text Overall | Gemini 3 / 3.1 Pro Preview, Kimi K3-max и GPT-5.6 Sol (xhigh) | примерно 1483–1486 | доверительные интервалы сильно перекрываются, жёстко ранжировать не стоит |
| Arena Text Overall | DeepSeek V4 Pro | около 1458 Elo | до лидеров среди закрытых моделей пока далеко; цена и самохостинг — отдельный разговор |
| AA Intelligence Index | Claude Opus 5 (max) | ≈61 | вблизи вершины сводного индекса |
| AA Intelligence Index | Opus 5 (xhigh), Claude Fable 5 | Fable ≈60 | Вплотную за Opus max |
| AA Intelligence Index | GPT-5.6 Sol (max) | ≈59 | Вплотную к первой линии Anthropic |
| AA Intelligence Index | Kimi K3 (max) / DeepSeek V4 Pro (max) | ≈57 / ≈44 | В лагере open-source разрыв очевиден |
Июльское дополнение: Kimi K3 вышел и открыл исходный код, семейство GPT-5.6 постепенно заходит в Arena — голосов мало, позиции неустойчивы. Для китайских моделей не переносим старые баллы SuperCLUE 2026-05, а смотрим на относительные позиции Qwen / Kimi / DeepSeek / GLM / Doubao в Arena.
Разбивка по сценариям на S / A / B
Разбивка по уровням — редакционное мнение, официально не подтверждено:
- S:В этом сценарии и публичные лидерборды, и наш повседневный опыт достаточно надежны: модели можно смело рассматривать как основных кандидатов по умолчанию.
- A:...
- B:Работать может, подходит как запасной вариант или для отдельных задач; одного скриншота недостаточно, чтобы сделать её единственной моделью по умолчанию во всей компании.
Ниже четыре таблицы, разбитые по сценариям. «Обоснование» только повторяет сигналы Arena / AA из текста выше и логику редакционной разбивки по категориям, без выдумывания новых бенчмарк-баллов.
Кодинг и сдача фронтенда
В Arena Code/WebDev Overall (Aug 1) Opus 5-max примерно 1705 лидирует по Elo; Kimi K3-max примерно 1676; Qwen3.8-max WebDev — около 1668 (Preliminary); GPT-5.6 Sol — около 1620. В под-рейтинге Text Coding Fable 5 примерно 1553±9всё ещё в первом тире. Место в WebDev не означает «первый во всём»
| Тир | Модель | Основание / сигналы рейтинга | Примечания |
|---|---|---|---|
| S | Claude Opus 5 (max/high) | WebDev Overall ≈1705 — первое место | Основной кандидат для работы по умолчанию; обратите внимание: max/high и уровень в чат-окне — это не одно и то же |
| S | Claude Fable 5 | WebDev — топ-5; Text Coding ≈1553±9 | Субрейтинги практического кодинга и популярности — оба заслуживают доверия |
| Между S и A | Kimi K3-max | WebDev ≈1676; в субрейтинге Fullstack обходил целый ряд закрытых флагманов | Фронтенд-задачи и переделка страниц — в первую очередь для A/B; не считайте его первым в общем зачёте |
| A | GPT-5.6 Sol (xhigh, с обвязкой Codex) | WebDev ≈1620 | Если команда уже работает на стеке OpenAI — сначала A/B, прежнюю модель по умолчанию менять прямо сейчас не обязательно |
| A | Qwen3.8-max | WebDev ≈1668 (предварительно) | Мало голосов, ценность ограничена; команды, использующие Tongyi, могут попробовать параллельно |
| B | GLM-5.2-max | WebDev — виден в топ-15 | Совместимость с китайскими API и предсказуемые расходы |
| B | DeepSeek V4 Flash / Pro — серия | Общий рейтинг и инженерные затраты | Дёшево, можно развернуть самостоятельно под MIT; пока закрытые флагманы всё ещё стабильнее — использовать как базовый слой для трафика |
Длинный контекст: написание текстов, обзоры и мультимодальная помощь в чтении
В таких популярных категориях, как Overall, Creative Writing, Instruction Following, семейство Claude традиционно впереди; у Gemini / GPT свои преимущества в длинном контексте, мультимодальности и интеграции с продуктами. Перед выбором чётко определитесь: вы оптимизируете «впечатление от слепого теста» или «процент выполнения задач».
| Тир | Модель | Основание / данные лидербордов | Примечание |
|---|---|---|---|
| S | Claude Fable 5 / линейка Opus 4.x–5 | Overall и категории популярности «письмо/следование инструкциям» — в верхних строчках | Редактура длинных текстов, правка по регламенту, меньше «приторных штампов» — блок о впечатлениях помечен как редакционное мнение |
| A | Gemini 3 / 3.1 Pro Preview | Text Overall — в районе 1483–1486 | Длинный контекст и потоки мультимодальных документов — частые заявленные преимущества |
| A | Gemini 3.5 / 3.6 Flash | Та же линейка Flash | Быстрая и дешёвая модель для черновиков — часто разумнее, чем Pro |
| A | Семейство GPT-5.5 / 5.6 | AA-индекс уровня Sol вплотную к лидерам Anthropic; в рейтинге популярности Arena позиции будут иными | Экосистема инструментов и интеграция с продуктами широки; сначала пойми, что именно ты оптимизируешь |
| B | Grok 4.5 и др. | Часть подрейтингов для Agent/документов активнее | В главном общем рейтинге Text не обязательно первое место каждый день; если нужны сценарии вроде поиска в реальном времени — берите уровнем выше |
Китайские бизнес-сценарии и контролируемый открытый код
Не опирайтесь на майские баллы SuperCLUE. Смотрите на относительные позиции Qwen / Kimi / DeepSeek / GLM / Doubao в Arena, затем добавляйте свои бизнес-корпусы. Открытая модель «вторая в рейтинге» не означает «потянет в вашей серверной».
| Эшелон | Модель | Основание / ориентиры по рейтингам | Примечания |
|---|---|---|---|
| A | Qwen3.8-max / семейство Qwen3.7 | Топ-5 Arena Overall (голосов мало, ценность ограничена) | Обычный дефолт для китайских продуктов; Preliminary не стоит принимать за окончательный вывод |
| A | Kimi K3 | Открытые веса + сильные позиции в кодинг-рейтингах | ... |
| ... | DeepSeek V4 Pro / Flash | Arena ≈1458; AA max ≈44 | MIT, низкая цена, приватное развёртывание возможно — сравнивают по «пропускной способности на доллар»; закрытый S — не бесплатная замена |
| B | GLM-5.x, MiMo, Doubao / Seed и др. | В Arena можно набить рейтинг | Совместимость с локальными API и нижняя планка по стоимости; перед апгрейдом до S прогоните хотя бы один цикл на своём корпусе: тикеты, переписка поддержки, договоры. |
Вызов инструментов и агентная направленность
AA Intelligence Index присваивает agentic-задачам больший вес; Computer-use / многошаговые цепочки инструментов — ключевой акцент в продуктах Anthropic. Конкретные суб-баллы независимо не перепроверяли, поэтому проценты здесь выдумывать не будем. Самый частый провал — принимать «демка работает» за «вывезет в проде».
| Тир | Модель | Основание / отсылки к лидербордам | Примечания |
|---|---|---|---|
| S | Claude Opus 5 / Fable 5 | У верхней границы индекса AA (Opus 5-max ≈61; Fable ≈60) | Кандидат по умолчанию для многошагового тулчейна; без независимой сверки подоценок проценты не выдумываем |
| A | GPT-5.6 Sol | Индекс и позиции в harness идут вплотную | Если стек OpenAI agent / Codex уже есть — приоритет параллельному тестированию |
| A | Kimi K3 | 浏览、前端交付与开源可控 | 需要自托管 agent 栈时很有竞争力 |
| B | 价低的 Flash / Luna / 开源小档 | 成本与吞吐导向 | 适合路由层、预分类、高并发粗加工,不适合当唯一生产默认 |
读榜时容易踩的五个坑
- Стилевые предпочтения не говорят о правильности:Arena — это слепой человеческий выбор «какой вариант нравится больше». Модель с приятным тоном и красивой вёрсткой не обязательно лидирует в задачах, требующих строгих рассуждений.
- Предварительные результаты и широкие доверительные интервалы:У моделей с небольшим числом голосов (например, у некоторых новых позиций max всего по несколько тысяч голосов) рейтинг может прыгать на три места за день. Если видите интервал ±15–20, считайте, что голоса ещё копятся, а позиция нестабильна.
- Загрязнение данных и натаскивание на тестах:Публичные статические бенчмарки (MMLU-Pro, GPQA и т.п.) каждый год критикуют за загрязнение; скриншоты «идеального результата» без даты и описания воспроизводимости мы просто игнорируем.
- Закрытый API — это не то же самое, что версия в чате:У одного и того же бренда chat-latest, thinking, max effort и codex-harness — разные строки в рейтинге. Если в контракте на закупку указан не тот тариф, это всё равно что купить другую модель.
- Скрытая цена открытых весов:У таких сверхбольших MoE, как K3, объём весов и расходы на многомашинный инференс превращают «второе место в рейтинге» в «модель, которую серверная не потянет». DeepSeek и GLM, наоборот, могут оказаться более S-тировыми с точки зрения внедряемости.
Переделка нашей версии через шаблон
Выше — редакционное мнение гик-команды OBPAI. Шаблон «Сводный тир-лист возможностей больших языковых моделей (LLM)» (ID 1785671363439) содержит перетаскиваемые блоки — вы можете сами переставить их и собрать рейтинг моделей, который считаете правильным.
互动体验:拖拽排位《Тир-лист LLM》
Тир-лист LLM
Шаги по встраиванию — см. Как встроить интерактивный тир-лист。
Как читать публичный рейтинг в начале августа
В начале августа 2026-го: в общем топе популярности по-прежнему впереди сплошной Anthropic; по индексу синтетического интеллекта Opus 5, Fable 5 и GPT-5.6 Sol идут вплотную; в зачёте по сдаче кода и Kimi K3, и Opus 5 требуют серьёзного A/B. При выборе сначала определите сценарий — кодинг, длинные тексты, китайский или агент — и только потом решайте, готовы ли мириться с закрытым кодом и счётом. Рейтинг обновляется каждую неделю, так что ориентируйтесь на ту лестницу, которую сами вытащили.
Тир-лист LLM
想打造自己的个性化天梯图并开放给读者嵌入吗?