返回博客列表
Гик-команда OBPAI2026/8/436 阅读

Сводный рейтинг больших языковых моделей 2026

На основе открытых данных Arena по состоянию на 2026-08-01 и публичных данных Artificial Analysis за последние месяцы выставляем оценки S/A/B по сценариям: кодинг, длинный контекст, китайские/открытые модели, агенты. В комплекте — редактируемый перетаскиваемый шаблон LLM-тир-листа.

Большие языковые моделиLLM-тир-листрейтинг Arenaвыбор моделиИИ
Сводный рейтинг больших языковых моделей 2026 - 天梯图与数据榜单

Как ранжировали

Данные актуальны на 2026-08-05По сценариям — кодинг, длинные тексты, китайские/открытые модели, агенты — выставлены оценки S/A/B. Основные источники: снимок Arena (arena.ai) от 1 августа 2026 года и индекс Artificial Analysis Intelligence. Публичные цифры — в таблице ниже.

Пояснение к источникам

Arena и Artificial Analysis по-разному взвешивают результаты, поэтому позиции в рейтингах могут не совпадать; публичные цифры приведены ниже.

ИсточникМодель / уровеньПубличные цифры (приблизительно)Как читать
Arena Text OverallClaude Fable 51509±6 Elo, №1 в общем зачётеВершина общего рейтинга популярности
Arena Text OverallClaude Opus 4.6 / 4.7 (thinking)примерно 1505 / 1502следом идёт; не-thinking версия того же поколения тоже держится рядом с топ-10
Arena Text OverallQwen3.8-max1496±10 (Preliminary)проходит в общий топ-5; голосов мало, интервал широкий — расцениваем как сигнал роста
Arena Text OverallGemini 3 / 3.1 Pro Preview, Kimi K3-max и GPT-5.6 Sol (xhigh)примерно 1483–1486доверительные интервалы сильно перекрываются, жёстко ранжировать не стоит
Arena Text OverallDeepSeek V4 Proоколо 1458 Eloдо лидеров среди закрытых моделей пока далеко; цена и самохостинг — отдельный разговор
AA Intelligence IndexClaude Opus 5 (max)≈61вблизи вершины сводного индекса
AA Intelligence IndexOpus 5 (xhigh), Claude Fable 5Fable ≈60Вплотную за Opus max
AA Intelligence IndexGPT-5.6 Sol (max)≈59Вплотную к первой линии Anthropic
AA Intelligence IndexKimi K3 (max) / DeepSeek V4 Pro (max)≈57 / ≈44В лагере open-source разрыв очевиден

Июльское дополнение: Kimi K3 вышел и открыл исходный код, семейство GPT-5.6 постепенно заходит в Arena — голосов мало, позиции неустойчивы. Для китайских моделей не переносим старые баллы SuperCLUE 2026-05, а смотрим на относительные позиции Qwen / Kimi / DeepSeek / GLM / Doubao в Arena.

Разбивка по сценариям на S / A / B

Разбивка по уровням — редакционное мнение, официально не подтверждено:

  • S:В этом сценарии и публичные лидерборды, и наш повседневный опыт достаточно надежны: модели можно смело рассматривать как основных кандидатов по умолчанию.
  • A:...
  • B:Работать может, подходит как запасной вариант или для отдельных задач; одного скриншота недостаточно, чтобы сделать её единственной моделью по умолчанию во всей компании.

Ниже четыре таблицы, разбитые по сценариям. «Обоснование» только повторяет сигналы Arena / AA из текста выше и логику редакционной разбивки по категориям, без выдумывания новых бенчмарк-баллов.

Кодинг и сдача фронтенда

В Arena Code/WebDev Overall (Aug 1) Opus 5-max примерно 1705 лидирует по Elo; Kimi K3-max примерно 1676; Qwen3.8-max WebDev — около 1668 (Preliminary); GPT-5.6 Sol — около 1620. В под-рейтинге Text Coding Fable 5 примерно 1553±9всё ещё в первом тире. Место в WebDev не означает «первый во всём»

ТирМодельОснование / сигналы рейтингаПримечания
SClaude Opus 5 (max/high)WebDev Overall ≈1705 — первое местоОсновной кандидат для работы по умолчанию; обратите внимание: max/high и уровень в чат-окне — это не одно и то же
SClaude Fable 5WebDev — топ-5; Text Coding ≈1553±9Субрейтинги практического кодинга и популярности — оба заслуживают доверия
Между S и AKimi K3-maxWebDev ≈1676; в субрейтинге Fullstack обходил целый ряд закрытых флагмановФронтенд-задачи и переделка страниц — в первую очередь для A/B; не считайте его первым в общем зачёте
AGPT-5.6 Sol (xhigh, с обвязкой Codex)WebDev ≈1620Если команда уже работает на стеке OpenAI — сначала A/B, прежнюю модель по умолчанию менять прямо сейчас не обязательно
AQwen3.8-maxWebDev ≈1668 (предварительно)Мало голосов, ценность ограничена; команды, использующие Tongyi, могут попробовать параллельно
BGLM-5.2-maxWebDev — виден в топ-15Совместимость с китайскими API и предсказуемые расходы
BDeepSeek V4 Flash / Pro — серияОбщий рейтинг и инженерные затратыДёшево, можно развернуть самостоятельно под MIT; пока закрытые флагманы всё ещё стабильнее — использовать как базовый слой для трафика

Длинный контекст: написание текстов, обзоры и мультимодальная помощь в чтении

В таких популярных категориях, как Overall, Creative Writing, Instruction Following, семейство Claude традиционно впереди; у Gemini / GPT свои преимущества в длинном контексте, мультимодальности и интеграции с продуктами. Перед выбором чётко определитесь: вы оптимизируете «впечатление от слепого теста» или «процент выполнения задач».

ТирМодельОснование / данные лидербордовПримечание
SClaude Fable 5 / линейка Opus 4.x–5Overall и категории популярности «письмо/следование инструкциям» — в верхних строчкахРедактура длинных текстов, правка по регламенту, меньше «приторных штампов» — блок о впечатлениях помечен как редакционное мнение
AGemini 3 / 3.1 Pro PreviewText Overall — в районе 1483–1486Длинный контекст и потоки мультимодальных документов — частые заявленные преимущества
AGemini 3.5 / 3.6 FlashТа же линейка FlashБыстрая и дешёвая модель для черновиков — часто разумнее, чем Pro
AСемейство GPT-5.5 / 5.6AA-индекс уровня Sol вплотную к лидерам Anthropic; в рейтинге популярности Arena позиции будут инымиЭкосистема инструментов и интеграция с продуктами широки; сначала пойми, что именно ты оптимизируешь
BGrok 4.5 и др.Часть подрейтингов для Agent/документов активнееВ главном общем рейтинге Text не обязательно первое место каждый день; если нужны сценарии вроде поиска в реальном времени — берите уровнем выше

Китайские бизнес-сценарии и контролируемый открытый код

Не опирайтесь на майские баллы SuperCLUE. Смотрите на относительные позиции Qwen / Kimi / DeepSeek / GLM / Doubao в Arena, затем добавляйте свои бизнес-корпусы. Открытая модель «вторая в рейтинге» не означает «потянет в вашей серверной».

ЭшелонМодельОснование / ориентиры по рейтингамПримечания
AQwen3.8-max / семейство Qwen3.7Топ-5 Arena Overall (голосов мало, ценность ограничена)Обычный дефолт для китайских продуктов; Preliminary не стоит принимать за окончательный вывод
AKimi K3Открытые веса + сильные позиции в кодинг-рейтингах...
...DeepSeek V4 Pro / FlashArena ≈1458; AA max ≈44MIT, низкая цена, приватное развёртывание возможно — сравнивают по «пропускной способности на доллар»; закрытый S — не бесплатная замена
BGLM-5.x, MiMo, Doubao / Seed и др.В Arena можно набить рейтингСовместимость с локальными API и нижняя планка по стоимости; перед апгрейдом до S прогоните хотя бы один цикл на своём корпусе: тикеты, переписка поддержки, договоры.

Вызов инструментов и агентная направленность

AA Intelligence Index присваивает agentic-задачам больший вес; Computer-use / многошаговые цепочки инструментов — ключевой акцент в продуктах Anthropic. Конкретные суб-баллы независимо не перепроверяли, поэтому проценты здесь выдумывать не будем. Самый частый провал — принимать «демка работает» за «вывезет в проде».

ТирМодельОснование / отсылки к лидербордамПримечания
SClaude Opus 5 / Fable 5У верхней границы индекса AA (Opus 5-max ≈61; Fable ≈60)Кандидат по умолчанию для многошагового тулчейна; без независимой сверки подоценок проценты не выдумываем
AGPT-5.6 SolИндекс и позиции в harness идут вплотнуюЕсли стек OpenAI agent / Codex уже есть — приоритет параллельному тестированию
AKimi K3浏览、前端交付与开源可控需要自托管 agent 栈时很有竞争力
B价低的 Flash / Luna / 开源小档成本与吞吐导向适合路由层、预分类、高并发粗加工,不适合当唯一生产默认

读榜时容易踩的五个坑

  1. Стилевые предпочтения не говорят о правильности:Arena — это слепой человеческий выбор «какой вариант нравится больше». Модель с приятным тоном и красивой вёрсткой не обязательно лидирует в задачах, требующих строгих рассуждений.
  2. Предварительные результаты и широкие доверительные интервалы:У моделей с небольшим числом голосов (например, у некоторых новых позиций max всего по несколько тысяч голосов) рейтинг может прыгать на три места за день. Если видите интервал ±15–20, считайте, что голоса ещё копятся, а позиция нестабильна.
  3. Загрязнение данных и натаскивание на тестах:Публичные статические бенчмарки (MMLU-Pro, GPQA и т.п.) каждый год критикуют за загрязнение; скриншоты «идеального результата» без даты и описания воспроизводимости мы просто игнорируем.
  4. Закрытый API — это не то же самое, что версия в чате:У одного и того же бренда chat-latest, thinking, max effort и codex-harness — разные строки в рейтинге. Если в контракте на закупку указан не тот тариф, это всё равно что купить другую модель.
  5. Скрытая цена открытых весов:У таких сверхбольших MoE, как K3, объём весов и расходы на многомашинный инференс превращают «второе место в рейтинге» в «модель, которую серверная не потянет». DeepSeek и GLM, наоборот, могут оказаться более S-тировыми с точки зрения внедряемости.

Переделка нашей версии через шаблон

Выше — редакционное мнение гик-команды OBPAI. Шаблон «Сводный тир-лист возможностей больших языковых моделей (LLM)» (ID 1785671363439) содержит перетаскиваемые блоки — вы можете сами переставить их и собрать рейтинг моделей, который считаете правильным.

互动体验:拖拽排位《Тир-лист LLM

Тир-лист LLM

Unranked pool(0)
All items have been ranked!

Шаги по встраиванию — см. Как встроить интерактивный тир-лист

Как читать публичный рейтинг в начале августа

В начале августа 2026-го: в общем топе популярности по-прежнему впереди сплошной Anthropic; по индексу синтетического интеллекта Opus 5, Fable 5 и GPT-5.6 Sol идут вплотную; в зачёте по сдаче кода и Kimi K3, и Opus 5 требуют серьёзного A/B. При выборе сначала определите сценарий — кодинг, длинные тексты, китайский или агент — и только потом решайте, готовы ли мириться с закрытым кодом и счётом. Рейтинг обновляется каждую неделю, так что ориентируйтесь на ту лестницу, которую сами вытащили.

榜单开放与生成

Тир-лист LLM

想打造自己的个性化天梯图并开放给读者嵌入吗?

全屏高清制作
文章来源:OBPAI TierList