Сравнение ведущих AI-моделей: состояние на сентябрь 2026 | WhaleBiz

Гонка за лучшим AI: состояние на сентябрь 2026
Предыдущая редакция этого материала описывала расстановку сил на апрель 2026. За пять месяцев она сменилась целиком: почти все модели, которые тогда были флагманами, сегодня стали предыдущим поколением. Это само по себе главный вывод статьи, и ниже мы объясним, почему перестали публиковать таблицы с баллами.
Вот что изменилось у трёх основных поставщиков.
Anthropic Claude: семейство Claude 5
Линейка Claude 4.6 и 4.8, о которой шла речь весной, сменилась семейством Claude 5. Актуальный состав:
- Claude Fable 5.1 и Claude Fable 5 - самый способный из широко доступных уровней, для сложных рассуждений и длинных агентных задач. Окно 1 млн токенов, 10 и 50 долларов за миллион входных и выходных токенов.
- Claude Opus 5 - рабочий флагман. Окно 1 млн токенов, 5 и 25 долларов за миллион. Линейка Opus 4.8, 4.7 и 4.6 продолжает обслуживаться по той же цене.
- Claude Sonnet 5 - баланс качества и цены. Окно 1 млн токенов, 2 и 10 долларов за миллион, заметно дешевле Sonnet 4.6 с его 3 и 15.
- Claude Haiku 4.5 - самый дешёвый уровень: окно 200 тысяч токенов, 1 и 5 долларов за миллион.
Важнее ценника изменение в том, как этими моделями управляют. Фиксированный «бюджет на размышление» (budget_tokens) в семействе Claude 5 убран, вместо него адаптивное мышление и уровень усилий (effort) от низкого до максимального. Практический смысл для бизнеса простой: на одной и той же модели теперь можно осознанно экономить на простых задачах и доплачивать только там, где цена ошибки высока.
OpenAI GPT: GPT-6 Astra и семейство GPT-5.6
Весной флагманом был GPT-5.4. К сентябрю 2026 картина другая. В июле 2026 вышло семейство GPT-5.6 из трёх линеек: Sol (флагманская), Terra (баланс качества и стоимости) и Luna (самая дешёвая), плюс специализированная GPT-5.6 Cyber для задач кибербезопасности. Сверху над ними стоит GPT-6 Astra, который в официальной документации описан как самая способная модель компании для сквозных задач.
Все эти линейки работают с контекстным окном около 1,05 млн токенов. Отдельно стоит отметить динамику цен: в конце июля 2026 OpenAI снизила стоимость Luna на 80% и Terra на 20%, а в конце августа на время снизила цену Sol более чем на 20%. Для бизнеса это прямой сигнал: расчёт окупаемости, сделанный весной, к осени уже неверен, и его стоит пересчитать.
Google Gemini: Pro и Flash разошлись по номерам
У Google произошло то, чего не было раньше: линейки Pro и Flash перестали двигаться вместе. На сентябрь 2026 в каталоге Google DeepMind:
- Gemini 3.8 Flash - основная рабочая лошадка для агентных задач в большом масштабе, плюс специализированная Gemini 3.8 Flash Cyber.
- Gemini 3.5 Flash-Lite - для высокообъёмных и экономных сценариев.
- Gemini 3.1 Pro - для сложных задач, и Gemini 3.1 Deep Think для научных и исследовательских.
- Отдельные мультимодальные модели: Gemini Omni (работа с видео), Gemini Audio, Gemini Embedding 2 и генератор изображений Gemini Image (Nano Banana).
Google обещает Gemini 3.5 Pro, и для Flash 3.7 и 3.8 действует вводная цена, которая истекает 31 декабря 2026 года. Последнее стоит держать в голове при планировании бюджета на следующий год.
Хотите проконсультироваться?
Мы поможем вам выбрать, создать и внедрить идеальное AI-решение для вашего бизнеса. Оставьте контакты, и мы вам перезвоним.
Таблица: что чем отличается на практике
Здесь только те параметры, которые меняются медленно и на которые можно опираться при выборе. Цены указаны за миллион токенов, вход и выход, по прайс-листу поставщика и без учёта скидок за кеширование и пакетную обработку.
| Модель | Окно контекста | Цена вход/выход | Типичная роль |
|---|---|---|---|
| Claude Fable 5.1 | 1 млн | $10 / $50 | самые сложные рассуждения, длинные агентные задачи |
| Claude Opus 5 | 1 млн | $5 / $25 | рабочий флагман, сложные диалоги и документы |
| Claude Sonnet 5 | 1 млн | $2 / $10 | баланс цены и качества на потоке |
| Claude Haiku 4.5 | 200 тыс. | $1 / $5 | массовые простые задачи |
| GPT-6 Astra | ~1,05 млн | см. прайс OpenAI | сквозные многошаговые задачи |
| GPT-5.6 Sol / Terra / Luna | ~1,05 млн | см. прайс OpenAI | флагман / баланс / экономия |
| Gemini 3.8 Flash | см. каталог Google | вводная цена до 31.12.2026 | агентные задачи в масштабе |
| Gemini 3.1 Pro / Deep Think | см. каталог Google | см. прайс Google | сложное рассуждение, исследования |
Почему мы убрали из статьи баллы по бенчмаркам
В прошлой редакции здесь стояла подробная таблица с процентами по SWE-bench, GPQA Diamond, AIME и Humanity's Last Exam. Мы её убрали сознательно, и вот почему.
За пять месяцев между редакциями каждая из трёх лабораторий выпустила по новому поколению. Любая зафиксированная в тексте цифра живёт недели, а статья в поиске - годы. В итоге читатель принимает решение на прошлогодних данных и думает, что смотрит на актуальные. Для материала, который люди находят в Google через полтора года после публикации, это не мелкая неточность, а прямая дезинформация.
Что живёт дольше и на что стоит опираться: состав линеек, размер контекстного окна, опубликованная цена и профиль задачи, под который модель сделана. Это в статье есть. За свежими баллами имеет смысл идти на живой лидерборд вроде LMArena и в официальную документацию поставщиков, ссылки на которую собраны в конце.
Открытые модели: когда они имеют смысл
За 2026 год открытые веса заметно подтянулись. DeepSeek выпустила семейство V4, Meta развивает Llama 4, активны Qwen и Mistral. Практический смысл для бизнеса не в том, чтобы догнать флагман по баллам, а в двух вещах: данные не покидают вашу инфраструктуру, и стоимость запроса не зависит от прайс-листа чужой компании.
Плата за это тоже понятная. Железо, эксплуатация, обновления и безопасность становятся вашей задачей, а не задачей поставщика. Для клиники, юридической фирмы или финансовой компании с жёсткими требованиями к приватности этот размен часто оправдан. Для бизнеса, которому нужен работающий агент в WhatsApp за две недели, почти никогда.
Как выбрать модель под свою задачу
Правильный вопрос не «какая модель лучшая», а «какая модель дешевле всего доводит эту задачу до результата». Ниже практическая разбивка.
Для поддержки клиентов и чат-ботов
Берите быстрый и дешёвый уровень: Gemini Flash, GPT-5.6 Luna, Claude Haiku 4.5 или Sonnet 5. На массовом диалоговом трафике разница в цене токена превращается в реальные деньги, а разница в «интеллекте» на типовых вопросах о ценах и часах работы незаметна. Подробнее про архитектуру такого решения - на странице AI для поддержки.
Для сложных консультаций и работы с документами
Здесь оправдан флагман: Claude Opus 5, GPT-5.6 Sol или GPT-6 Astra, Gemini 3.1 Pro. Сценарий, в котором модель разбирает договор, сопоставляет несколько документов и отвечает за вывод, - как раз тот случай, когда цена ошибки выше разницы в цене токена.
Для программирования и агентных задач
Claude Opus 5 и Claude Fable 5.1, GPT-6 Astra, Gemini 3.8 Flash. Ключевой практический параметр здесь не балл в бенчмарке, а способность модели пройти длинную цепочку шагов, не потеряв контекст, и уровень усилий, который вы готовы оплатить.
Для жёстких требований к приватности
Открытые модели на своей инфраструктуре: DeepSeek, Llama, Qwen, Mistral. Дальше вопрос не модели, а архитектуры хранения и того, кто по закону является владельцем базы данных.
Для максимальной экономии
Самый дешёвый уровень у любого из трёх поставщиков плюс дисциплина на стороне приложения: кеширование постоянной части промпта, короткие ответы, отказ от того, чтобы гонять флагман на вопросе «во сколько вы открываетесь».
Что из «трендов 2026» действительно случилось
- Автономные агенты для кода. Случилось. Это уже не демо, а рабочий инструмент, и все три поставщика продают отдельные линейки под агентные задачи.
- Мультиагентные системы. Случилось. Оркестрация нескольких специализированных агентов вместо одного универсального стала стандартной архитектурой.
- Нативная мультимодальность. Случилось. Отдельные модели под видео, аудио и изображения есть у каждого поставщика.
- Адаптивное мышление вместо фиксированного бюджета. Случилось за 2026 год: управление глубиной рассуждения переехало с «сколько токенов потратить» на «насколько стараться».
- Контекстные окна в миллион токенов. Случилось и перестало быть отличием: это теперь базовая характеристика верхних линеек, а не преимущество.
Отдельный сюжет - что всё это означает для экономики, где агенты начинают совершать действия друг с другом. Мы разбирали его в материале про экономику виртуальных агентов.
Почему мы не привязываемся к одной модели
Практический вывод из всей статьи один. Между двумя редакциями этого материала расстановка сил сменилась полностью, и это будет повторяться. Решение, жёстко привязанное к конкретной модели конкретного поставщика, устаревает вместе с ней и требует переписывания.
Мы в WhaleBiz строим агентов так, чтобы модель под конкретную задачу менялась без переделки решения: дешёвая и быстрая на массовый диалог, сильная на сложное рассуждение и документы. Клиент при этом не платит за слабые места одного поставщика ради его сильных сторон.
Если вы выбираете, на чём строить своего агента, и хотите обсудить конкретную задачу, а не абстрактный рейтинг, напишите нам.
Часто задаваемые вопросы
Какая AI-модель выгоднее всего для поддержки клиентов и чат-ботов?
Для массового диалогового трафика считают не «кто умнее», а цену за обработанный разговор при приемлемом качестве. В сентябре 2026 в этой роли обычно оказываются быстрые и дешёвые линейки: Gemini 3.8 Flash и 3.5 Flash-Lite у Google, GPT-5.6 Luna у OpenAI, Claude Haiku 4.5 и Claude Sonnet 5 у Anthropic. Флагман ставят только на те сценарии, где ошибка дороже разницы в цене токена.
В чём практическая разница между окном в 200 тысяч и в миллион токенов?
Окно определяет, сколько материала модель держит перед глазами в одном запросе, без поиска по базе. На 200 тысячах токенов помещается большая база знаний или длинный разговор, на миллионе - несколько документов целиком, история переписки за месяцы или крупный репозиторий. Для агента поддержки окно редко бывает узким местом: там важнее качество извлечения нужного куска, чем возможность загрузить всё сразу.
Зачем бизнесу открытые модели вроде DeepSeek, Llama или Qwen?
Открытые веса можно развернуть на своей инфраструктуре и не отправлять данные внешнему провайдеру. Это главный аргумент там, где требования к приватности жёсткие: медицина, право, финансы. Разрыв с закрытыми флагманами за 2026 год заметно сократился, но появляется своя цена: железо, эксплуатация и обновления становятся вашей задачей.
Почему в статье нет таблицы с баллами по бенчмаркам?
Потому что она устаревает быстрее, чем статья успевает выйти. Крупные лаборатории выпускают новые версии каждые несколько недель, и зафиксированные в тексте цифры через месяц вводят читателя в заблуждение. Названия линеек, размеры контекстных окон и опубликованные цены живут дольше, поэтому в статье они, а за свежими баллами имеет смысл идти на живой лидерборд.
Почему WhaleBiz не привязывается к одной AI-модели?
Потому что оптимальная модель зависит от задачи, а расстановка сил меняется каждые несколько месяцев. Мы держим агентов так, чтобы модель под конкретную задачу можно было заменить без переписывания решения: быструю и дешёвую на массовый диалог, более сильную на сложное рассуждение и работу с документами. Привязка к одному поставщику означает, что вы платите за его слабые места вместе с сильными.
Источники
- Anthropic, обзор моделей Claude и официальный прайс-лист Anthropic.
- OpenAI, каталог моделей в документации для разработчиков.
- Google DeepMind, каталог моделей Gemini.
- LMArena - живой лидерборд для сверки актуальных результатов.

Michael Romm
Михаил - основатель и CEO WhaleBiz, руководит бизнес- и маркетинговой стратегией. Эксперт в области данных (SQL, Python) и разработки решений по автоматизации и AI для бизнеса.