דלג לתוכן העיקרי
WhaleBiz Logo

Сравнение ведущих AI-моделей: состояние на сентябрь 2026 | WhaleBiz

19.12.2025
Обновлено: 15.09.2026
11 мин. чтения
Таблица сравнения ведущих AI-моделей: GPT, Claude, Gemini

Гонка за лучшим AI: состояние на сентябрь 2026

Предыдущая редакция этого материала описывала расстановку сил на апрель 2026. За пять месяцев она сменилась целиком: почти все модели, которые тогда были флагманами, сегодня стали предыдущим поколением. Это само по себе главный вывод статьи, и ниже мы объясним, почему перестали публиковать таблицы с баллами.

Вот что изменилось у трёх основных поставщиков.

Anthropic Claude: семейство Claude 5

Линейка Claude 4.6 и 4.8, о которой шла речь весной, сменилась семейством Claude 5. Актуальный состав:

  • Claude Fable 5.1 и Claude Fable 5 - самый способный из широко доступных уровней, для сложных рассуждений и длинных агентных задач. Окно 1 млн токенов, 10 и 50 долларов за миллион входных и выходных токенов.
  • Claude Opus 5 - рабочий флагман. Окно 1 млн токенов, 5 и 25 долларов за миллион. Линейка Opus 4.8, 4.7 и 4.6 продолжает обслуживаться по той же цене.
  • Claude Sonnet 5 - баланс качества и цены. Окно 1 млн токенов, 2 и 10 долларов за миллион, заметно дешевле Sonnet 4.6 с его 3 и 15.
  • Claude Haiku 4.5 - самый дешёвый уровень: окно 200 тысяч токенов, 1 и 5 долларов за миллион.

Важнее ценника изменение в том, как этими моделями управляют. Фиксированный «бюджет на размышление» (budget_tokens) в семействе Claude 5 убран, вместо него адаптивное мышление и уровень усилий (effort) от низкого до максимального. Практический смысл для бизнеса простой: на одной и той же модели теперь можно осознанно экономить на простых задачах и доплачивать только там, где цена ошибки высока.

OpenAI GPT: GPT-6 Astra и семейство GPT-5.6

Весной флагманом был GPT-5.4. К сентябрю 2026 картина другая. В июле 2026 вышло семейство GPT-5.6 из трёх линеек: Sol (флагманская), Terra (баланс качества и стоимости) и Luna (самая дешёвая), плюс специализированная GPT-5.6 Cyber для задач кибербезопасности. Сверху над ними стоит GPT-6 Astra, который в официальной документации описан как самая способная модель компании для сквозных задач.

Все эти линейки работают с контекстным окном около 1,05 млн токенов. Отдельно стоит отметить динамику цен: в конце июля 2026 OpenAI снизила стоимость Luna на 80% и Terra на 20%, а в конце августа на время снизила цену Sol более чем на 20%. Для бизнеса это прямой сигнал: расчёт окупаемости, сделанный весной, к осени уже неверен, и его стоит пересчитать.

Google Gemini: Pro и Flash разошлись по номерам

У Google произошло то, чего не было раньше: линейки Pro и Flash перестали двигаться вместе. На сентябрь 2026 в каталоге Google DeepMind:

  • Gemini 3.8 Flash - основная рабочая лошадка для агентных задач в большом масштабе, плюс специализированная Gemini 3.8 Flash Cyber.
  • Gemini 3.5 Flash-Lite - для высокообъёмных и экономных сценариев.
  • Gemini 3.1 Pro - для сложных задач, и Gemini 3.1 Deep Think для научных и исследовательских.
  • Отдельные мультимодальные модели: Gemini Omni (работа с видео), Gemini Audio, Gemini Embedding 2 и генератор изображений Gemini Image (Nano Banana).

Google обещает Gemini 3.5 Pro, и для Flash 3.7 и 3.8 действует вводная цена, которая истекает 31 декабря 2026 года. Последнее стоит держать в голове при планировании бюджета на следующий год.

Хотите проконсультироваться?

Мы поможем вам выбрать, создать и внедрить идеальное AI-решение для вашего бизнеса. Оставьте контакты, и мы вам перезвоним.

Таблица: что чем отличается на практике

Здесь только те параметры, которые меняются медленно и на которые можно опираться при выборе. Цены указаны за миллион токенов, вход и выход, по прайс-листу поставщика и без учёта скидок за кеширование и пакетную обработку.

МодельОкно контекстаЦена вход/выходТипичная роль
Claude Fable 5.11 млн$10 / $50самые сложные рассуждения, длинные агентные задачи
Claude Opus 51 млн$5 / $25рабочий флагман, сложные диалоги и документы
Claude Sonnet 51 млн$2 / $10баланс цены и качества на потоке
Claude Haiku 4.5200 тыс.$1 / $5массовые простые задачи
GPT-6 Astra~1,05 млнсм. прайс OpenAIсквозные многошаговые задачи
GPT-5.6 Sol / Terra / Luna~1,05 млнсм. прайс OpenAIфлагман / баланс / экономия
Gemini 3.8 Flashсм. каталог Googleвводная цена до 31.12.2026агентные задачи в масштабе
Gemini 3.1 Pro / Deep Thinkсм. каталог Googleсм. прайс Googleсложное рассуждение, исследования

Почему мы убрали из статьи баллы по бенчмаркам

В прошлой редакции здесь стояла подробная таблица с процентами по SWE-bench, GPQA Diamond, AIME и Humanity's Last Exam. Мы её убрали сознательно, и вот почему.

За пять месяцев между редакциями каждая из трёх лабораторий выпустила по новому поколению. Любая зафиксированная в тексте цифра живёт недели, а статья в поиске - годы. В итоге читатель принимает решение на прошлогодних данных и думает, что смотрит на актуальные. Для материала, который люди находят в Google через полтора года после публикации, это не мелкая неточность, а прямая дезинформация.

Что живёт дольше и на что стоит опираться: состав линеек, размер контекстного окна, опубликованная цена и профиль задачи, под который модель сделана. Это в статье есть. За свежими баллами имеет смысл идти на живой лидерборд вроде LMArena и в официальную документацию поставщиков, ссылки на которую собраны в конце.

Открытые модели: когда они имеют смысл

За 2026 год открытые веса заметно подтянулись. DeepSeek выпустила семейство V4, Meta развивает Llama 4, активны Qwen и Mistral. Практический смысл для бизнеса не в том, чтобы догнать флагман по баллам, а в двух вещах: данные не покидают вашу инфраструктуру, и стоимость запроса не зависит от прайс-листа чужой компании.

Плата за это тоже понятная. Железо, эксплуатация, обновления и безопасность становятся вашей задачей, а не задачей поставщика. Для клиники, юридической фирмы или финансовой компании с жёсткими требованиями к приватности этот размен часто оправдан. Для бизнеса, которому нужен работающий агент в WhatsApp за две недели, почти никогда.

Как выбрать модель под свою задачу

Правильный вопрос не «какая модель лучшая», а «какая модель дешевле всего доводит эту задачу до результата». Ниже практическая разбивка.

Для поддержки клиентов и чат-ботов

Берите быстрый и дешёвый уровень: Gemini Flash, GPT-5.6 Luna, Claude Haiku 4.5 или Sonnet 5. На массовом диалоговом трафике разница в цене токена превращается в реальные деньги, а разница в «интеллекте» на типовых вопросах о ценах и часах работы незаметна. Подробнее про архитектуру такого решения - на странице AI для поддержки.

Для сложных консультаций и работы с документами

Здесь оправдан флагман: Claude Opus 5, GPT-5.6 Sol или GPT-6 Astra, Gemini 3.1 Pro. Сценарий, в котором модель разбирает договор, сопоставляет несколько документов и отвечает за вывод, - как раз тот случай, когда цена ошибки выше разницы в цене токена.

Для программирования и агентных задач

Claude Opus 5 и Claude Fable 5.1, GPT-6 Astra, Gemini 3.8 Flash. Ключевой практический параметр здесь не балл в бенчмарке, а способность модели пройти длинную цепочку шагов, не потеряв контекст, и уровень усилий, который вы готовы оплатить.

Для жёстких требований к приватности

Открытые модели на своей инфраструктуре: DeepSeek, Llama, Qwen, Mistral. Дальше вопрос не модели, а архитектуры хранения и того, кто по закону является владельцем базы данных.

Для максимальной экономии

Самый дешёвый уровень у любого из трёх поставщиков плюс дисциплина на стороне приложения: кеширование постоянной части промпта, короткие ответы, отказ от того, чтобы гонять флагман на вопросе «во сколько вы открываетесь».

Что из «трендов 2026» действительно случилось

  • Автономные агенты для кода. Случилось. Это уже не демо, а рабочий инструмент, и все три поставщика продают отдельные линейки под агентные задачи.
  • Мультиагентные системы. Случилось. Оркестрация нескольких специализированных агентов вместо одного универсального стала стандартной архитектурой.
  • Нативная мультимодальность. Случилось. Отдельные модели под видео, аудио и изображения есть у каждого поставщика.
  • Адаптивное мышление вместо фиксированного бюджета. Случилось за 2026 год: управление глубиной рассуждения переехало с «сколько токенов потратить» на «насколько стараться».
  • Контекстные окна в миллион токенов. Случилось и перестало быть отличием: это теперь базовая характеристика верхних линеек, а не преимущество.

Отдельный сюжет - что всё это означает для экономики, где агенты начинают совершать действия друг с другом. Мы разбирали его в материале про экономику виртуальных агентов.

Почему мы не привязываемся к одной модели

Практический вывод из всей статьи один. Между двумя редакциями этого материала расстановка сил сменилась полностью, и это будет повторяться. Решение, жёстко привязанное к конкретной модели конкретного поставщика, устаревает вместе с ней и требует переписывания.

Мы в WhaleBiz строим агентов так, чтобы модель под конкретную задачу менялась без переделки решения: дешёвая и быстрая на массовый диалог, сильная на сложное рассуждение и документы. Клиент при этом не платит за слабые места одного поставщика ради его сильных сторон.

Если вы выбираете, на чём строить своего агента, и хотите обсудить конкретную задачу, а не абстрактный рейтинг, напишите нам.

Часто задаваемые вопросы

Какая AI-модель выгоднее всего для поддержки клиентов и чат-ботов?

Для массового диалогового трафика считают не «кто умнее», а цену за обработанный разговор при приемлемом качестве. В сентябре 2026 в этой роли обычно оказываются быстрые и дешёвые линейки: Gemini 3.8 Flash и 3.5 Flash-Lite у Google, GPT-5.6 Luna у OpenAI, Claude Haiku 4.5 и Claude Sonnet 5 у Anthropic. Флагман ставят только на те сценарии, где ошибка дороже разницы в цене токена.

В чём практическая разница между окном в 200 тысяч и в миллион токенов?

Окно определяет, сколько материала модель держит перед глазами в одном запросе, без поиска по базе. На 200 тысячах токенов помещается большая база знаний или длинный разговор, на миллионе - несколько документов целиком, история переписки за месяцы или крупный репозиторий. Для агента поддержки окно редко бывает узким местом: там важнее качество извлечения нужного куска, чем возможность загрузить всё сразу.

Зачем бизнесу открытые модели вроде DeepSeek, Llama или Qwen?

Открытые веса можно развернуть на своей инфраструктуре и не отправлять данные внешнему провайдеру. Это главный аргумент там, где требования к приватности жёсткие: медицина, право, финансы. Разрыв с закрытыми флагманами за 2026 год заметно сократился, но появляется своя цена: железо, эксплуатация и обновления становятся вашей задачей.

Почему в статье нет таблицы с баллами по бенчмаркам?

Потому что она устаревает быстрее, чем статья успевает выйти. Крупные лаборатории выпускают новые версии каждые несколько недель, и зафиксированные в тексте цифры через месяц вводят читателя в заблуждение. Названия линеек, размеры контекстных окон и опубликованные цены живут дольше, поэтому в статье они, а за свежими баллами имеет смысл идти на живой лидерборд.

Почему WhaleBiz не привязывается к одной AI-модели?

Потому что оптимальная модель зависит от задачи, а расстановка сил меняется каждые несколько месяцев. Мы держим агентов так, чтобы модель под конкретную задачу можно было заменить без переписывания решения: быструю и дешёвую на массовый диалог, более сильную на сложное рассуждение и работу с документами. Привязка к одному поставщику означает, что вы платите за его слабые места вместе с сильными.

Источники

Michael Romm

Michael Romm

Михаил - основатель и CEO WhaleBiz, руководит бизнес- и маркетинговой стратегией. Эксперт в области данных (SQL, Python) и разработки решений по автоматизации и AI для бизнеса.

Понравилась статья? Поделитесь!