Текущие ИИ модели по состоянию на июль 2026 года

Июль 2026 года выдался насыщенным: за одну неделю вышли GPT-5.6, Grok 4.5 и Muse Spark 1.1, а Claude Fable 5 вернулся в строй после почти трёхнедельной паузы. Ниже - актуальные модели и агенты, о которых пойдёт речь:
- OpenAI: GPT-5.6 Sol, Terra, Luna; GPT-5.5; ChatGPT Work; ChatGPT Images 2.0; Codex
- Anthropic: Claude Fable 5, Opus 4.8, Sonnet 5; Claude Cowork
- Google: Gemini 3.1 Pro, Gemini 3.5 Flash; Gemini Spark; Veo 3.1
- xAI: Grok 4.5
- Meta: Muse Spark 1.1
- ByteDance: Seedream 5.0 Pro
- Alibaba: Qwen 3.7 Max (API); Qwen 3 235B-A22B, Qwen 3.5, Qwen 3.6 (open weights)
- Open-source: Llama 4 Scout и Maverick; DeepSeek V4, R1, V3; Mistral Large 3, Small 4; GLM-5, GLM-4.7; Gemma 3, Gemma 4 26B A4B; Phi-4; Kimi K2.6
Рынок флагманских моделей больше не сводится к «одному победителю» - у каждого семейства есть своя сильная сторона, и выбор зависит от задачи, бюджета и требований к контексту.

Коротко: что это значит для бизнеса
- Нет «одной лучшей» модели. Для рутинных задач (переписка, черновики, классификация) дешёвые модели вроде GPT-5.6 Luna или Qwen 3.7 Max стоят в разы меньше флагманов и справляются вполне достаточно.
- Для кода и агентов закладывайте бюджет выше. GPT-5.6 Sol и Claude Fable 5 дороже, но именно они тянут сложные многошаговые задачи. Тестируйте 2-3 варианта на своих задачах, а не выбирайте по рекламе вендора.
- Не привязывайтесь к одному вендору. Claude Fable 5 три недели была недоступна из-за экспортных ограничений США - у любого поставщика может случиться похожий сбой. Держите запасной вариант на другую модель или другого вендора.
- Open-source имеет смысл, если важны контроль над данными или большой объём обращений в месяц - но это требует своей серверной инфраструктуры, а не режима «включил и пользуешься».
- Считайте стоимость на задачу, а не цену за токен. Дешёвая модель с длинным ответом иногда обходится дороже дорогой модели с коротким.
Дальше - подробный разбор по каждому вендору с таблицами цен и разделы для тех, кто хочет разобраться в деталях (контекст, лицензии, self-hosting).
Общая картина рынка
К середине 2026 года сложилась устойчивая трёхполюсная структура:
- OpenAI - GPT-5.6 (Sol, Terra, Luna) и экосистема ChatGPT / Codex / ChatGPT Work
- Anthropic - Claude Fable 5, Opus 4.8, Sonnet 5 и агент Claude Cowork
- Google - Gemini 3.1 Pro, Gemini 3.5 Flash и агент Gemini Spark
Рядом с ними работают специализированные игроки: xAI (Grok 4.5), Meta (Muse Spark 1.1), ByteDance (Seedream 5.0 Pro для изображений), Alibaba (Qwen 3.7 Max). Параллельно зрелый open-source сегмент закрывает разрыв с закрытыми флагманами до нескольких пунктов на ключевых бенчмарках - Llama 4, Qwen 3.x, DeepSeek V4, Mistral Large 3 и GLM-5 уже пригодны для продакшена при self-hosting. Конкуренция сместилась из плоскости «кто умнее» в плоскость «кто эффективнее на конкретной задаче при приемлемой цене».
Ниже - актуальное состояние основных линеек по состоянию на 11 июля 2026 года.
OpenAI: семейство GPT-5.6
9 июля OpenAI открыла GPT-5.6 для всех пользователей. Модель стала дефолтной в ChatGPT после ограниченного preview, которое сопровождалось регуляторными проверками.
Три уровня в одном поколении
| Модель | Роль | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Sol | Флагман: код, агенты, сложные задачи | 1.05M | $5.00 | $30.00 |
| Terra | Баланс цены и качества | 1.05M | $2.50 | $15.00 |
| Luna | Быстрая и экономичная | 1.05M | $1.00 | $6.00 |
| GPT-5.5 | Предыдущий флагман, запасной вариант | 1M | $5.00 | $30.00 |
При input свыше 272K токенов у GPT-5.6 действует длинный контекст тариф: input x2, output x1.5 (Sol: $10 / $45 за 1M).
Sol позиционируется как лучшая coding-модель OpenAI: по Artificial Analysis Coding Agent Index (независимый рейтинг, сравнивающий coding-агентов на реальных задачах) она опережает Claude Fable 5 при меньшем расходе токенов и более низкой стоимости. Terra и Luna закрывают массовые сценарии - от повседневной переписки до фоновой автоматизации.
GPT-5.5 остаётся запасным вариантом там, где нужна проверенная стабильность. Sol в отдельных сценариях показывал повышенную «агентность», поэтому для продакшен-критичных задач имеет смысл тестировать обе версии.
ChatGPT Work
Вместе с GPT-5.6 анонсирован ChatGPT Work - агент для офисных задач: документы, таблицы, презентации, простые веб-приложения. Он объединяет возможности ChatGPT и Codex и конкурирует с Claude Cowork. Поддерживаются интеграции со Slack, Gmail, Google Drive, календарями и CRM. Для нетехнической команды разница между ChatGPT Work, Claude Cowork и Gemini Spark пока больше в экосистеме интеграций, чем в качестве результата - логично выбирать агента под уже используемый набор сервисов (Google Workspace, Slack и т. д.), а не наоборот.
Anthropic: Claude после паузы
1 июля Anthropic вернула Claude Fable 5 - флагман класса Mythos, снятый с линии 12 июня из-за экспортных ограничений США. Возвращение модели заметно изменило расклад в coding и длинных агентных сценариях.
Ключевые модели линейки
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Claude Fable 5 | Coding, длинные агентные сценарии | 1M | $10.00 | $50.00 |
| Claude Opus 4.8 | Ежедневная работа, корпоративный | 1M | $5.00 | $25.00 |
| Claude Sonnet 5 | Тексты, инструкции (intro до 31.08) | 1M | $2.00 | $10.00 |
С 1 сентября 2026 Claude Sonnet 5: $3.00 input / $15.00 output за 1M.
Claude Cowork - агент для совместной работы с файлами и приложениями, прямой ответ OpenAI на ChatGPT Work. Для команд, уже использующих Claude Code, Cowork логично дополняет стек разработки.
Google: Gemini 3.x
Google держит линейку в двух плоскостях - рассуждения и цена/производительность.
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Gemini 3.1 Pro | Сложные рассуждения, точность | 1M | $2.00 | $12.00 |
| Gemini 3.5 Flash | Цена/производительность, длинный контекст | 2M | $1.50 | $9.00 |
Выше 200K токенов у Gemini 3.1 Pro действует повышенный тариф: $4.00 input / $18.00 output за 1M.
У Gemini сильная сторона - длинный контекст и мультимодальность. Для анализа больших массивов документов, кодовых баз и смешанных данных (текст + изображения) это часто решающий аргумент.
Gemini Spark - агент Google, один из трёх наиболее заметных агентных продуктов лета 2026 года наряду с ChatGPT Work и Claude Cowork. Для компаний, уже работающих в Google Workspace, это самый низкий порог входа среди трёх.
xAI, Meta, ByteDance и Alibaba
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Grok 4.5 | Код, в реальном времени контекст X | 1M | $2.00 | $6.00 |
| Meta Muse Spark 1.1 | Доступный API среднего уровня | 256K | $1.25 | $4.25 |
| Qwen 3.7 Max | Рассуждения среднего уровня | 1M | $2.50 | $7.50 |
| Seedream 5.0 Pro | Генерация изображений | - | per image | per image |
Grok 4.5 сильна в связке с Cursor и задачах, где нужен актуальный контекст из X и веба. Qwen 3.7 Max - закрытые веса через Alibaba Cloud; open-source линейка Qwen описана ниже. Seedream 5.0 Pro биллится за изображение, не за токены.
Open-source модели
Открытые веса - отдельный слой рынка, который в 2026 году перестал быть «запасным вариантом для экспериментов». Ряд моделей сходятся с GPT-4-классом по коду и рассуждениям, а DeepSeek V4 и GLM-5.1 конкурируют с закрытыми флагманами в SWE-Bench (стандартный тест на реальных задачах программирования). Главные причины выбрать open-source: self-hosting, контроль данных, предсказуемая стоимость при высоком трафике и отсутствие зависимости от вендора.
Цены open-source моделей ниже - по OpenRouter на 11 июля 2026, где модели запускаются в облаке без развёртывания своего железа. Self-hosting по-прежнему возможен - тогда платить за каждый обработанный токен не нужно.
Meta: Llama 4
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Llama 4 Scout | RAG, большие архивы | 10M | $0.10 | $0.30 |
| Llama 4 Maverick | Универсальная | 1M | $0.15 | $0.60 |
Цены - OpenRouter. При self-hosting плата за токены не взимается, стоимость - только железо и электричество.
Лицензия Llama 4 Community накладывает ограничение на продукты с аудиторией свыше 700M MAU (monthly active users - ежемесячных активных пользователей) - для большинства B2B-проектов это не проблема, для крупных потребительских платформ нужна отдельная проверка.
Alibaba: Qwen (open weights)
Облачный Qwen 3.7 Max и open-source линейка - разные продукты. Для self-hosting актуальны:
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Qwen 3 235B-A22B | Рассуждения + код | 131K | $0.46 | $1.82 |
| Qwen 3.5-397B-A17B | Мультиязычность, наука | 256K | $0.39 | $2.45 |
| Qwen 3.6-35B-A3B | Один сервер, квантизация | 262K | $0.14 | $1.00 |
Qwen - самый частый выбор, когда нужен баланс качества, лицензии Apache 2.0 и поддержки в vLLM / Ollama / llama.cpp (популярные инструменты для запуска моделей на своих серверах).
DeepSeek
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| DeepSeek V4 Flash | Coding, agents, бюджет | 1M | $0.08 | $0.17 |
| DeepSeek V4 Pro | Сложные рассуждения | 1M | $0.44 | $0.87 |
| DeepSeek R1 | Математика, глубокие рассуждения | 164K | $0.70 | $2.50 |
| DeepSeek V3.2 | Универсальный запасной вариант | 131K | $0.21 | $0.32 |
На OpenRouter DeepSeek V4 Flash дешевле, чем через прямой API DeepSeek. Прямой API удваивает тарифы в пиковые часы (9:00-12:00 и 14:00-18:00 CST) с mid-July 2026.
Mistral AI
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Mistral Large 3 | Многоязычность, корпоративное использование | 262K | $0.50 | $1.50 |
| Mistral Small 4 | Production chat + tools | 262K | $0.15 | $0.60 |
Mistral выигрывает там, где важны permissive-лицензия без MAU-cap, европейская резидентность данных и зрелая экосистема деплоя.
Zhipu AI: GLM
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| GLM-5.1 | Agentic coding | 203K | $0.97 | $3.04 |
| GLM-4.7 | Coding workflows | 203K | $0.40 | $1.75 |
Google и Microsoft: компактные модели
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Gemma 3 27B | Одна GPU | 131K | $0.08 | $0.16 |
| Gemma 4 26B A4B | Math + coding | 262K | $0.06 | $0.33 |
| Phi-4 | Edge, laptop | 16K | $0.07 | $0.14 |
Kimi K2.6
| Модель | Назначение | Контекст | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Kimi K2.6 | Agentic coding | 262K | $0.66 | $3.41 |
Kimi K2.6 (Moonshot AI) - модель с открытыми весами с упором на агентный coding и длинные сессии разработки. Часто упоминается рядом с DeepSeek V4 и GLM-5 как top-tier для автономных coding-агентов.
Сравнение open-source флагманов
| Модель | Сильная сторона | Контекст | Input / 1M | Output / 1M | Лицензия |
|---|---|---|---|---|---|
| Qwen 3 235B-A22B | Рассуждения + код | 131K | $0.46 | $1.82 | Apache 2.0 |
| DeepSeek V4 Flash | Coding + agents | 1M | $0.08 | $0.17 | MIT |
| DeepSeek V4 Pro | Сложные рассуждения | 1M | $0.44 | $0.87 | MIT |
| DeepSeek R1 | Математика + глубокие рассуждения | 164K | $0.70 | $2.50 | MIT |
| Llama 4 Scout | Long context | 10M | $0.10 | $0.30 | Llama 4 Community |
| Mistral Large 3 | Многоязычность + корпоративное использование | 262K | $0.50 | $1.50 | Apache 2.0 |
| Mistral Small 4 | Production chat + tools | 262K | $0.15 | $0.60 | Apache 2.0 |
| GLM-5.1 | Agentic coding | 203K | $0.97 | $3.04 | MIT |
| Qwen 3.6-35B-A3B | Single-server deploy | 262K | $0.14 | $1.00 | Apache 2.0 |
| Gemma 3 27B | Single GPU | 131K | $0.08 | $0.16 | Gemma |
| Gemma 4 26B A4B | Math + coding | 262K | $0.06 | $0.33 | Apache 2.0 |
| Phi-4 | Edge / laptop | 16K | $0.07 | $0.14 | MIT |
| Kimi K2.6 | Agentic coding | 262K | $0.66 | $3.41 | Open weights |
Все цены - OpenRouter, июль 2026. При self-hosting учитывайте стоимость GPU и электричества вместо per-token billing.
Когда выбирать open-source
Open-source имеет смысл, если:
- данные не должны покидать периметр (на своей инфраструктуре, private cloud)
- нужны предсказуемые расходы, растущие вместе с объёмом запросов, при миллионах обращений в месяц
- важно дообучение под домен без ограничений API
- команда уже держит GPU-инфраструктуру или использует vLLM / TGI
Закрытые API (GPT-5.6, Claude, Gemini) остаются предпочтительнее, когда нужны агенты «из коробки» (ChatGPT Work, Cowork, Spark), минимальное время выхода на рынок без DevOps и доступ к самым свежим multimodal-возможностям без развёртывания.
Мультимодальность: изображения и видео
Текстовые LLM - лишь часть экосистемы:
- ChatGPT Images 2.0 - генерация изображений с читаемым текстом на картинке
- Google Veo 3.1 - лидер среди video-моделей после закрытия потребительского приложения Sora 2 у OpenAI
- Seedream 5.0 Pro - альтернатива для дизайна и маркетинговых материалов
Выбор зависит от того, нужен ли единый стек или лучшее качество в конкретном модальном направлении.
Как выбрать модель под задачу
Универсального «лучшего ИИ» нет. Практичная схема:
| Задача | Что смотреть в первую очередь |
|---|---|
| Ежедневный чат и документы | GPT-5.6 Terra или Luna, Claude Opus 4.8 |
| Программирование и агенты | GPT-5.6 Sol, Claude Fable 5 |
| Длинный контекст (код, архивы) | Gemini 3.5 Flash, Gemini 3.1 Pro |
| Тексты и редактура | Claude Sonnet 5 |
| Бюджет и API-автоматизация | GPT-5.6 Luna, Grok 4.5, Qwen 3.7 Max |
| Self-hosting и своя инфраструктура | Qwen 3 235B-A22B, DeepSeek V4, Mistral Small 4, Llama 4 Scout |
| Coding на своём железе | DeepSeek V4, GLM-5.1, Qwen 3.6-35B-A3B |
| Одна GPU / edge | Gemma 3 27B, Phi-4, Qwen 3.6-35B-A3B (OpenRouter) |
| Длинный контекст (локально) | Llama 4 Scout, Qwen 3.6 |
| Real-time новости и X | Grok 4.5 |
| Офисная автоматизация | ChatGPT Work, Claude Cowork, Gemini Spark |
| Изображения / видео | ChatGPT Images 2.0, Veo 3.1, Seedream 5.0 Pro |
Для продакшена разумно держать абстракцию над провайдерами: маршрутизация запросов по типу задачи, запасной вариант на GPT-5.5 или Opus 4.8 при сбоях, отдельный мониторинг стоимости токенов.
Что изменилось за последний месяц
- GPT-5.6 вышла в GA - OpenAI вернула лидерство в coding-бенчмарках и снизила стоимость флагмана относительно конкурентов
- Claude Fable 5 вернулась - Anthropic восстановила позиции в SWE и агентных сценариях
- Агенты вышли в mainstream - ChatGPT Work, Claude Cowork и Gemini Spark превращают LLM из чата в рабочий инструмент
- Ценовая война усилилась - Luna, Grok 4.5 и Muse Spark 1.1 давят на средний уровень и делят рынок API-интеграций
- Регуляторика стала фактором - пауза Fable 5 показала, что доступ к топ-моделям может меняться быстро
- Open-source догнал закрытый фронтир - DeepSeek V4, GLM-5.1 и Qwen 3.6 вышли на уровень SWE-Bench, сопоставимый с GPT-5.5 и Opus 4.8
Итог
В июле 2026 года рынок ИИ зрелый и фрагментированный. GPT-5.6 Sol и Claude Fable 5 делят первое место в coding среди закрытых API, Gemini 3.5 Flash - в длинном контексте и цена/производительность, Claude Sonnet 5 - в работе с текстом. В open-source сегменте лидируют Qwen 3 235B-A22B, DeepSeek V4 и Llama 4 Scout - каждая с узкой специализацией. Агентские продукты (ChatGPT Work, Cowork, Spark) - следующий слой поверх моделей.
Для бизнеса оптимальная стратегия - не привязываться к одному вендору: тестировать 2-3 модели на реальных задачах, считать стоимость за задачу, а не только цену за миллион токенов, и закладывать запасной вариант - на предыдущее поколение API (GPT-5.5, Opus 4.8) или на self-hosted open-source (DeepSeek V4, Mistral Small 4) при требованиях к данным и бюджету.
Если нужна помощь с разработкой, внедрением ИИ или сопровождением сайта под вашу задачу - напишите мне.
Часто задаваемые вопросы
Какая модель лучше для программирования в июле 2026?
Среди закрытых API лидируют GPT-5.6 Sol и Claude Fable 5 - обе сильны в coding и агентных сценариях. Sol выигрывает по стоимости output-токенов, Fable 5 - по SWE-Bench Pro (~80.3%). Для бюджетного API - Grok 4.5 ($2 / $6) или GPT-5.6 Luna ($1 / $6). В open-source - DeepSeek V4 Flash на OpenRouter ($0.08 / $0.17) и GLM-5.1.
Open-source или закрытый API - что выбрать?
Open-source (через OpenRouter или self-hosting) - если важны контроль данных, предсказуемый рост расходов вместе с объёмом запросов и отсутствие зависимости от вендора. Закрытый API (GPT-5.6, Claude, Gemini) - если нужны агенты «из коробки» (ChatGPT Work, Cowork, Spark), мультимодальность без DevOps и минимальное время выхода на рынок. Для многих команд оптимален гибрид: закрытый API для продуктовых фич, open-source - для фоновой автоматизации.
Чем отличаются GPT-5.6 Sol, Terra и Luna?
Все три - одно поколение с контекстом 1.05M токенов, но разным уровнем capability и ценой. Sol ($5 / $30) - флагман для сложного кода и агентов. Terra ($2.50 / $15) - баланс для ежедневной работы. Luna ($1 / $6) - массовые задачи: классификация, извлечение данных, рутинная переписка. В ChatGPT Free и Go по умолчанию стоит Terra.
Почему Claude Fable 5 была недоступна и вернулась ли она?
12 июня 2026 Anthropic сняла Fable 5 с линии из-за экспортных ограничений США на frontier-модели. 30 июня ограничение сняли, 1 июля модель вернулась в API и ChatGPT-конкурентные сервисы по прежней цене ($10 / $50). Пауза показала, что доступ к топ-моделям может меняться по регуляторным причинам - стоит держать fallback (Opus 4.8, GPT-5.6 Sol).
Как сэкономить на API без потери качества?
Три рабочих подхода: маршрутизация по задаче - Luna или DeepSeek V4 Flash для простых запросов, Sol или Fable 5 только для сложных; OpenRouter для open-source моделей - часто дешевле прямого API (например, DeepSeek V4 Flash - input $0.08 через OpenRouter против $0.16 у прямого API в пиковые часы, когда тариф удваивается); кэширование промпта и batch API (пакетная обработка запросов вместо поштучной) - до 50-90% экономии на повторяющемся контексте. Считайте стоимость за задачу, а не только цену за миллион токенов - дешёвая модель с длинным output может обойтись дороже.
Термины в статье
open-source — software with publicly available source code — ПО с открытым исходным кодом
self-hosting — running software on your own servers — развёртывание на собственном сервере
агентность — agentic capability of a model to plan and act autonomously — способность модели самостоятельно планировать и выполнять цепочки действий без пошаговых указаний человека
CRM — Customer Relationship Management — управление взаимоотношениями с клиентами
RAG — Retrieval-Augmented Generation — генерация с дополненным поиском
B2B — Business to Business — продажи между компаниями
Ollama — tool to run local open-weight LLMs on your machine — инструмент для локального запуска LLM с открытыми весами
production — live environment serving real users — боевая среда с реальными пользователями
agentic — agent-like autonomous multi-step behavior — автономное многошаговое поведение агента
GPU — Graphics Processing Unit — графический процессор
long context — model that can take a very large prompt in one go — модель, которая принимает очень длинный промпт за раз
open weights — model weights you can download and run yourself — веса модели, которые можно скачать и запускать у себя
дообучение — fine-tuning — дополнительное обучение модели под вашу задачу
DevOps — Development and Operations — совместная практика разработки и эксплуатации
LLM — Large Language Model — большая языковая модель
real-time — processed with minimal delay — в реальном времени, с минимальной задержкой
self-hosted — software you run on your own servers — ПО на собственном сервере
fallback — backup path used when the primary option fails — запасной путь, если основной вариант не сработал