Modelos de IA atuais em julho de 2026

Julho de 2026 foi intenso: em uma semana saíram GPT-5.6, Grok 4.5 e Muse Spark 1.1, e Claude Fable 5 voltou à ativa após uma pausa de quase três semanas. Abaixo estão os modelos e agentes atuais que serão abordados:
- OpenAI: GPT-5.6 Sol, Terra, Luna; GPT-5.5; ChatGPT Work; ChatGPT Images 2.0; Codex
- Anthropic: Claude Fable 5, Opus 4.8, Sonnet 5; Claude Cowork
- Google: Gemini 3.1 Pro, Gemini 3.5 Flash; Gemini Spark; Veo 3.1
- xAI: Grok 4.5
- Meta: Muse Spark 1.1
- ByteDance: Seedream 5.0 Pro
- Alibaba: Qwen 3.7 Max (API); Qwen 3 235B-A22B, Qwen 3.5, Qwen 3.6 (open weights)
- Open-source: Llama 4 Scout e Maverick; DeepSeek V4, R1, V3; Mistral Large 3, Small 4; GLM-5, GLM-4.7; Gemma 3, Gemma 4 26B A4B; Phi-4; Kimi K2.6
O mercado de modelos flagship não se resume mais a um «único vencedor» - cada família tem seu ponto forte, e a escolha depende da tarefa, do orçamento e dos requisitos de contexto.

Em resumo: o que isso significa para o seu negócio
- Não existe um único modelo «melhor». Para tarefas rotineiras (correspondência, rascunhos, classificação), modelos econômicos como GPT-5.6 Luna ou Qwen 3.7 Max custam uma fração do preço dos flagships e são mais que suficientes.
- Reserve orçamento maior para código e agentes. GPT-5.6 Sol e Claude Fable 5 são mais caros, mas são eles que resolvem tarefas complexas de várias etapas. Teste 2-3 opções nas suas próprias tarefas, em vez de escolher pelo marketing.
- Não se prenda a um único fornecedor. O Claude Fable 5 ficou três semanas indisponível por restrições de exportação dos EUA - uma falha semelhante pode acontecer com qualquer fornecedor. Mantenha um modelo ou fornecedor reserva pronto.
- Open-source (modelos com pesos abertos) faz sentido se controle de dados ou um volume alto de requisições mensais forem importantes - mas exige infraestrutura de servidor própria, não um esquema de «ligar e usar».
- Calcule o custo por tarefa, não o preço por token. Um modelo barato com resposta longa pode acabar saindo mais caro que um modelo caro com resposta curta.
Abaixo está uma análise detalhada por fornecedor com tabelas de preços, além de seções para quem quer entender os detalhes (contexto, licenças, self-hosting).
Panorama geral do mercado
Em meados de 2026, consolidou-se uma estrutura tripolar estável:
- OpenAI - GPT-5.6 (Sol, Terra, Luna) e o ecossistema ChatGPT / Codex / ChatGPT Work
- Anthropic - Claude Fable 5, Opus 4.8, Sonnet 5 e o agente Claude Cowork
- Google - Gemini 3.1 Pro, Gemini 3.5 Flash e o agente Gemini Spark
Ao lado deles atuam players especializados: xAI (Grok 4.5), Meta (Muse Spark 1.1), ByteDance (Seedream 5.0 Pro para imagens), Alibaba (Qwen 3.7 Max). Em paralelo, o segmento open-source maduro reduz a diferença em relação aos flagships fechados a poucos pontos nos principais benchmarks - Llama 4, Qwen 3.x, DeepSeek V4, Mistral Large 3 e GLM-5 já são adequados para produção com self-hosting (execução do modelo em servidores próprios). A competição saiu do plano «quem é mais inteligente» para o plano «quem é mais eficiente em uma tarefa específica a um preço aceitável».
Abaixo está o estado atual das principais linhas em 11 de julho de 2026.
OpenAI: família GPT-5.6
Em 9 de julho, a OpenAI liberou o GPT-5.6 para todos os usuários. O modelo tornou-se o padrão no ChatGPT após um preview limitado acompanhado de verificações regulatórias.
Três níveis em uma geração
| Modelo | Função | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Sol | Flagship: código, agentes, tarefas complexas | 1.05M | $5.00 | $30.00 |
| Terra | Equilíbrio entre preço e qualidade | 1.05M | $2.50 | $15.00 |
| Luna | Rápido e econômico | 1.05M | $1.00 | $6.00 |
| GPT-5.5 | Flagship anterior, fallback | 1M | $5.00 | $30.00 |
Para input acima de 272K tokens, o GPT-5.6 aplica tarifa long-context: input x2, output x1.5 (Sol: $10 / $45 por 1M).
Sol é posicionado como o melhor modelo de coding da OpenAI: no Artificial Analysis Coding Agent Index (ranking independente que compara agentes de coding em tarefas reais), ele supera o Claude Fable 5 com menor consumo de tokens e custo mais baixo. Terra e Luna cobrem cenários em massa - da correspondência cotidiana à automação em segundo plano.
O GPT-5.5 permanece como opção de reserva onde é necessária estabilidade comprovada. Sol mostrou «agenticidade» elevada em alguns cenários, por isso faz sentido testar ambas as versões para tarefas críticas de produção.
ChatGPT Work
Junto com o GPT-5.6 foi anunciado o ChatGPT Work - agente para tarefas de escritório: documentos, planilhas, apresentações, aplicativos web simples. Ele combina as capacidades do ChatGPT e do Codex e compete com o Claude Cowork. Há suporte a integrações com Slack, Gmail, Google Drive, calendários e CRM. Para uma equipe não técnica, a diferença entre ChatGPT Work, Claude Cowork e Gemini Spark hoje está mais no ecossistema de integrações do que na qualidade do resultado - faz sentido escolher o agente de acordo com as ferramentas já usadas (Google Workspace, Slack etc.), e não o contrário.
Anthropic: Claude após a pausa
Em 1 de julho, a Anthropic devolveu o Claude Fable 5 - flagship da classe Mythos, retirado da linha em 12 de junho por restrições de exportação dos EUA. O retorno do modelo alterou significativamente o cenário em coding e cenários agentic longos.
Principais modelos da linha
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Claude Fable 5 | Coding, workflows agentic longos | 1M | $10.00 | $50.00 |
| Claude Opus 4.8 | Trabalho diário, enterprise | 1M | $5.00 | $25.00 |
| Claude Sonnet 5 | Textos, instruções (intro até 31.08) | 1M | $2.00 | $10.00 |
A partir de 1 de setembro de 2026, Claude Sonnet 5: $3.00 input / $15.00 output por 1M.
Claude Cowork - agente para trabalho colaborativo com arquivos e aplicativos, resposta direta da OpenAI ao ChatGPT Work. Para equipes que já usam Claude Code, o Cowork complementa logicamente o stack de desenvolvimento.
Google: Gemini 3.x
A Google mantém a linha em duas frentes - reasoning e price-performance.
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Gemini 3.1 Pro | Raciocínio complexo, precisão | 1M | $2.00 | $12.00 |
| Gemini 3.5 Flash | Price-performance, contexto longo | 2M | $1.50 | $9.00 |
Acima de 200K tokens, o Gemini 3.1 Pro aplica tarifa elevada: $4.00 input / $18.00 output por 1M.
O ponto forte do Gemini é o contexto longo e a multimodalidade. Para análise de grandes volumes de documentos, bases de código e dados mistos (texto + imagens), isso costuma ser o argumento decisivo.
Gemini Spark - agente da Google, um dos três produtos agentic mais visíveis do verão de 2026, junto com o ChatGPT Work e o Claude Cowork. Para empresas que já usam o Google Workspace, é a menor barreira de entrada dos três.
xAI, Meta, ByteDance e Alibaba
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Grok 4.5 | Código, contexto em tempo real do X | 1M | $2.00 | $6.00 |
| Meta Muse Spark 1.1 | API mid-tier acessível | 256K | $1.25 | $4.25 |
| Qwen 3.7 Max | Reasoning mid-tier (API) | 1M | $2.50 | $7.50 |
| Seedream 5.0 Pro | Geração de imagens | - | per image | per image |
O Grok 4.5 é forte em conjunto com o Cursor e em tarefas que exigem contexto atualizado do X e da web. O Qwen 3.7 Max - pesos fechados via Alibaba Cloud; a linha open-source Qwen é descrita abaixo. O Seedream 5.0 Pro é cobrado por imagem, não por tokens.
Modelos open-source
Open weights - uma camada separada do mercado que em 2026 deixou de ser «opção reserva para experimentos». Vários modelos se aproximam da classe GPT-4 em código e raciocínio, e DeepSeek V4 e GLM-5.1 competem com flagships fechados no SWE-Bench (benchmark padrão para tarefas reais de programação). As principais razões para escolher open-source: self-hosting, controle de dados, custo previsível com alto tráfego e ausência de vendor lock-in.
Os preços dos modelos open-source são mais baixos - segundo o OpenRouter em 11 de julho de 2026 (inferência hospedada sem implantar hardware próprio). Self-hosting continua possível - nesse caso, o billing por token (pagamento pelo volume de texto processado) não se aplica.
Meta: Llama 4
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Llama 4 Scout | RAG, grandes arquivos | 10M | $0.10 | $0.30 |
| Llama 4 Maverick | General-purpose | 1M | $0.15 | $0.60 |
Preços - OpenRouter. Com self-hosting, não há cobrança por tokens; o custo é apenas hardware e eletricidade.
A licença Llama 4 Community impõe restrição a produtos com audiência acima de 700M MAU (usuários ativos mensais) - para a maioria dos projetos B2B isso não é problema; para grandes plataformas consumer, é necessária verificação separada.
Alibaba: Qwen (open weights)
O Qwen 3.7 Max em nuvem e a linha open-source são produtos diferentes. Para self-hosting, são relevantes:
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Qwen 3 235B-A22B | Reasoning + coding | 131K | $0.46 | $1.82 |
| Qwen 3.5-397B-A17B | Multilinguismo, ciência | 256K | $0.39 | $2.45 |
| Qwen 3.6-35B-A3B | Um servidor, quantização | 262K | $0.14 | $1.00 |
Qwen é a escolha mais frequente quando se precisa de equilíbrio entre qualidade, licença Apache 2.0 e suporte em vLLM / Ollama / llama.cpp (ferramentas populares para self-hosting de modelos).
DeepSeek
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| DeepSeek V4 Flash | Coding, agents, orçamento | 1M | $0.08 | $0.17 |
| DeepSeek V4 Pro | Reasoning complexo | 1M | $0.44 | $0.87 |
| DeepSeek R1 | Math, deep reasoning | 164K | $0.70 | $2.50 |
| DeepSeek V3.2 | General-purpose fallback | 131K | $0.21 | $0.32 |
No OpenRouter, o DeepSeek V4 Flash é mais barato do que pela API direta da DeepSeek. A API direta dobra as tarifas nos horários de pico (9:00-12:00 e 14:00-18:00 CST) a partir de meados de julho de 2026.
Mistral AI
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Mistral Large 3 | Multilingual, enterprise | 262K | $0.50 | $1.50 |
| Mistral Small 4 | Production chat + tools | 262K | $0.15 | $0.60 |
A Mistral vence onde importam licença permissiva sem MAU-cap, data residency europeia e ecossistema maduro de deploy.
Zhipu AI: GLM
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| GLM-5.1 | Agentic coding | 203K | $0.97 | $3.04 |
| GLM-4.7 | Coding workflows | 203K | $0.40 | $1.75 |
Google e Microsoft: modelos compactos
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Gemma 3 27B | Uma GPU | 131K | $0.08 | $0.16 |
| Gemma 4 26B A4B | Math + coding | 262K | $0.06 | $0.33 |
| Phi-4 | Edge, laptop | 16K | $0.07 | $0.14 |
Kimi K2.6
| Modelo | Finalidade | Contexto | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Kimi K2.6 | Agentic coding | 262K | $0.66 | $3.41 |
Kimi K2.6 (Moonshot AI) - modelo open-weight com foco em agentic coding e sessões longas de desenvolvimento. Frequentemente citado junto com DeepSeek V4 e GLM-5 como top-tier para agentes de coding autônomos.
Comparação dos flagships open-source
| Modelo | Ponto forte | Contexto | Input / 1M | Output / 1M | Licença |
|---|---|---|---|---|---|
| Qwen 3 235B-A22B | Reasoning + coding | 131K | $0.46 | $1.82 | Apache 2.0 |
| DeepSeek V4 Flash | Coding + agents | 1M | $0.08 | $0.17 | MIT |
| DeepSeek V4 Pro | Reasoning complexo | 1M | $0.44 | $0.87 | MIT |
| DeepSeek R1 | Math + deep reasoning | 164K | $0.70 | $2.50 | MIT |
| Llama 4 Scout | Long context | 10M | $0.10 | $0.30 | Llama 4 Community |
| Mistral Large 3 | Multilingual + enterprise | 262K | $0.50 | $1.50 | Apache 2.0 |
| Mistral Small 4 | Production chat + tools | 262K | $0.15 | $0.60 | Apache 2.0 |
| GLM-5.1 | Agentic coding | 203K | $0.97 | $3.04 | MIT |
| Qwen 3.6-35B-A3B | Single-server deploy | 262K | $0.14 | $1.00 | Apache 2.0 |
| Gemma 3 27B | Single GPU | 131K | $0.08 | $0.16 | Gemma |
| Gemma 4 26B A4B | Math + coding | 262K | $0.06 | $0.33 | Apache 2.0 |
| Phi-4 | Edge / laptop | 16K | $0.07 | $0.14 | MIT |
| Kimi K2.6 | Agentic coding | 262K | $0.66 | $3.41 | Open weights |
Todos os preços - OpenRouter, julho de 2026. Com self-hosting, considere o custo de GPU e eletricidade em vez do billing por token.
Quando escolher open-source
Open-source faz sentido se:
- os dados não podem sair do perímetro (on-premise, private cloud)
- é necessário cost at scale previsível (custo que cresce de forma previsível com o volume) com milhões de requisições por mês
- fine-tuning para o domínio é importante, sem restrições de API
- a equipe já mantém infraestrutura de GPU ou usa vLLM / TGI
APIs fechadas (GPT-5.6, Claude, Gemini) permanecem preferíveis quando são necessários agentes «prontos para uso» (ChatGPT Work, Cowork, Spark), time-to-market mínimo sem DevOps e acesso às capacidades multimodais mais recentes sem deploy.
Multimodalidade: imagens e vídeo
LLMs de texto são apenas parte do ecossistema:
- ChatGPT Images 2.0 - geração de imagens com texto legível na imagem
- Google Veo 3.1 - líder entre modelos de vídeo após o encerramento do aplicativo consumer Sora 2 da OpenAI
- Seedream 5.0 Pro - alternativa para design e materiais de marketing
A escolha depende de se é necessário um stack unificado (OpenAI / Google) ou a melhor qualidade em uma modalidade específica.
Como escolher o modelo para a tarefa
Não existe um «melhor IA» universal. Esquema prático:
| Tarefa | O que priorizar |
|---|---|
| Chat diário e documentos | GPT-5.6 Terra ou Luna, Claude Opus 4.8 |
| Programação e agentes | GPT-5.6 Sol, Claude Fable 5 |
| Contexto longo (código, arquivos) | Gemini 3.5 Flash, Gemini 3.1 Pro |
| Textos e edição | Claude Sonnet 5 |
| Orçamento e automação via API | GPT-5.6 Luna, Grok 4.5, Qwen 3.7 Max |
| Self-hosting e on-premise | Qwen 3 235B-A22B, DeepSeek V4, Mistral Small 4, Llama 4 Scout |
| Coding no próprio hardware | DeepSeek V4, GLM-5.1, Qwen 3.6-35B-A3B |
| Uma GPU / edge | Gemma 3 27B, Phi-4, Qwen 3.6-35B-A3B (OpenRouter) |
| Contexto longo (local) | Llama 4 Scout, Qwen 3.6 |
| Notícias em tempo real e X | Grok 4.5 |
| Automação de escritório | ChatGPT Work, Claude Cowork, Gemini Spark |
| Imagens / vídeo | ChatGPT Images 2.0, Veo 3.1, Seedream 5.0 Pro |
Para produção, faz sentido manter abstração sobre provedores: roteamento de requisições por tipo de tarefa, fallback para GPT-5.5 ou Opus 4.8 em falhas, monitoramento separado do custo de tokens.
O que mudou no último mês
- GPT-5.6 entrou em GA - a OpenAI recuperou a liderança nos benchmarks de coding e reduziu o custo do flagship em relação aos concorrentes
- Claude Fable 5 voltou - a Anthropic restaurou posições em SWE e cenários agentic
- Agentes entraram no mainstream - ChatGPT Work, Claude Cowork e Gemini Spark transformam LLM de chat em ferramenta de trabalho
- Guerra de preços se intensificou - Luna, Grok 4.5 e Muse Spark 1.1 pressionam o mid-tier e dividem o mercado de integrações via API
- Regulação virou fator - a pausa do Fable 5 mostrou que o acesso a modelos top pode mudar rapidamente
- Open-source alcançou a fronteira fechada - DeepSeek V4, GLM-5.1 e Qwen 3.6 atingiram nível de SWE-Bench comparável ao GPT-5.5 e Opus 4.8
Conclusão
Em julho de 2026, o mercado de IA é maduro e fragmentado. GPT-5.6 Sol e Claude Fable 5 dividem o primeiro lugar em coding entre APIs fechadas, Gemini 3.5 Flash - em contexto longo e price-performance, Claude Sonnet 5 - em trabalho com texto. No segmento open-source lideram Qwen 3 235B-A22B, DeepSeek V4 e Llama 4 Scout - cada um com especialização específica. Produtos agentic (ChatGPT Work, Cowork, Spark) são a próxima camada sobre os modelos.
Para negócios, a estratégia ideal é não se prender a um único vendor: testar 2-3 modelos em tarefas reais, calcular cost per task, não apenas o preço por milhão de tokens, e prever fallback - para a geração anterior de API (GPT-5.5, Opus 4.8) ou para open-source self-hosted (DeepSeek V4, Mistral Small 4) conforme requisitos de dados e orçamento.
Se precisar de ajuda com desenvolvimento, implementação de IA ou suporte ao site para o seu projeto - escreva-me.
Perguntas frequentes
Qual modelo é melhor para programação em julho de 2026?
Entre APIs fechadas lideram GPT-5.6 Sol e Claude Fable 5 - ambos fortes em coding e cenários agentic. Sol vence no custo de tokens de output, Fable 5 - no SWE-Bench Pro (~80.3%). Para API econômica - Grok 4.5 ($2 / $6) ou GPT-5.6 Luna ($1 / $6). Em open-source - DeepSeek V4 Flash no OpenRouter ($0.08 / $0.17) e GLM-5.1.
Open-source ou API fechada - o que escolher?
Open-source (via OpenRouter ou self-hosting) - se importam controle de dados, cost at scale previsível (custo que cresce de forma previsível com o uso) e ausência de vendor lock-in. API fechada (GPT-5.6, Claude, Gemini) - se são necessários agentes «prontos para uso» (ChatGPT Work, Cowork, Spark), multimodalidade sem DevOps e time-to-market mínimo. Para muitas equipes, o híbrido é ideal: API fechada para features de produto, open-source - para automação em segundo plano.
Qual a diferença entre GPT-5.6 Sol, Terra e Luna?
Os três são da mesma geração com contexto de 1.05M tokens, mas com níveis diferentes de capability e preço. Sol ($5 / $30) - flagship para código complexo e agentes. Terra ($2.50 / $15) - equilíbrio para o trabalho diário. Luna ($1 / $6) - tarefas em massa: classificação, extração de dados, correspondência rotineira. No ChatGPT Free e Go, o padrão é Terra.
Por que Claude Fable 5 ficou indisponível e ela voltou?
Em 12 de junho de 2026, a Anthropic retirou o Fable 5 da linha por restrições de exportação dos EUA a modelos frontier. Em 30 de junho a restrição foi levantada, e em 1 de julho o modelo voltou à API e aos serviços concorrentes do ChatGPT pelo preço anterior ($10 / $50). A pausa mostrou que o acesso a modelos top pode mudar por razões regulatórias - vale manter fallback (Opus 4.8, GPT-5.6 Sol).
Como economizar na API sem perder qualidade?
Três abordagens práticas: roteamento por tarefa - Luna ou DeepSeek V4 Flash para requisições simples, Sol ou Fable 5 apenas para as complexas; OpenRouter para modelos open-source - frequentemente mais barato que a API direta (por exemplo, DeepSeek V4 Flash $0.08 vs $0.14); prompt caching e batch API (processamento em lote em vez de um a um) - até 50-90% de economia em contexto repetido. Calcule cost per task, não apenas o preço por milhão de tokens - um modelo barato com output longo pode sair mais caro.
Termos deste artigo
open-source — software with publicly available source code — software com código-fonte público
self-hosting — running software on your own servers — rodar software nos seus próprios servidores
long-context — model that can take a very large prompt in one go — modelo que aceita um prompt muito longo de uma vez
fallback — backup path used when the primary option fails — caminho reserva se a opção principal falhar
CRM — Customer Relationship Management — gestão de relacionamento com clientes
agentic — agent-like autonomous multi-step behavior — comportamento autônomo de agente em várias etapas
price-performance — value relative to cost and speed
open weights — model weights you can download and run yourself — pesos do modelo baixáveis e executáveis aí
vendor lock-in — hard to leave a vendor without costly rewrite — difícil sair do fornecedor sem reescrita cara
RAG — Retrieval-Augmented Generation — geração aumentada por recuperação
consumer — queue/stream consumer
MAU — Monthly Active Users — usuários ativos mensais
B2B — Business to Business — de empresa para empresa
Ollama — tool to run local open-weight LLMs on your machine — ferramenta para rodar LLMs open-weight no local
data residency — requirement to keep data in a specific country/region — exigência de guardar dados em país/região específico
production — live environment serving real users — ambiente ao vivo com usuários reais
GPU — Graphics Processing Unit — unidade de processamento gráfico
time-to-market — how fast a product reaches customers — rapidez com que um produto chega aos clientes
fine-tuning — additional training of a model on domain data — treinamento adicional do modelo com dados do domínio
DevOps — Development and Operations — desenvolvimento e operações
on-premise — software hosted in your own infrastructure — software na sua infraestrutura, não na nuvem do fornecedor
LLM — Large Language Model — modelo de linguagem grande
self-hosted — software you run on your own servers — software que você roda nos seus próprios servidores
lock-in — hard to leave a vendor or stack without costly rewrite — difícil sair de um fornecedor ou stack sem reescrita cara
prompt caching — reuse of a cached prompt prefix to cut cost and latency — reutilizar um prefixo de prompt em cache: mais barato e rápido