37 modelos mexem no preço em 24h: 26 sobem, 6 caem
Gemma 3 27B e Llama 3.1 8B quase triplicam o custo de saída. Qwen3 Coder é o único corte relevante entre os grandes.
O dia em que o catálogo virou 26 a 6
Acordou, abriu o painel de billing e o número de saída de tokens está maior. Não é impressão: entre ontem e hoje, 37 modelos mexeram no preço na sua lista de fornecedores, e a maioria foi para cima. São 26 aumentos contra 6 cortes, num único dia. Para quem paga a conta, isso é a diferença entre manter o mesmo produto e descobrir, no fim do mês, que o mesmo produto ficou quase três vezes mais caro em alguns casos.
O movimento mais agressivo veio de dois nomes que muita gente usa como "barato padrão" em produção: o Gemma 3 27B, do Google, e o Llama 3.1 8B Instruct, da Meta. Os dois subiram forte no preço de saída — o que importa quando seu sistema gera muito texto.
Gemma 3 27B e Llama 3.1 8B: o barato ficou caro
O Gemma 3 27B saiu de US$ 0,16 para US$ 0,45 por milhão de tokens de saída. É um salto de 2,81x — quase três vezes pelo mesmo modelo, sem mudança de versão. O preço de entrada ficou parado em US$ 0,08, então o impacto só aparece em cargas que geram bastante resposta: chatbots longos, geração de relatório, sumarização pesada.
O Llama 3.1 8B Instruct mexeu nos dois lados: entrada de US$ 0,02 para US$ 0,05 (2,5x) e saída de US$ 0,03 para US$ 0,08 (2,67x). Para quem usava o modelo como classificador ou extrator barato, a conta de entrada também mudou — e mudou mais rápido que a de saída, proporcionalmente.
Se você roda esses dois modelos em volume, vale rodar a calculadora hoje, antes do próximo ciclo de cobrança. Não é reajuste de 5%: é reposicionamento.
Qwen3 Coder é o corte que importa
Em meio a 26 altas, o Qwen3 Coder 480B A35B fez o movimento oposto: preço de saída caiu de US$ 1,80 para US$ 1,00 por milhão (queda de 44%, ratio 0,56). É o único corte entre os modelos grandes da lista. O preço de entrada subiu um pouco, de US$ 0,22 para US$ 0,30, então o desconto é seletivo — ele quer ficar competitivo exatamente onde os agentes e ferramentas de código geram mais texto.
Para quem usa o Qwen3 Coder em pipelines de geração de código, é a melhor notícia do dia. Para quem não usa, é a deixa para testar: um modelo de 480B com saída abaixo de US$ 1 por milhão não é comum.
| Modelo | Saída antes US$/M | Saída depois US$/M | Variação |
|---|---|---|---|
| Gemma 3 27B | 0.16 | 0.45 | +181% |
| Llama 3.1 8B Instruct | 0.03 | 0.08 | +167% |
| Qwen3 VL 235B A22B Instruct | 0.88 | 1.9 | +116% |
| Qwen3 Coder 480B A35B | 1.8 | 1 | -44% |
| GLM 5 | 1.92 | 3.15 | +64% |
| Nemotron 3 Ultra | 2.2 | 3.6 | +64% |
| Qwen3 30B A3B Instruct 2507 | 0.1931 | 0.3 | +55% |
| Mistral Small 3.2 24B | 0.2 | 0.3 | +50% |
Os outros reajustes que merecem atenção
Nem tudo é caso extremo. O Qwen3 VL 235B A22B Instruct — multimodal, grande — dobrou o preço de saída (US$ 0,88 → US$ 1,90). O Z.ai GLM 5 subiu 64% na saída (US$ 1,92 → US$ 3,15). O NVIDIA Nemotron 3 Ultra também subiu 64% (US$ 2,20 → US$ 3,60). O Qwen3 30B A3B Instruct 2507 foi de US$ 0,19 para US$ 0,30 na saída, e o Mistral Small 3.2 24B foi de US$ 0,20 para US$ 0,30.
Padrão claro: saída subiu mais que entrada em quase todos os casos. Isso afeta mais quem tem agentes, RAG com geração longa e ferramentas de código — exatamente o tipo de uso que mais cresce em 2026.
Para quem isso muda a escolha, e para quem não muda nada
Muda a escolha se você roda Gemma 3 27B ou Llama 3.1 8B em produção com volume alto de saída. O custo por request subiu o suficiente para justificar revisitar a rota: talvez um modelo da faixa de IQ 45 com saída a US$ 1,20 por milhão, como o MiniMax M3 ou o GPT-5.6 Luna, seja alternativa viável para tarefas que não precisam do topo da tabela. Também muda para quem usa Qwen3 VL 235B, GLM 5 ou Nemotron 3 Ultra — todos passaram de US$ 2 por milhão na saída.
Não muda nada se seu gasto dominante é em entrada (ingestão de documentos, embeddings via API, classificação curta) e o modelo que você usa não entrou na lista de hoje. Dos 502 modelos do catálogo, só 37 mexeram de preço. A esmagadora maioria continua exatamente como ontem.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| GPT-5.6 Terra | 56.6 | 12 |
| Grok 4.5 | 55.8 | 6 |
| Claude Sonnet 5 | 55.3 | 10 |
O cenário geral segue o mesmo de antes: o topo de inteligência continua sendo Claude Fable 5 (IQ 62,07) a US$ 50 por milhão de saída, seguido de GPT-5.6 Sol (IQ 60,93) a US$ 10. Nenhum dos dois mexeu de preço hoje. Quem paga caro pelo topo não foi afetado; quem pagava barato pelo meio da tabela foi.
O que fazer agora
Pegue sua lista de modelos ativos, filtre pelos que estão nesta tabela e recalcule o custo projetado do mês. Se algum deles era seu "barato padrão", teste uma alternativa da faixa de IQ 45–55 antes de aceitar o novo preço. E se você estava olhando o Qwen3 Coder de longe, hoje é um bom dia para colocar em produção.
Recalcule hoje o custo dos modelos que estão na tabela — Gemma 3 27B, Llama 3.1 8B, Qwen3 VL 235B, GLM 5 e Nemotron 3 Ultra subiram forte na saída, e só o Qwen3 Coder ficou mais barato.
Perguntas frequentes
Quais modelos de IA tiveram aumento de preço em julho de 2026?
Entre 14 e 15 de julho de 2026, 26 modelos subiram de preço no catálogo. Os maiores reajustes foram Gemma 3 27B (saída 2,81x), Llama 3.1 8B Instruct (2,67x), Qwen3 VL 235B A22B (2,16x) e Qwen3 30B A3B Instruct 2507 (1,55x). Os modelos do topo de inteligência, como Claude Fable 5 e GPT-5.6 Sol, não mexeram de preço.
Algum modelo ficou mais barato hoje?
Sim, seis modelos tiveram corte de preço. O mais relevante é o Qwen3 Coder 480B A35B, com saída caindo de US$ 1,80 para US$ 1,00 por milhão de tokens (queda de 44%). Os outros cinco cortes envolvem modelos menores ou com impacto marginal na conta.
Por que o preço de saída subiu mais que o de entrada?
Porque gerar tokens custa mais caro para o provedor do que recebê-los, e o reajuste recente reflete o custo real de modelos grandes rodando em produção. Para o cliente, isso significa que cargas com resposta longa — agentes, geração de código, sumarização — são as mais afetadas, enquanto pipelines focados em entrada (classificação, extração curta) sentem menos.