FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

37 modelos mexem no preço em 24h: 26 sobem, 6 caem

Gemma 3 27B e Llama 3.1 8B quase triplicam o custo de saída. Qwen3 Coder é o único corte relevante entre os grandes.

Redação FalaVIP IA 4 min de leitura
2,81xreajuste do preço de saída do Gemma 3 27B (US$ 0,16 → US$ 0,45 por milhão)
26modelos com aumento no dia, contra 6 cortes
0,56xúnica redução relevante: Qwen3 Coder 480B (US$ 1,80 → US$ 1,00 por milhão de saída)

O dia em que o catálogo virou 26 a 6

Acordou, abriu o painel de billing e o número de saída de tokens está maior. Não é impressão: entre ontem e hoje, 37 modelos mexeram no preço na sua lista de fornecedores, e a maioria foi para cima. São 26 aumentos contra 6 cortes, num único dia. Para quem paga a conta, isso é a diferença entre manter o mesmo produto e descobrir, no fim do mês, que o mesmo produto ficou quase três vezes mais caro em alguns casos.

O movimento mais agressivo veio de dois nomes que muita gente usa como "barato padrão" em produção: o Gemma 3 27B, do Google, e o Llama 3.1 8B Instruct, da Meta. Os dois subiram forte no preço de saída — o que importa quando seu sistema gera muito texto.

Variação do preço de saída (%)
Gemma 3 27B181Llama 3.1 8B Instruct167Qwen3 VL 235B A22B Instruct116Qwen3 Coder 480B A35B-44GLM 564Nemotron 3 Ultra64Qwen3 30B A3B Instruct 250755Mistral Small 3.2 24B50%

Gemma 3 27B e Llama 3.1 8B: o barato ficou caro

O Gemma 3 27B saiu de US$ 0,16 para US$ 0,45 por milhão de tokens de saída. É um salto de 2,81x — quase três vezes pelo mesmo modelo, sem mudança de versão. O preço de entrada ficou parado em US$ 0,08, então o impacto só aparece em cargas que geram bastante resposta: chatbots longos, geração de relatório, sumarização pesada.

O Llama 3.1 8B Instruct mexeu nos dois lados: entrada de US$ 0,02 para US$ 0,05 (2,5x) e saída de US$ 0,03 para US$ 0,08 (2,67x). Para quem usava o modelo como classificador ou extrator barato, a conta de entrada também mudou — e mudou mais rápido que a de saída, proporcionalmente.

Se você roda esses dois modelos em volume, vale rodar a calculadora hoje, antes do próximo ciclo de cobrança. Não é reajuste de 5%: é reposicionamento.

Qwen3 Coder é o corte que importa

Em meio a 26 altas, o Qwen3 Coder 480B A35B fez o movimento oposto: preço de saída caiu de US$ 1,80 para US$ 1,00 por milhão (queda de 44%, ratio 0,56). É o único corte entre os modelos grandes da lista. O preço de entrada subiu um pouco, de US$ 0,22 para US$ 0,30, então o desconto é seletivo — ele quer ficar competitivo exatamente onde os agentes e ferramentas de código geram mais texto.

Para quem usa o Qwen3 Coder em pipelines de geração de código, é a melhor notícia do dia. Para quem não usa, é a deixa para testar: um modelo de 480B com saída abaixo de US$ 1 por milhão não é comum.

Preços que mudaram no dia
ModeloSaída antes US$/MSaída depois US$/MVariação
Gemma 3 27B0.160.45+181%
Llama 3.1 8B Instruct0.030.08+167%
Qwen3 VL 235B A22B Instruct0.881.9+116%
Qwen3 Coder 480B A35B1.81-44%
GLM 51.923.15+64%
Nemotron 3 Ultra2.23.6+64%
Qwen3 30B A3B Instruct 25070.19310.3+55%
Mistral Small 3.2 24B0.20.3+50%
Comparação entre duas capturas consecutivas do catálogo (2x/dia).

Os outros reajustes que merecem atenção

Nem tudo é caso extremo. O Qwen3 VL 235B A22B Instruct — multimodal, grande — dobrou o preço de saída (US$ 0,88 → US$ 1,90). O Z.ai GLM 5 subiu 64% na saída (US$ 1,92 → US$ 3,15). O NVIDIA Nemotron 3 Ultra também subiu 64% (US$ 2,20 → US$ 3,60). O Qwen3 30B A3B Instruct 2507 foi de US$ 0,19 para US$ 0,30 na saída, e o Mistral Small 3.2 24B foi de US$ 0,20 para US$ 0,30.

Padrão claro: saída subiu mais que entrada em quase todos os casos. Isso afeta mais quem tem agentes, RAG com geração longa e ferramentas de código — exatamente o tipo de uso que mais cresce em 2026.

Para quem isso muda a escolha, e para quem não muda nada

Muda a escolha se você roda Gemma 3 27B ou Llama 3.1 8B em produção com volume alto de saída. O custo por request subiu o suficiente para justificar revisitar a rota: talvez um modelo da faixa de IQ 45 com saída a US$ 1,20 por milhão, como o MiniMax M3 ou o GPT-5.6 Luna, seja alternativa viável para tarefas que não precisam do topo da tabela. Também muda para quem usa Qwen3 VL 235B, GLM 5 ou Nemotron 3 Ultra — todos passaram de US$ 2 por milhão na saída.

Não muda nada se seu gasto dominante é em entrada (ingestão de documentos, embeddings via API, classificação curta) e o modelo que você usa não entrou na lista de hoje. Dos 502 modelos do catálogo, só 37 mexeram de preço. A esmagadora maioria continua exatamente como ontem.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GPT-5.6 Sol60.910
GPT-5.6 Terra56.612
Grok 4.555.86
Claude Sonnet 555.310
Entre os 502 modelos disponíveis no catálogo nesta data.

O cenário geral segue o mesmo de antes: o topo de inteligência continua sendo Claude Fable 5 (IQ 62,07) a US$ 50 por milhão de saída, seguido de GPT-5.6 Sol (IQ 60,93) a US$ 10. Nenhum dos dois mexeu de preço hoje. Quem paga caro pelo topo não foi afetado; quem pagava barato pelo meio da tabela foi.

O que fazer agora

Pegue sua lista de modelos ativos, filtre pelos que estão nesta tabela e recalcule o custo projetado do mês. Se algum deles era seu "barato padrão", teste uma alternativa da faixa de IQ 45–55 antes de aceitar o novo preço. E se você estava olhando o Qwen3 Coder de longe, hoje é um bom dia para colocar em produção.

Em uma frase

Recalcule hoje o custo dos modelos que estão na tabela — Gemma 3 27B, Llama 3.1 8B, Qwen3 VL 235B, GLM 5 e Nemotron 3 Ultra subiram forte na saída, e só o Qwen3 Coder ficou mais barato.

Perguntas frequentes

Quais modelos de IA tiveram aumento de preço em julho de 2026?

Entre 14 e 15 de julho de 2026, 26 modelos subiram de preço no catálogo. Os maiores reajustes foram Gemma 3 27B (saída 2,81x), Llama 3.1 8B Instruct (2,67x), Qwen3 VL 235B A22B (2,16x) e Qwen3 30B A3B Instruct 2507 (1,55x). Os modelos do topo de inteligência, como Claude Fable 5 e GPT-5.6 Sol, não mexeram de preço.

Algum modelo ficou mais barato hoje?

Sim, seis modelos tiveram corte de preço. O mais relevante é o Qwen3 Coder 480B A35B, com saída caindo de US$ 1,80 para US$ 1,00 por milhão de tokens (queda de 44%). Os outros cinco cortes envolvem modelos menores ou com impacto marginal na conta.

Por que o preço de saída subiu mais que o de entrada?

Porque gerar tokens custa mais caro para o provedor do que recebê-los, e o reajuste recente reflete o custo real de modelos grandes rodando em produção. Para o cliente, isso significa que cargas com resposta longa — agentes, geração de código, sumarização — são as mais afetadas, enquanto pipelines focados em entrada (classificação, extração curta) sentem menos.

Leia também