FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Qwen3 14B derruba preço de saída em 74%; Gemma 4 31B encarece 49%

Em um único dia, o catálogo registrou cortes agressivos em modelos chineses e aumentos em Google e MiniMax — e isso muda o cálculo de quem paga a fatura da API.

Redação FalaVIP IA 3 min de leitura
US$ 0,24por milhão de tokens de saída no Qwen3 14B (era US$ 0,91)
+49%no preço de saída do Google Gemma 4 31B
US$ 3,80por milhão de tokens de saída no Kimi K2.7 Code (era US$ 4,40)

Ontem você pagava US$ 0,91 por milhão de tokens de saída no Qwen3 14B. Hoje paga US$ 0,24. Em um único dia, a Alibaba cortou 74% do preço de saída desse modelo open-weight de 14B parâmetros — uma das mudanças de tabela que o catálogo registrou nas últimas 24 horas.

Variação do preço de saída (%)
Qwen3 14B-74Gemma 4 31B49MiniMax M218GLM 5.2-15Kimi K2.7 Code-14Kimi K2.6-14Nemotron 3 Super-12Gemma 4 26B A4B 13%

No recorte geral, cinco foram redução e três foram aumento. É um dia típico do mercado de APIs em 2026: quem tem escala derruba preço; quem aposta em diferenciação cobra mais. E quem roda o modelo errado hoje vai pagar a conta amanhã.

O corte do dia: Qwen3 14B

A mudança do Qwen3 14B é a que muda a fatura mais rápido. O preço de entrada também caiu quase pela metade — de US$ 0,2275 para US$ 0,12 por milhão de tokens. Isso coloca o modelo chinês abaixo de várias opções intermediárias-americanas para trabalho de classificação, extração e resumos em volume.

Mas atenção ao release: quando o comunicado diz "74% mais barato", ele está falando só do token de saída. Se a sua chamada gera muito mais tokens de entrada do que de saída (RAG com prompt longo, por exemplo), a economia real vai ser menor — e o número correto a olhar é o da tabela, não o do headline.

Preços que mudaram no dia
ModeloSaída antes US$/MSaída depois US$/MVariação
Qwen3 14B0.910.24-74%
Gemma 4 31B0.370.55+49%
MiniMax M21.021.2+18%
GLM 5.20.91520.7788-15%
Kimi K2.7 Code4.43.8-14%
Kimi K2.643.42-14%
Nemotron 3 Super0.4550.4-12%
Gemma 4 26B A4B 0.30.34+13%
Comparação entre duas capturas consecutivas do catálogo (2x/dia).

Quem apertou o cerco

Do lado dos aumentos, o caso mais agressivo é o do Google Gemma 4 31B. O preço de saída subiu de US$ 0,37 para US$ 0,55 por milhão de tokens — quase 49% em um dia. O preço de entrada também subiu, de US$ 0,12 para US$ 0,22. Quem migrou para o Gemma 4 31B por causa do custo vai levar um susto na próxima invoice.

O Google também mexeu no Gemma 4 26B A4B, mas de forma mais sutil: preço de entrada caiu (US$ 0,10 → US$ 0,07), enquanto o de saída subiu (US$ 0,30 → US$ 0,34). A leitura possível é reposicionamento — entrada mais barata para atrair quem usa em batch, saída mais cara para quem consome muito completion.

A MiniMax também subiu o MiniMax M2 em 18% — preço de saída de US$ 1,02 para US$ 1,20 por milhão de tokens. Não é absurdo, mas é a primeira coisa que se nota quando o catálogo da própria casa encarece do dia para a noite.

Kimi e NVIDIA também cederam

A MoonshotAI aproveitou o dia para cortar a linha Kimi. O Kimi K2.7 Code (modelo voltado a agentes de código) caiu de US$ 4,40 para US$ 3,80 por milhão de tokens de saída, e o Kimi K2.6 foi de US$ 4,00 para US$ 3,42. Em coding agents, onde cada chamada pode gerar milhares de tokens de saída por hora, isso é economia real para quem roda em produção.

A Z.ai também cortou o GLM 5.2 em cerca de 15% — preço de saída de US$ 0,9152 para US$ 0,7788 por milhão de tokens. E a NVIDIA fez o corte mais discreto do dia no Nemotron 3 Super 120B-A12B: preço de entrada despencou de US$ 0,21 para US$ 0,085 (menos da metade), enquanto o de saída mal se mexeu (US$ 0,455 → US$ 0,40). Sinalização clara: baratinho para pré-processar, completion segue caro.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
GPT-5.6 Terra56.612
Grok 4.555.86
Entre os 509 modelos disponíveis no catálogo nesta data.

O que muda na sua decisão

Para quem escolhe modelo pela fatura, este é um dia em que vale revisar três coisas antes de fechar a próxima sprint:

  1. Se você roda muito Qwen3 14B em produção, ajuste a rota de inference hoje mesmo — 74% mais barato no output é dinheiro que fica na mesa até você trocar.
  2. Se migrou recentemente para o Gemma 4 31B por custo, o cálculo mudou. Compare com o Gemma 4 26B A4B ou volte a olhar o Qwen3 14B antes da próxima fatura.
  3. Se depende de agentes de código rodando Kimi K2.7 Code, a janela ficou favorável — vale simular uma rota de fallback para o K2.6 também, que caiu junto.

Para quem está no topo do mercado e paga US$ 50 por milhão de tokens de saída no Claude Fable 5 ou US$ 10 no GPT-5.6 Sol, nada muda. Esses modelos não mexem em preço — vendem inteligência de fronteira, não commodity. A briga de preço de hoje é toda na faixa intermediária, e quem decide nessa faixa é você.

Em uma frase

Hoje vale rever o que roda em Qwen3 14B (74% mais barato no output) e repensar o Gemma 4 31B (+49% na saída) antes da próxima fatura — quem não se mexe fica com o custo antigo.

Leia também