Nemotron 3 Super ficou 2,25× mais caro em um dia
Quatro modelos subiram e quatro caíram nesta mudança de preço — e o que mais doeu foi o ajuste da NVIDIA, não o corte da Z.ai.
O reajuste que ninguém viu vir
Você abriu o painel de custos ontem e fechou com a mesma cara de quem abriu hoje: tem modelo que ficou quase 2,3 vezes mais caro da noite para o dia. Foi o que aconteceu com o Nemotron 3 Super, da NVIDIA, que saltou de US$ 0,40 para US$ 0,90 por milhão de tokens de saída — um aumento de 125% em uma única janela de cobrança. O token de entrada também subiu, de US$ 0,085 para US$ 0,30, ou 3,5 vezes o valor anterior.
Se você usa Nemotron em produção, essa é a hora de olhar para a fatura projetada antes de o próximo ciclo fechar.
Quem subiu, quem desceu
No total, oito preços mudaram ontem — quatro para cima e quatro para baixo. É um dia equilibrado em quantidade de movimentos, mas bem desigual em intensidade.
Os aumentos foram:
- Nemotron 3 Super (NVIDIA): +125% na saída, +253% na entrada.
- Qwen3.5 397B A17B: +54% na saída (de US$ 2,34 para US$ 3,60 por milhão).
- DeepSeek V4 Flash Latest: +41% na saída (de US$ 0,179 para US$ 0,252).
- DeepSeek V3.2: +5% na saída, em um segundo ajuste no mesmo dia.
Os cortes foram:
- Z.ai GLM 5.2: dois cortes consecutivos, primeiro de 0,572 para 0,308 (-46%), depois para 0,22 (-29% sobre o valor já reduzido). É o modelo que mais mudou de preço em 24 horas.
- MythoMax 13B: -45% na saída (de US$ 0,11 para US$ 0,06).
- DeepSeek V3.2: -5% na saída, no primeiro dos dois movimentos do dia.
| Modelo | Saída antes US$/M | Saída depois US$/M | Variação |
|---|---|---|---|
| Nemotron 3 Super | 0.4 | 0.9 | +125% |
| GLM 5.2 | 0.572 | 0.308 | -46% |
| MythoMax 13B | 0.11 | 0.06 | -45% |
| Qwen3.5 397B A17B | 2.34 | 3.6 | +54% |
| DeepSeek V4 Flash Latest | 0.1792 | 0.252 | +41% |
| GLM 5.2 | 0.308 | 0.22 | -29% |
| DeepSeek V3.2 | 0.4 | 0.38 | -5% |
| DeepSeek V3.2 | 0.38 | 0.4 | +5% |
O que isso diz sobre o tabuleiro
A NVIDIA não é conhecida por mexer em preço de API com frequência. Quando mexe, geralmente é para refletir custo de inferência em hardware dedicado — e um salto desse tamanho sugere que o modelo está sendo reprecificado para um novo regime de operação, não um ajuste de centavos. Para quem roteava tarefas de médio porte pelo Nemotron, a conta muda de figura.
Na ponta oposta, a Z.ai aproveitou o dia para fazer dois cortes agressivos no GLM 5.2. O modelo saiu de US$ 0,572 para US$ 0,22 por milhão de tokens de saída em menos de 24 horas — uma redução acumulada de 61%. É o tipo de movimento que costuma aparecer quando um provedor chinês quer ganhar volume em um segmento onde a concorrência está apertada.
A DeepSeek, por sua vez, mexeu duas vezes no V3.2 no mesmo dia: primeiro cortou 5%, depois subiu 5%. O efeito líquido é quase zero, mas a mensagem é de instabilidade — quem automatiza fallback entre modelos precisa estar atento a esse tipo de gangorra.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Opus 5 | 63.1 | 25 |
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Kimi K3 | 59.7 | 15 |
| Qwen3.8 Max | 58.1 | 6 |
Para quem isso muda alguma coisa
Se você roda o Nemotron 3 Super em produção para tarefas com muito token de saída — geração longa, raciocínio estendido, sumarização pesada — o impacto é direto: o mesmo volume de trabalho agora custa mais que o dobro. Vale reroteamento para o GLM 5.2, que está entre os modelos mais baratos acima de IQ 45 e ficou ainda mais em conta.
Se você usa Qwen3.5 397B A17B como modelo principal, o aumento de 54% na saída é relevante, mas o preço final (US$ 3,60 por milhão) ainda está dentro da faixa de modelos premium como o Claude Opus 5 (US$ 25 por milhão) e o GPT-5.6 Sol (US$ 10). O reajuste pesa mais para quem opera em escala.
Se você está no MythoMax 13B ou no DeepSeek V4 Flash Latest, a leitura é oposta: o primeiro ficou mais barato, o segundo ficou mais caro. Trocar um pelo outro depende do tipo de tarefa — MythoMax é modelo pequeno, focado emRoleplay e conversação; V4 Flash Latest é mais generalista.
Se nenhum desses modelos está no seu stack, este dia não muda nada para você. Mas vale guardar o padrão: agosto de 2026 já soma 31 modelos lançados nos últimos 30 dias, e o catálogo passa de 533 opções. Em um mercado assim, preço muda toda semana — e a planilha de custos precisa de revisão na mesma frequência.
Rever o roteamento hoje: quem usa Nemotron 3 Super deve testar GLM 5.2 como substituto mais barato, e quem tem Qwen3.5 397B em escala precisa simular o impacto dos 54% antes do próximo ciclo.
Perguntas frequentes
Por que o Nemotron 3 Super ficou tão mais caro de um dia para o outro?
O reajuste foi de 125% no token de saída e 253% no token de entrada, sem aviso público de mudança de tier ou hardware. Na prática, o modelo deixou de ser uma opção de baixo custo para tarefas com muita geração e passou a competir na faixa de modelos premium.
O GLM 5.2 da Z.ai realmente ficou 61% mais barato?
Foi o que aconteceu em duas etapas no mesmo dia: primeiro o preço de saída caiu de US$ 0,572 para US$ 0,308, e horas depois para US$ 0,22 por milhão de tokens. A redução acumulada é de 61% sobre o valor original.
Vale trocar o DeepSeek V3.2 por outro modelo depois dessas mudanças?
O V3.2 teve dois ajustes opostos no mesmo dia, com efeito líquido próximo de zero. Quem já usa não precisa migrar, mas quem está avaliando pode se beneficiar do GLM 5.2, que está mais barato e em faixa de preço semelhante.