Nemotron 3 Super oscilou 125% em 24 horas e ninguém avisou
Oito modelos mexeram no preço entre ontem e hoje; o caso da NVIDIA mostra como tarifa de API pode virar montanha-russa em um único dia.
Oito modelos mexeram no preço ontem, e o caso mais barulhento não é o que ficou mais barato — é o que mudou duas vezes no mesmo dia. O NVIDIA Nemotron 3 Super apareceu em duas entradas distintas na lista de alterações: primeiro caiu de US$ 0,90 para US$ 0,40 por milhão de tokens de saída (uma redução de 56%), depois voltou para US$ 0,90. Em 24 horas, o mesmo modelo foi de US$ 0,30 para US$ 0,085 e de volta a US$ 0,30 por milhão de tokens de entrada. Quem automatizou o roteamento de tráfego por preço acordou com uma conta diferente da que tinha na hora do almoço.
A montanha-russa da NVIDIA
A Nemotron 3 Super é uma das poucas ofertas abertas da NVIDIA para uso via API, então qualquer movimento nela mexe com quem busca alternativa aos modelos de fronteira. A queda para US$ 0,085/M de input parecia promoção de lançamento; a volta para US$ 0,30/M sugere erro de cadastro, teste de elasticidade ou ajuste de margem que não deu certo. O catálogo não informa o motivo — só registra que houve mudança. Para quem opera com orçamento fixo em dólar, isso é ruído demais para tratar como preço.
Os cortes que seguraram
Nem todo movimento foi de ida e volta. O Ling-3.0-flash, da InclusionAI, foi de US$ 0,22 para US$ 0,063 por milhão de tokens de saída — corte de 71% — e ficou lá. É o tipo de ajuste que reposiciona o modelo: com IQ 45,4 e preço de US$ 1,20/M de output agregado, ele entra na faixa dos modelos "acima de IQ 45 mais baratos do catálogo", disputando espaço com o MiniMax M3 (IQ 45,4, US$ 1,20/M) e o GPT-5.6 Luna (IQ 52,3, US$ 1,20/M). Para tarefas onde IQ em torno de 45 basta — classificação, extração, resumo curto — o Ling vira opção real.
O outro corte relevante é o do Z.ai GLM 5.2, que passou de US$ 0,6902 para US$ 0,5306 por milhão de tokens de entrada (queda de 23%) e de US$ 2,1692 para US$ 1,6676 por milhão de tokens de saída. Mas atenção: o GLM 5.2 também aparece na lista com um aumento anterior, de US$ 0,546 para US$ 0,6902. Ou seja, ao longo do dia ele subiu 26% e depois caiu 23% — o preço final está abaixo do inicial, mas acima do que estava no começo da manhã. Para quem mira o GLM como substituto de fronteira, a lição é a mesma do Nemotron: não fixe orçamento em uma cotação só.
Os aumentos discretos
| Modelo | Saída antes US$/M | Saída depois US$/M | Variação |
|---|---|---|---|
| Ling-3.0-flash | 0.22 | 0.063 | -71% |
| Nemotron 3 Super | 0.9 | 0.4 | -56% |
| Nemotron 3 Super | 0.4 | 0.9 | +125% |
| DeepSeek V4 Flash 0423 | 0.1764 | 0.28 | +59% |
| GLM 5.2 | 2.1692 | 1.6676 | -23% |
| GLM 5.2 | 1.716 | 2.1692 | +26% |
| Qwen3.5-122B-A10B | 2.08 | 2.4 | +15% |
| Kimi K2.6 | 2.4 | 2.48 | +3% |
No lado dos reajustes para cima, três modelos subiram sem volta. O DeepSeek V4 Flash 0423 foi de US$ 0,0882 para US$ 0,14 por milhão de tokens de entrada (alta de 59%) e de US$ 0,1764 para US$ 0,28 por milhão de tokens de saída. É o único corte de preço "real" do dia entre os modelos com IQ alto — o V4 Flash 0731, versão mais barata do catálogo acima de IQ 45, segue em US$ 0,18/M de output e não foi tocado. A versão 0423, mais antiga, é que pagou a conta.
O Qwen3.5-122B-A10B subiu 15% (de US$ 0,26 para US$ 0,29/M de entrada) e o MoonshotAI Kimi K2.6 subiu 3% (de US$ 0,57 para US$ 0,589/M de entrada). Ajustes pequenos em modelos que já não estavam no topo da lista de IQ — Kimi K2.6 fica atrás do Kimi K3 (IQ 59,7, US$ 15/M de output) — o que sugere repique de demanda ou correção de margem em vez de reposicionamento.
Para quem isso muda a escolha
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Opus 5 | 63.1 | 25 |
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Kimi K3 | 59.7 | 15 |
| Qwen3.8 Max | 58.1 | 6 |
Se você roda o Nemotron 3 Super em produção, o dia de hoje mostrou que o preço dele não é âncora — é variável. Vale cachear a cotação por algumas horas antes de redirecionar tráfego, ou aceitar que a fatura do mês vai oscilar. Se você roda o DeepSeek V4 Flash 0423 e estava pagando US$ 0,0882/M de input, a conta de agosto vai pesar mais: a alta de 59% é real e não foi revertida.
Se você estava olhando o Ling-3.0-flash de longe, hoje é o dia de testar: US$ 0,063/M de output é um dos preços mais baixos do catálogo para um modelo acima de IQ 45. E se você usa o GLM 5.2 como peça de custo fixo, atualize a planilha — o preço de hoje não é o de ontem, e pode não ser o de amanhã.
No fim, a mensagem do catálogo é simples: em 7 de agosto de 2026, com 531 modelos listados, preço de API ainda é variável de turno, não de mês.
Não trave orçamento em uma cotação só: cacheie preços por algumas horas, especialmente em modelos como Nemotron 3 Super e GLM 5.2, que mudaram duas vezes no mesmo dia.
Perguntas frequentes
Por que o Nemotron 3 Super mudou de preço duas vezes em um dia?
O catálogo só registra a alteração, não o motivo. Pode ter sido teste de elasticidade, erro de cadastro ou ajuste de margem revertido. Para o consumidor, o efeito prático é o mesmo: o preço não é estável e não deve ser tratado como referência fixa.
O Ling-3.0-flash realmente ficou tão barato assim?
Sim, dentro do catálogo atual: US$ 0,021 por milhão de tokens de entrada e US$ 0,063 por milhão de tokens de saída, com IQ 45,4. É um dos modelos mais baratos acima de IQ 45 listados hoje, ao lado do MiniMax M3 e do GPT-5.6 Luna.
Vale trocar o DeepSeek V4 Flash 0423 pelo 0731?
Se você usa a versão 0423 e o caso de uso cabe no 0731, vale reavaliar. O 0731 segue em US$ 0,18 por milhão de tokens de saída e não foi alterado hoje; o 0423 subiu 59% no input e 59% no output. Para workloads sensíveis a preço, o 0731 é a opção mais barata do catálogo acima de IQ 45.