FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Nemotron 3 Super oscilou 125% em 24 horas e ninguém avisou

Oito modelos mexeram no preço entre ontem e hoje; o caso da NVIDIA mostra como tarifa de API pode virar montanha-russa em um único dia.

Redação FalaVIP IA 4 min de leitura
US$ 0,40por milhão de tokens de saída do Nemotron 3 Super após o corte
US$ 0,90por milhão de tokens de saída do Nemotron 3 Super antes do corte
US$ 0,063por milhão de tokens de saída do Ling-3.0-flash após o corte

Oito modelos mexeram no preço ontem, e o caso mais barulhento não é o que ficou mais barato — é o que mudou duas vezes no mesmo dia. O NVIDIA Nemotron 3 Super apareceu em duas entradas distintas na lista de alterações: primeiro caiu de US$ 0,90 para US$ 0,40 por milhão de tokens de saída (uma redução de 56%), depois voltou para US$ 0,90. Em 24 horas, o mesmo modelo foi de US$ 0,30 para US$ 0,085 e de volta a US$ 0,30 por milhão de tokens de entrada. Quem automatizou o roteamento de tráfego por preço acordou com uma conta diferente da que tinha na hora do almoço.

A montanha-russa da NVIDIA

Variação do preço de saída (%)
Ling-3.0-flash-71Nemotron 3 Super-56Nemotron 3 Super125DeepSeek V4 Flash 042359GLM 5.2-23GLM 5.226Qwen3.5-122B-A10B15Kimi K2.63%

A Nemotron 3 Super é uma das poucas ofertas abertas da NVIDIA para uso via API, então qualquer movimento nela mexe com quem busca alternativa aos modelos de fronteira. A queda para US$ 0,085/M de input parecia promoção de lançamento; a volta para US$ 0,30/M sugere erro de cadastro, teste de elasticidade ou ajuste de margem que não deu certo. O catálogo não informa o motivo — só registra que houve mudança. Para quem opera com orçamento fixo em dólar, isso é ruído demais para tratar como preço.

Os cortes que seguraram

Nem todo movimento foi de ida e volta. O Ling-3.0-flash, da InclusionAI, foi de US$ 0,22 para US$ 0,063 por milhão de tokens de saída — corte de 71% — e ficou lá. É o tipo de ajuste que reposiciona o modelo: com IQ 45,4 e preço de US$ 1,20/M de output agregado, ele entra na faixa dos modelos "acima de IQ 45 mais baratos do catálogo", disputando espaço com o MiniMax M3 (IQ 45,4, US$ 1,20/M) e o GPT-5.6 Luna (IQ 52,3, US$ 1,20/M). Para tarefas onde IQ em torno de 45 basta — classificação, extração, resumo curto — o Ling vira opção real.

O outro corte relevante é o do Z.ai GLM 5.2, que passou de US$ 0,6902 para US$ 0,5306 por milhão de tokens de entrada (queda de 23%) e de US$ 2,1692 para US$ 1,6676 por milhão de tokens de saída. Mas atenção: o GLM 5.2 também aparece na lista com um aumento anterior, de US$ 0,546 para US$ 0,6902. Ou seja, ao longo do dia ele subiu 26% e depois caiu 23% — o preço final está abaixo do inicial, mas acima do que estava no começo da manhã. Para quem mira o GLM como substituto de fronteira, a lição é a mesma do Nemotron: não fixe orçamento em uma cotação só.

Os aumentos discretos

Preços que mudaram no dia
ModeloSaída antes US$/MSaída depois US$/MVariação
Ling-3.0-flash0.220.063-71%
Nemotron 3 Super0.90.4-56%
Nemotron 3 Super0.40.9+125%
DeepSeek V4 Flash 04230.17640.28+59%
GLM 5.22.16921.6676-23%
GLM 5.21.7162.1692+26%
Qwen3.5-122B-A10B2.082.4+15%
Kimi K2.62.42.48+3%
Comparação entre duas capturas consecutivas do catálogo (2x/dia).

No lado dos reajustes para cima, três modelos subiram sem volta. O DeepSeek V4 Flash 0423 foi de US$ 0,0882 para US$ 0,14 por milhão de tokens de entrada (alta de 59%) e de US$ 0,1764 para US$ 0,28 por milhão de tokens de saída. É o único corte de preço "real" do dia entre os modelos com IQ alto — o V4 Flash 0731, versão mais barata do catálogo acima de IQ 45, segue em US$ 0,18/M de output e não foi tocado. A versão 0423, mais antiga, é que pagou a conta.

O Qwen3.5-122B-A10B subiu 15% (de US$ 0,26 para US$ 0,29/M de entrada) e o MoonshotAI Kimi K2.6 subiu 3% (de US$ 0,57 para US$ 0,589/M de entrada). Ajustes pequenos em modelos que já não estavam no topo da lista de IQ — Kimi K2.6 fica atrás do Kimi K3 (IQ 59,7, US$ 15/M de output) — o que sugere repique de demanda ou correção de margem em vez de reposicionamento.

Para quem isso muda a escolha

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Opus 563.125
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
Qwen3.8 Max58.16
Entre os 531 modelos disponíveis no catálogo nesta data.

Se você roda o Nemotron 3 Super em produção, o dia de hoje mostrou que o preço dele não é âncora — é variável. Vale cachear a cotação por algumas horas antes de redirecionar tráfego, ou aceitar que a fatura do mês vai oscilar. Se você roda o DeepSeek V4 Flash 0423 e estava pagando US$ 0,0882/M de input, a conta de agosto vai pesar mais: a alta de 59% é real e não foi revertida.

Se você estava olhando o Ling-3.0-flash de longe, hoje é o dia de testar: US$ 0,063/M de output é um dos preços mais baixos do catálogo para um modelo acima de IQ 45. E se você usa o GLM 5.2 como peça de custo fixo, atualize a planilha — o preço de hoje não é o de ontem, e pode não ser o de amanhã.

No fim, a mensagem do catálogo é simples: em 7 de agosto de 2026, com 531 modelos listados, preço de API ainda é variável de turno, não de mês.

Em uma frase

Não trave orçamento em uma cotação só: cacheie preços por algumas horas, especialmente em modelos como Nemotron 3 Super e GLM 5.2, que mudaram duas vezes no mesmo dia.

Perguntas frequentes

Por que o Nemotron 3 Super mudou de preço duas vezes em um dia?

O catálogo só registra a alteração, não o motivo. Pode ter sido teste de elasticidade, erro de cadastro ou ajuste de margem revertido. Para o consumidor, o efeito prático é o mesmo: o preço não é estável e não deve ser tratado como referência fixa.

O Ling-3.0-flash realmente ficou tão barato assim?

Sim, dentro do catálogo atual: US$ 0,021 por milhão de tokens de entrada e US$ 0,063 por milhão de tokens de saída, com IQ 45,4. É um dos modelos mais baratos acima de IQ 45 listados hoje, ao lado do MiniMax M3 e do GPT-5.6 Luna.

Vale trocar o DeepSeek V4 Flash 0423 pelo 0731?

Se você usa a versão 0423 e o caso de uso cabe no 0731, vale reavaliar. O 0731 segue em US$ 0,18 por milhão de tokens de saída e não foi alterado hoje; o 0423 subiu 59% no input e 59% no output. Para workloads sensíveis a preço, o 0731 é a opção mais barata do catálogo acima de IQ 45.

Leia também