Nemotron 3 Ultra sobe 64% no output em dia de cortes no catálogo
Das onze alterações de preço de hoje, oito foram para baixo — mas o modelo de 550B da NVIDIA foi na contramão e viu o token de saída saltar de US$ 2,20 para US$ 3,60 por milhão.
A conta chegou diferente para quem usa o Nemotron 3 Ultra da NVIDIA. Em um dia em que oito modelos do catálogo ficaram mais baratos, o modelo de 550B parâmetros foi na contramão e viu o preço do token de saída saltar 64% — de US$ 2,20 para US$ 3,60 por milhão de tokens.
O balanço das últimas 24 horas soma onze alterações: duas altas e oito reduções, segundo o recorte do catálogo. A lista pública detalha oito delas — todas com nome, criador e preço anterior e atual. A média do dia é de cortes modestos, entre 5% e 10%. O Nemotron 3 Ultra destoa completamente.
O mapa do dia: oito cortes, dois aumentos
O catálogo tem mais de 521 modelos ativos hoje, vindos de 66 criadores. No recorte do dia, a maioria dos ajustes foi para baixo — o oposto do que se costuma ver quando um modelo top de linha chega e força reposicionamento de tabela. Os dois aumentos do dia são a exceção: o Nemotron 3 Ultra, com 64%, e o Arcee Trinity Large Thinking, com 6% no output.
NVIDIA contra a maré
O Nemotron 3 Ultra é a maior aposta aberta da NVIDIA em modelo hospedado: 550 bilhões de parâmetros, arquitetura MoE com 55B ativos por inferência. Custava US$ 0,50 por milhão de tokens de entrada e US$ 2,20 de saída; agora são US$ 0,60 e US$ 3,60. O reajuste de input é de 20%; o de output, de quase dois terços. Para um workload de geração longa — resumo de documentos, raciocínio encadeado, agentes — o impacto na fatura é desproporcional: a maior parte do custo mora no token que sai, não no que entra.
| Modelo | Saída antes US$/M | Saída depois US$/M | Variação |
|---|---|---|---|
| Nemotron 3 Ultra | 2.2 | 3.6 | +64% |
| Qwen3 30B A3B Instruct 2507 | 0.3 | 0.1931 | -36% |
| Kimi K2.6 | 3.42 | 2.72 | -20% |
| Nemotron 3 Super | 0.45 | 0.4 | -11% |
| Kimi K2.7 Code | 3.75 | 3.5 | -7% |
| gpt-oss-20b | 0.14 | 0.13 | -7% |
| GLM 5.2 | 2.3936 | 2.2176 | -7% |
| Trinity Large Thinking | 0.8 | 0.85 | +6% |
Para quem isso importa: aplicações que já migraram workloads de reasoning para o Nemotron 3 Ultra e que não estão travadas em contrato anual. Para quem não muda nada: quem usa o irmão menor, o Nemotron 3 Super (120B), que pelo contrário ficou um pouco mais barato — input subiu 6%, mas output caiu 11%.
Qwen lidera o corte, Kimi vem logo atrás
No lado oposto, o corte mais agressivo do dia veio da Alibaba, via Qwen. O Qwen3 30B A3B Instruct 2507 viu o preço de entrada cair de US$ 0,10 para US$ 0,0482 por milhão, e o de saída de US$ 0,30 para US$ 0,1931. É quase metade do que custava ontem. Para um modelo de 30B com ativação esparsa de 3B, o novo patamar coloca o Qwen entre os mais baratos por token de qualquer modelo de peso médio à venda no catálogo.
Logo atrás, o Kimi K2.6 da MoonshotAI também merece atenção: saiu de US$ 3,42 para US$ 2,72 no token de saída, corte de 20%. É menos agressivo que o da Qwen em percentual, mas em valor absoluto a economia por milhão de tokens é maior — US$ 0,70 a menos. Para quem roda o Kimi em volume — chatbots, classificação, pipelines de RAG — o desconto se acumula rápido.
O restante do dia é ajuste fino: GLM 5.2, Kimi K2.7 Code e gpt-oss-20b todos na faixa dos 7% de corte, com Arcee Trinity Large Thinking subindo 6% no output e caindo 12% no input — mudança pequena em ambas as direções.
Para quem isso muda a conta
A leitura prática é simples: se a sua stack depende do Nemotron 3 Ultra, é hora de revisar o orçamento antes do próximo ciclo de cobrança. Se você está no Qwen3 30B ou no Kimi K2.6, o custo cai sem renegociar contrato nem trocar provedor. E se você ainda está avaliando modelo, vale lembrar que o snapshot de hoje lista o MiniMax M3, o GPT-5.6 Luna e o DeepSeek V4 Pro 0423 como os mais baratos acima de IQ 45 — todos abaixo de US$ 2 por milhão de tokens de saída.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Opus 5 | 63.1 | 25 |
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Kimi K3 | 59.7 | 15 |
| GPT-5.6 Terra | 56.6 | 12 |
A conta de API raramente cai sozinha. Quando cai, é bom checar se não é corte cosmético no input enquanto o output — que é o que pesa em geração — continua subindo.
Se a sua fatura depende do Nemotron 3 Ultra, reveja o orçamento agora; se está no Qwen3 30B ou no Kimi K2.6, o custo cai sem renegociar nada.
Perguntas frequentes
Qual modelo ficou mais caro hoje (25 de julho de 2026)?
O NVIDIA Nemotron 3 Ultra, cujo token de saída subiu de US$ 2,20 para US$ 3,60 por milhão — alta de 64%. É a única mudança acima de 10% no lado dos aumentos.
Qual modelo teve o maior corte de preço hoje?
O Qwen3 30B A3B Instruct 2507, da Alibaba: o preço de saída caiu de US$ 0,30 para US$ 0,1931 por milhão de tokens — redução de cerca de 36%. O input também caiu pela metade, de US$ 0,10 para US$ 0,0482.
Outros modelos da NVIDIA também subiram de preço?
Não. O Nemotron 3 Super (120B) teve corte no preço de saída, de US$ 0,45 para US$ 0,40 por milhão. Apenas o modelo Ultra, de 550B parâmetros, foi reajustado para cima nas duas direções (input e output).