FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Nemotron 3 Ultra sobe 64% no output em dia de cortes no catálogo

Das onze alterações de preço de hoje, oito foram para baixo — mas o modelo de 550B da NVIDIA foi na contramão e viu o token de saída saltar de US$ 2,20 para US$ 3,60 por milhão.

Redação FalaVIP IA 3 min de leitura
US$ 3,60por milhão de tokens de saída no Nemotron 3 Ultra (era US$ 2,20)
US$ 0,1931por milhão de tokens de saída no Qwen3 30B A3B (era US$ 0,30)
US$ 2,72por milhão de tokens de saída no Kimi K2.6 (era US$ 3,42)

A conta chegou diferente para quem usa o Nemotron 3 Ultra da NVIDIA. Em um dia em que oito modelos do catálogo ficaram mais baratos, o modelo de 550B parâmetros foi na contramão e viu o preço do token de saída saltar 64% — de US$ 2,20 para US$ 3,60 por milhão de tokens.

O balanço das últimas 24 horas soma onze alterações: duas altas e oito reduções, segundo o recorte do catálogo. A lista pública detalha oito delas — todas com nome, criador e preço anterior e atual. A média do dia é de cortes modestos, entre 5% e 10%. O Nemotron 3 Ultra destoa completamente.

Variação do preço de saída (%)
Nemotron 3 Ultra64Qwen3 30B A3B Instruct 2507-36Kimi K2.6-20Nemotron 3 Super-11Kimi K2.7 Code-7gpt-oss-20b-7GLM 5.2-7Trinity Large Thinking6%

O mapa do dia: oito cortes, dois aumentos

O catálogo tem mais de 521 modelos ativos hoje, vindos de 66 criadores. No recorte do dia, a maioria dos ajustes foi para baixo — o oposto do que se costuma ver quando um modelo top de linha chega e força reposicionamento de tabela. Os dois aumentos do dia são a exceção: o Nemotron 3 Ultra, com 64%, e o Arcee Trinity Large Thinking, com 6% no output.

NVIDIA contra a maré

O Nemotron 3 Ultra é a maior aposta aberta da NVIDIA em modelo hospedado: 550 bilhões de parâmetros, arquitetura MoE com 55B ativos por inferência. Custava US$ 0,50 por milhão de tokens de entrada e US$ 2,20 de saída; agora são US$ 0,60 e US$ 3,60. O reajuste de input é de 20%; o de output, de quase dois terços. Para um workload de geração longa — resumo de documentos, raciocínio encadeado, agentes — o impacto na fatura é desproporcional: a maior parte do custo mora no token que sai, não no que entra.

Preços que mudaram no dia
ModeloSaída antes US$/MSaída depois US$/MVariação
Nemotron 3 Ultra2.23.6+64%
Qwen3 30B A3B Instruct 25070.30.1931-36%
Kimi K2.63.422.72-20%
Nemotron 3 Super0.450.4-11%
Kimi K2.7 Code3.753.5-7%
gpt-oss-20b0.140.13-7%
GLM 5.22.39362.2176-7%
Trinity Large Thinking0.80.85+6%
Comparação entre duas capturas consecutivas do catálogo (2x/dia).

Para quem isso importa: aplicações que já migraram workloads de reasoning para o Nemotron 3 Ultra e que não estão travadas em contrato anual. Para quem não muda nada: quem usa o irmão menor, o Nemotron 3 Super (120B), que pelo contrário ficou um pouco mais barato — input subiu 6%, mas output caiu 11%.

Qwen lidera o corte, Kimi vem logo atrás

No lado oposto, o corte mais agressivo do dia veio da Alibaba, via Qwen. O Qwen3 30B A3B Instruct 2507 viu o preço de entrada cair de US$ 0,10 para US$ 0,0482 por milhão, e o de saída de US$ 0,30 para US$ 0,1931. É quase metade do que custava ontem. Para um modelo de 30B com ativação esparsa de 3B, o novo patamar coloca o Qwen entre os mais baratos por token de qualquer modelo de peso médio à venda no catálogo.

Logo atrás, o Kimi K2.6 da MoonshotAI também merece atenção: saiu de US$ 3,42 para US$ 2,72 no token de saída, corte de 20%. É menos agressivo que o da Qwen em percentual, mas em valor absoluto a economia por milhão de tokens é maior — US$ 0,70 a menos. Para quem roda o Kimi em volume — chatbots, classificação, pipelines de RAG — o desconto se acumula rápido.

O restante do dia é ajuste fino: GLM 5.2, Kimi K2.7 Code e gpt-oss-20b todos na faixa dos 7% de corte, com Arcee Trinity Large Thinking subindo 6% no output e caindo 12% no input — mudança pequena em ambas as direções.

Para quem isso muda a conta

A leitura prática é simples: se a sua stack depende do Nemotron 3 Ultra, é hora de revisar o orçamento antes do próximo ciclo de cobrança. Se você está no Qwen3 30B ou no Kimi K2.6, o custo cai sem renegociar contrato nem trocar provedor. E se você ainda está avaliando modelo, vale lembrar que o snapshot de hoje lista o MiniMax M3, o GPT-5.6 Luna e o DeepSeek V4 Pro 0423 como os mais baratos acima de IQ 45 — todos abaixo de US$ 2 por milhão de tokens de saída.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Opus 563.125
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
GPT-5.6 Terra56.612
Entre os 521 modelos disponíveis no catálogo nesta data.

A conta de API raramente cai sozinha. Quando cai, é bom checar se não é corte cosmético no input enquanto o output — que é o que pesa em geração — continua subindo.

Em uma frase

Se a sua fatura depende do Nemotron 3 Ultra, reveja o orçamento agora; se está no Qwen3 30B ou no Kimi K2.6, o custo cai sem renegociar nada.

Perguntas frequentes

Qual modelo ficou mais caro hoje (25 de julho de 2026)?

O NVIDIA Nemotron 3 Ultra, cujo token de saída subiu de US$ 2,20 para US$ 3,60 por milhão — alta de 64%. É a única mudança acima de 10% no lado dos aumentos.

Qual modelo teve o maior corte de preço hoje?

O Qwen3 30B A3B Instruct 2507, da Alibaba: o preço de saída caiu de US$ 0,30 para US$ 0,1931 por milhão de tokens — redução de cerca de 36%. O input também caiu pela metade, de US$ 0,10 para US$ 0,0482.

Outros modelos da NVIDIA também subiram de preço?

Não. O Nemotron 3 Super (120B) teve corte no preço de saída, de US$ 0,45 para US$ 0,40 por milhão. Apenas o modelo Ultra, de 550B parâmetros, foi reajustado para cima nas duas direções (input e output).

Leia também