Nova 2 Lite custa 12,5× mais que Nemotron Nano no token de saída
Amazon e NVIDIA lançaram modelos de raciocínio em dezembro. Um entrega multimodalidade e contexto gigante, o outro entrega preço quase dez vezes menor e pesos abertos.
12,5 vezes mais caro por token de saída. É o que a Amazon cobra acima da NVIDIA no lançamento mais recente de cada uma. Em 1º de janeiro de 2026, os dois modelos estão na mesma prateleira de qualquer catálogo de API — e a diferença de preço é grande o suficiente para mudar a arquitetura do seu produto.
O que cada um entrega hoje
A Amazon colocou o Nova 2 Lite no catálogo em 2 de dezembro de 2025. A NVIDIA respondeu com o Nemotron 3 Nano 30B A3B doze dias depois. Ambos são modelos de raciocínio. Ambos vêm dos Estados Unidos. E ambos se anunciam para workloads de produção.
A diferença aparece no primeiro número que você olha: o índice de inteligência. O Nova 2 Lite marca 19,24, contra 14,54 do Nemotron Nano. Em torno de 32% a mais — o suficiente para colocá-lo no mesmo patamar do Mistral Devstral 2 2512, quinto colocado no ranking geral do dia. O Nemotron fica abaixo dos cinco primeiros.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Multimodalidade e contexto, onde a Amazon cobra
O Nova 2 Lite aceita texto, imagem, arquivo e vídeo e devolve texto. O Nemotron Nano só lê texto. Quem precisa alimentar o modelo com uma captura de tela, um PDF de 200 páginas ou um clipe de vídeo não tem escolha: tem de passar pelo Nova 2 Lite ou por outro multimodal.
A segunda vantagem do Nova 2 Lite é a janela de contexto. São 1 milhão de tokens, contra 262 mil do Nemotron. Em tarefas que exigem colar um repositório inteiro ou uma transcrição longa de call, o limite da NVIDIA aperta antes.
A conta no fim do mês
Aqui o jogo vira.
Preço de saída: US$ 2,50 por milhão de tokens no Nova 2 Lite, US$ 0,20 no Nemotron Nano. São 12,5 vezes a mais por token gerado. No preço de entrada, a diferença é de seis vezes (US$ 0,30 contra US$ 0,05). E o Nemotron ainda publica cache de leitura por US$ 0,025 por milhão — a Amazon não publicou o valor de cache no catálogo.
Juntando entrada e saída num uso típico, o blended do Nova 2 Lite fica em US$ 0,85 por milhão de tokens. O do Nemotron Nano fica em US$ 0,0875. Aproximadamente 9,7 vezes mais barato.
Soma a isso a velocidade medida: 248 tokens por segundo no Nemotron, 153 no Nova 2 Lite. Em pipelines de agente que disparam milhares de chamadas por hora, isso entra na conta de latência tanto quanto o preço.
O detalhe que muda a decisão
O Nemotron 3 Nano 30B A3B é um MoE de 31,6 bilhões de parâmetros, com 3,6 bilhões ativos. E vem com pesos abertos. Quem roda infraestrutura própria pode baixar e hospedar — o que zera o custo marginal de inferência se você já paga GPU ociosa.
Para workloads agentic, o índice agentic do Nemotron está em 1,99 e o de codificação em 14,37. Números modestos, mas compatíveis com a categoria. O Nova 2 Lite não publicou esses dois índices no catálogo, então a comparação direta não é possível — vale testar no seu caso de uso antes de cravar.
Quando cada um ganha
| Critério | Nova 2 Lite | Nemotron 3 Nano 30B A3B |
|---|---|---|
| Índice de inteligência | 19.2 | 14.5 |
| Entrada US$/M | 0.3 | 0.05 |
| Saída US$/M | 2.5 | 0.2 |
| Contexto | 1M | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 153 | 248 |
| Índice de código | — | 14.4 |
| Índice agêntico | — | 2.0 |
Nova 2 Lite ganha quando você precisa de multimodalidade (imagem, vídeo, arquivo) ou de mais de 262 mil tokens de contexto. A diferença de 32% no índice de inteligência e a janela quatro vezes maior são o que está sendo pago.
Nemotron 3 Nano ganha quando o workload é texto puro em volume — RAG, agente, classificação, extração — com janelas que cabem em 262 mil tokens. A conta cai quase dez vezes no blended, a latência melhora, e os pesos abertos permitem mover inferência para dentro de casa quando o volume justificar.
Reserve Nova 2 Lite para chamadas que exigem multimodalidade ou contexto longo; use Nemotron 3 Nano como motor padrão de texto em alto volume — a queda de quase 10× no preço blended muda o custo de rodar agentes em produção.
Perguntas frequentes
Nova 2 Lite vale o preço mais alto que o Nemotron Nano?
Vale se você precisa de multimodalidade (texto, imagem, vídeo, arquivo) ou de janela de contexto acima de 262 mil tokens. Se o caso é texto puro em volume, o Nemotron 3 Nano entrega a mesma categoria de raciocínio por 9,7 vezes menos no preço blended.
Nemotron 3 Nano serve para workloads agentic?
A NVIDIA o posiciona explicitamente para agentic AI e os pesos abertos permitem ajuste fino. Os índices agentic (1,99) e de codificação (14,37) são modestos frente ao topo do mercado, mas compatíveis com a categoria — vale prototipar antes de descartar.
Por que o cache do Nova 2 Lite não tem preço publicado?
O catálogo simplesmente não tornou o valor público até esta data. Se você depende de cache de leitura para cortar custo de prompts repetidos, essa lacuna é um ponto a considerar antes de colocar o modelo em produção.