Llama 4 Maverick custa 5x mais que Nemotron Nano 9B V2 e não raciocina
O modelo da Meta tem 1M de contexto e aceita imagem, mas o da NVIDIA cobra uma fração do preço e entrega raciocínio nativo.
A diferença de preço de saída é de 4,35x. A de IQ, 67%. A pergunta que vale ouro é: para qual tipo de trabalho cada um dos dois modelos faz sentido em 8 de outubro de 2025.
O Llama 4 Maverick chegou em abril pela Meta e cobra US$ 0,696 por milhão de tokens de saída. O Nemotron Nano 9B V2, da NVIDIA, foi lançado em setembro e cobra US$ 0,16 pela mesma quantidade. Os dois são pesos abertos, os dois vêm dos EUA, e nenhum dos dois é gratuito no catálogo. O resto é o que decide.
A conta, antes de tudo
Para cada milhão de tokens que sai do Maverick, você paga US$ 0,696. Para a mesma quantidade do Nemotron, US$ 0,16. Na entrada, a diferença é ainda maior: US$ 0,20 contra US$ 0,04 — cinco vezes mais barato. O custo blended, média ponderada que reflete uso típico, é de US$ 0,4225 no Maverick contra US$ 0,07 no Nemotron. Em volume, isso define orçamento no fim do mês.
| Critério | Llama 4 Maverick | Nemotron Nano 9B V2 |
|---|---|---|
| Índice de inteligência | 14.5 | 8.7 |
| Entrada US$/M | 0.2 | 0.04 |
| Saída US$/M | 0.696 | 0.16 |
| Contexto | 1.05M | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 86 | 147 |
| Índice de código | 16.3 | — |
| Índice agêntico | 1.2 | — |
O que o Maverick entrega a mais
São três coisas que o modelo da Meta faz e o da NVIDIA não. A primeira é multimodal: o Maverick aceita imagem e devolve texto, o Nemotron é só texto. Fluxo que depende de print, foto, PDF escaneado não roda no menor.
A segunda é a janela de contexto. O Maverick trabalha com 1.048.576 tokens, oito vezes os 131.072 do Nemotron. Quem joga livro, base de código grande ou transcrição longa no prompt precisa desse fôlego.
A terceira é a nota de inteligência: IQ 14,477 contra 8,677, e codificação em 16,277. No ranking do catálogo hoje, o Maverick é o quinto colocado, logo abaixo do gpt-oss-20b da OpenAI. O Nemotron não aparece no top 5.
O que o Nemotron devolve melhor
Três respostas a essa conta. A primeira é o raciocínio nativo — o Nemotron raciocina, o Maverick não. Em tarefas agentic e cadeias de pensamento, isso muda o resultado entregue.
A segunda é a velocidade: 147,18 tokens por segundo contra 86,45 do Maverick. Em processamento em massa, é SLA.
A terceira é o conhecimento: o corte do Nemotron é março de 2025, sete meses mais recente que o do Maverick (agosto de 2024). Para perguntas sobre eventos recentes, isso pesa.
E no fim das contas, o Nemotron é 9 bilhões de parâmetros densos, rodando em hardware comum. O Maverick é MoE de 402 bilhões no total, com 17B ativos por inferência. Mesmo aberto, exige infraestrutura de outro porte.
Quando cada um ganha
Maverick ganha quando você precisa de multimodal, de contexto acima de 128K tokens, ou quando a diferença de IQ aparece no resultado. Geração de código assistida, análise de documentos longos com imagem, fluxos onde cada ponto de qualidade vale o preço.
Nemotron Nano 9B V2 ganha quando o volume é alto, o orçamento é curto, a tarefa cabe em 128K e é só texto. Classificação, extração, sumarização em massa, agentes simples, roteamento de intenção. O raciocínio nativo ajuda onde cadeia de pensamento importa, e a velocidade deixa a fila andar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
O que fazer com isso hoje
Se você roda um SaaS com 10 milhões de chamadas por mês e cada chamada cospe 500 tokens de saída, trocar o Maverick pelo Nemotron economiza cerca de US$ 2.680 por mês. Em RAG, extração e sumarização onde o menor basta, esse dinheiro volta para o caixa. Em código assistido de qualidade alta, multimodal ou documentos longos, o Maverick cobra caro, mas devolve.
Maverick para multimodal, contexto acima de 128K ou qualidade máxima com orçamento folgada; Nemotron Nano 9B V2 para volume alto de texto puro com raciocínio e custo baixo.
Perguntas frequentes
Qual é mais barato, Llama 4 Maverick ou Nemotron Nano 9B V2?
O Nemotron Nano 9B V2 é mais barato em qualquer métrica. Cobra US$ 0,04 por milhão de tokens de entrada e US$ 0,16 por milhão de saída, contra US$ 0,20 e US$ 0,696 do Maverick. O custo blended fica em US$ 0,07 contra US$ 0,4225 — cerca de seis vezes menor.
O Llama 4 Maverick aceita imagem?
Sim, o Maverick é multimodal: aceita texto e imagem e devolve texto. O Nemotron Nano 9B V2 só trabalha com texto, então qualquer fluxo com print, foto ou PDF escaneado elimina o modelo menor.
Qual dos dois tem raciocínio nativo?
O Nemotron Nano 9B V2 tem raciocínio ligado por padrão. O Maverick não tem modo de raciocínio e responde direto. Em tarefas que pedem cadeia de pensamento, isso pesa a favor do modelo menor.