Llama 4 Maverick cobra 42% menos que o Nemotron 70B e ainda entrega o dobro de inteligência
Comparativo entre dois pesos-pesados abertos da Meta e da NVIDIA mostra que tamanho de catálogo não é argumento quando a conta fecha no fim do mês.
O gancho que a conta mostra
Você está olhando para dois modelos abertos, dos Estados Unidos, que rodam sem licenciamento royalties. O Llama 4 Maverick, da Meta, chegou em abril de 2025 cobrando US$ 0,696 por milhão de tokens de saída. O Llama 3.1 Nemotron 70B Instruct, da NVIDIA, custa US$ 1,20 pelo mesmo volume. Em outras palavras, o modelo da Meta é 42% mais barato só na saída — e isso antes de você colocar qualquer cache no meio.
O detalhe que muda tudo: o índice de inteligência do Maverick é de 14,477, quase o dobro dos 7,425 do Nemotron. Você paga menos e leva mais.
Tamanho de catálogo não é argumento
O Nemotron 70B é denso: 70 bilhões de parâmetros ativos em 70 bilhões totais. É o tipo de arquitetura que roda em hardware mais simples e dispensa a ginástica de servir um mixture-of-experts. O Maverick é outra história: são 402 bilhões de parâmetros totais, mas só 17 bilhões ativos por inferência, distribuídos entre 128 especialistas. É como um restaurante com 128 chefs no quadro, mas só 17 cozinham seu prato por vez. Você não precisa contratar os outros para a sua conta de luz subir.
A velocidade também pesa a favor do Maverick: 86,45 tokens por segundo, contra 44,63 do Nemotron. Em produção, isso é a diferença entre um chat que responde antes do usuário piscar e outro que gera fila.
O que mudou entre um lançamento e outro
O Nemotron saiu em outubro de 2024 com corte de conhecimento em dezembro de 2023. O Maverick estreou em abril de 2025 com corte em agosto de 2024 — quase um ano a mais de mundo treinado dentro. Em categorias que dependem de atualidades ou de vocabulário técnico recente, essa diferença de oito meses é sentida.
A janela de contexto segue o mesmo movimento: 131 mil tokens no Nemotron, 1.048.576 no Maverick. São oito vezes mais espaço para colar código, PDF ou um repositório inteiro sem precisar truquear com chunking.
| Critério | Llama 4 Maverick | Llama 3.1 Nemotron 70B Instr |
|---|---|---|
| Índice de inteligência | 14.5 | 7.4 |
| Entrada US$/M | 0.2 | 1.2 |
| Saída US$/M | 0.696 | 1.2 |
| Contexto | 1.05M | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 86 | 45 |
| Índice de código | 16.3 | — |
| Índice agêntico | 1.2 | — |
Onde o Nemotron ainda faz sentido
Se você está montando um pipeline que precisa de compatibilidade com a arquitetura densa do Llama 3.1 — por exemplo, um fine-tune já existente, um servidor vLLM calibrado para 70B denso, ou um SLA que exige o menor hardware possível — o Nemotron ainda responde bem. Ele é texto puro, sem multimodalidade, e isso pode ser uma vantagem quando você quer negar vetores de imagem por contrato ou compliance.
Onde o Maverick ganha disparado é em tudo que envolve multimodalidade (texto + imagem → texto), janela grande de contexto e qualquer fluxo com muito token de saída. Um agente que cospe logs longos, um resumidor de vídeo, um extrator de tabela em PDF: tudo isso se beneficia dos 402B totais com apenas 17B ativos por chamada.
Para quem cada um vale
O Maverick vale para o time que já tem GPU para servir MoE — é o seu caso se você roda H100 ou A100 em cluster. Você paga US$ 0,696 por milhão na saída e leva quase o dobro de inteligência pelo mesmo real.
O Nemotron vale para o time que precisa do menor custo de hardware possível e já tem o pipeline denso funcionando. Pagar US$ 1,20 por milhão na saída só se justifica quando migrar para MoE custa mais caro do que a economia de 42% por alguns meses.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
A implicação prática
Se você ainda está rodando Nemotron em produção e a sua única razão é “é da família Llama”, é hora de testar o Maverick com a mesma carga. A diferença de 42% no token de saída paga o retrabalho de trocar de servidor em poucos meses — e ainda sobra orçamento no fim do ano.
Migre do Nemotron 70B para o Llama 4 Maverick assim que sua infraestrutura de inferência aceitar MoE; a economia de 42% na saída mais o salto de inteligência compensam o custo de migração em poucos meses.
Perguntas frequentes
Llama 4 Maverick é mais barato que o Nemotron 70B?
Sim. O Maverick cobra US$ 0,696 por milhão de tokens de saída, contra US$ 1,20 do Nemotron — uma diferença de 42% a favor do modelo da Meta, sem considerar cache de leitura.
Qual a diferença de arquitetura entre os dois modelos?
O Nemotron é denso, com 70B de parâmetros ativos em 70B totais. O Maverick é um mixture-of-experts com 402B totais mas apenas 17B ativos por inferência, distribuídos em 128 especialistas.
Quando usar o Nemotron em vez do Maverick?
Quando seu pipeline já está calibrado para arquitetura densa, seu hardware é limitado ou você precisa negar multimodalidade por compliance — nesses casos, a economia de migrar não compensa o retrabalho.