FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Llama 4 Maverick cobra 42% menos que o Nemotron 70B e ainda entrega o dobro de inteligência

Comparativo entre dois pesos-pesados abertos da Meta e da NVIDIA mostra que tamanho de catálogo não é argumento quando a conta fecha no fim do mês.

Redação FalaVIP IA 3 min de leitura
US$ 0,696por milhão de tokens de saída no Llama 4 Maverick
US$ 1,20por milhão de tokens de saída no Nemotron 70B
14,477índice de inteligência do Maverick contra 7,425 do Nemotron

O gancho que a conta mostra

Você está olhando para dois modelos abertos, dos Estados Unidos, que rodam sem licenciamento royalties. O Llama 4 Maverick, da Meta, chegou em abril de 2025 cobrando US$ 0,696 por milhão de tokens de saída. O Llama 3.1 Nemotron 70B Instruct, da NVIDIA, custa US$ 1,20 pelo mesmo volume. Em outras palavras, o modelo da Meta é 42% mais barato só na saída — e isso antes de você colocar qualquer cache no meio.

O detalhe que muda tudo: o índice de inteligência do Maverick é de 14,477, quase o dobro dos 7,425 do Nemotron. Você paga menos e leva mais.

Preço de saída (US$ por milhão de tokens)
Llama 4 Maverick0,696Llama 3.1 Nemotron 70B Instr1,2US$/M
Fonte: OpenRouter

Tamanho de catálogo não é argumento

O Nemotron 70B é denso: 70 bilhões de parâmetros ativos em 70 bilhões totais. É o tipo de arquitetura que roda em hardware mais simples e dispensa a ginástica de servir um mixture-of-experts. O Maverick é outra história: são 402 bilhões de parâmetros totais, mas só 17 bilhões ativos por inferência, distribuídos entre 128 especialistas. É como um restaurante com 128 chefs no quadro, mas só 17 cozinham seu prato por vez. Você não precisa contratar os outros para a sua conta de luz subir.

A velocidade também pesa a favor do Maverick: 86,45 tokens por segundo, contra 44,63 do Nemotron. Em produção, isso é a diferença entre um chat que responde antes do usuário piscar e outro que gera fila.

O que mudou entre um lançamento e outro

O Nemotron saiu em outubro de 2024 com corte de conhecimento em dezembro de 2023. O Maverick estreou em abril de 2025 com corte em agosto de 2024 — quase um ano a mais de mundo treinado dentro. Em categorias que dependem de atualidades ou de vocabulário técnico recente, essa diferença de oito meses é sentida.

A janela de contexto segue o mesmo movimento: 131 mil tokens no Nemotron, 1.048.576 no Maverick. São oito vezes mais espaço para colar código, PDF ou um repositório inteiro sem precisar truquear com chunking.

Llama 4 Maverick × Llama 3.1 Nemotron 70B Instr
CritérioLlama 4 MaverickLlama 3.1 Nemotron 70B Instr
Índice de inteligência14.57.4
Entrada US$/M0.21.2
Saída US$/M0.6961.2
Contexto1.05M131k
Pesos abertossimsim
Velocidade (tok/s)8645
Índice de código16.3
Índice agêntico1.2

Onde o Nemotron ainda faz sentido

Se você está montando um pipeline que precisa de compatibilidade com a arquitetura densa do Llama 3.1 — por exemplo, um fine-tune já existente, um servidor vLLM calibrado para 70B denso, ou um SLA que exige o menor hardware possível — o Nemotron ainda responde bem. Ele é texto puro, sem multimodalidade, e isso pode ser uma vantagem quando você quer negar vetores de imagem por contrato ou compliance.

Onde o Maverick ganha disparado é em tudo que envolve multimodalidade (texto + imagem → texto), janela grande de contexto e qualquer fluxo com muito token de saída. Um agente que cospe logs longos, um resumidor de vídeo, um extrator de tabela em PDF: tudo isso se beneficia dos 402B totais com apenas 17B ativos por chamada.

Para quem cada um vale

O Maverick vale para o time que já tem GPU para servir MoE — é o seu caso se você roda H100 ou A100 em cluster. Você paga US$ 0,696 por milhão na saída e leva quase o dobro de inteligência pelo mesmo real.

O Nemotron vale para o time que precisa do menor custo de hardware possível e já tem o pipeline denso funcionando. Pagar US$ 1,20 por milhão na saída só se justifica quando migrar para MoE custa mais caro do que a economia de 42% por alguns meses.

Índice de inteligência (Artificial Analysis)
Llama 4 Maverick14,5Llama 3.1 Nemotron 70B Instr7,4índice
Fonte: Artificial Analysis
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 263 modelos disponíveis no catálogo nesta data.

A implicação prática

Se você ainda está rodando Nemotron em produção e a sua única razão é “é da família Llama”, é hora de testar o Maverick com a mesma carga. A diferença de 42% no token de saída paga o retrabalho de trocar de servidor em poucos meses — e ainda sobra orçamento no fim do ano.

Em uma frase

Migre do Nemotron 70B para o Llama 4 Maverick assim que sua infraestrutura de inferência aceitar MoE; a economia de 42% na saída mais o salto de inteligência compensam o custo de migração em poucos meses.

Perguntas frequentes

Llama 4 Maverick é mais barato que o Nemotron 70B?

Sim. O Maverick cobra US$ 0,696 por milhão de tokens de saída, contra US$ 1,20 do Nemotron — uma diferença de 42% a favor do modelo da Meta, sem considerar cache de leitura.

Qual a diferença de arquitetura entre os dois modelos?

O Nemotron é denso, com 70B de parâmetros ativos em 70B totais. O Maverick é um mixture-of-experts com 402B totais mas apenas 17B ativos por inferência, distribuídos em 128 especialistas.

Quando usar o Nemotron em vez do Maverick?

Quando seu pipeline já está calibrado para arquitetura densa, seu hardware é limitado ou você precisa negar multimodalidade por compliance — nesses casos, a economia de migrar não compensa o retrabalho.

Leia também