Maverick cobra US$ 0,70; Nova Premier, US$ 12,50 — qual vale o que cobra
Mesmo com IQ menor, o Llama 4 da Meta custa quase 18 vezes menos por milhão de tokens de saída que o topo de linha da Amazon.
O preço da Amazon cabe numa nota de vinte dólares
Você abre o catálogo, vê dois modelos multimodais americanos, ambos com contexto de 1 milhão de tokens, e descobre que um cobra US$ 0,696 por milhão de tokens de saída enquanto o outro pede US$ 12,50. Não é erro de digitação: o Nova Premier 1.0, lançado em 31 de outubro de 2025, custa quase 18 vezes mais que o Llama 4 Maverick, da Meta, que já está no mercado desde abril.
E a diferença não está só na fatura. O Llama 4 Maverick é open weights: o peso é seu, pode ser hospedado onde você quiser. O Nova Premier é fechado, só roda dentro da AWS. Então a conta que você vê no catálogo é a única conta possível — não tem como fugir dela com self-hosting.
Inteligência: o Maverick ganha, mas por pouco
No índice de inteligência da Artificial Analysis medido nesta data, o Llama 4 Maverick marca 14,477 e o Nova Premier 1.0 marca 12,718. A vantagem do Maverick existe, mas é de pouco mais de 1,7 ponto num índice em que o topo do catálogo, o o3 da OpenAI, está em 31. Nenhum dos dois está brigando pela ponta — estão brigando pelo meio do pacote.
Em coding, o único benchmark de capacidade técnica com dado publicado para os dois, o Maverick também lidera: 16,277 contra benchmark não publicado pela Amazon. Em agentic, o cenário se inverte: 1,237 do Maverick contra dado ausente do Premier. O blended do Premier é 5, contra 0,4225 do Maverick — aqui a Amazon cobra caro também em capacidade geral declarada.
| Critério | Llama 4 Maverick | Nova Premier 1.0 |
|---|---|---|
| Índice de inteligência | 14.5 | 12.7 |
| Entrada US$/M | 0.2 | 2.5 |
| Saída US$/M | 0.696 | 12.5 |
| Contexto | 1.05M | 1M |
| Pesos abertos | sim | não |
| Velocidade (tok/s) | 86 | 32 |
| Índice de código | 16.3 | — |
| Índice agêntico | 1.2 | — |
Velocidade e contexto: a vantagem silenciosa do Meta
O Maverick entrega 86,45 tokens por segundo; o Premier, 31,91. Em fluxo de geração isso significa quase o triplo de velocidade. Para um agente que precisa devolver resposta em tempo hábil, ou para um pipeline que processa lote, essa diferença pesa direto no TCO — você paga menos por token e recebe mais tokens por segundo.
Ambos aceitam texto e imagem como entrada e devolvem texto. Ambos têm 1 milhão de tokens de contexto (1.048.576 no Maverick, 1.000.000 no Premier). Em multimodalidade estão empatados; em velocidade, o Maverick atropela.
Onde cada um ganha — sem "depende"
Maverick ganha quando: você quer multimodal com contexto longo, precisa de velocidade de geração, quer open weights para rodar on-premise ou ajustar, ou está rodando volume alto e cada centavo por milhão de tokens conta. O caso típico é uma startup queimando API em produção: a 86 t/s e US$ 0,696 de saída, o mesmo orçamento renderiza muito mais requisições.
Nova Premier ganha quando: você já está preso ao ecossistema AWS, precisa do melhor "teacher" da Amazon para destilar modelos customizados (é literalmente como o próprio release descreve o Premier), ou tem uma carga curta e cara em que pagar US$ 12,50 por milhão de tokens de saída é irrelevante porque o ticket médio é alto. O Premier também oferece cache de leitura a US$ 0,625 por milhão — o Maverick não tem preço de cache publicado no catálogo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O que isso muda na sua escolha
Se você está decidindo hoje entre colocar um modelo multimodal de 1M de contexto em produção, a pergunta não é "qual é mais inteligente" — a diferença de IQ é pequena e nenhum dos dois está no topo. A pergunta é: você paga AWS e quer o melhor professor da Amazon para destilação? Vai de Premier. Você quer multimodal rápido, barato e com a opção de levar o peso para casa? Vai de Maverick. A conta fecha diferente nos dois cenários, e o "diferente" aqui é literal — quase 18 vezes diferente.
Para multimodal de 1M de contexto fora da AWS, o Llama 4 Maverick entrega mais velocidade por quase um vintésimo do preço; o Nova Premier só compensa se você já vive dentro do ecossistema Amazon e precisa dele como modelo professor para destilação.
Perguntas frequentes
Llama 4 Maverick é realmente mais barato que o Nova Premier?
Sim, em preço de catálogo: US$ 0,696 por milhão de tokens de saída contra US$ 12,50 do Nova Premier 1.0. A diferença é de quase 18 vezes, e o Maverick ainda é open weights, o que permite self-hosting fora da conta da API.
Qual dos dois tem melhor desempenho em código?
O Llama 4 Maverick tem benchmark de coding publicado em 16,277; o Nova Premier 1.0 não publicou esse número no catálogo. Em inteligência geral, o Maverick também lidera por uma margem pequena (14,477 contra 12,718).
Posso rodar o Nova Premier fora da AWS?
Não. O Nova Premier 1.0 é modelo fechado e só está disponível via AWS Bedrock. O Llama 4 Maverick, por ser open weights, pode ser baixado e hospedado em qualquer infraestrutura compatível.