Amazon Nova Premier custa 96 vezes mais que um rival open-weight mais esperto
Amazon apresenta o Nova Premier como multimodal mais avançado do portfólio Nova e 'melhor professor para destilação'. No IQ, porém, fica abaixo de um 21B open-weight que custa 1% do preço de saída do Premier.
US$ 12,50 por milhão de tokens de saída. É o que a Amazon cobra pelo Nova Premier 1.0, lançado hoje — e o número causa estranhamento quando colocado ao lado do que ele entrega. No índice de inteligência da Artificial Analysis, o modelo estreia com IQ 12,718, abaixo do gpt-oss-20b, da OpenAI, que marca 15,225 e sai por US$ 0,13 por milhão. Traduzindo: para cada chamada ao Premier, sobra orçamento para fazer 96 chamadas a um modelo mais capaz e open-weight.
O "mais capaz" da Amazon, no papel
O release da AWS apresenta o Nova Premier como o multimodal mais avançado do portfólio Nova, voltado a raciocínio complexo e, principalmente, ao papel de "melhor professor para destilação de modelos customizados". A Amazon não está vendendo o Premier como resposta padrão para qualquer workload — está vendendo como ponto de partida para treinar modelos menores que rodem dentro do ecossistema AWS.
Mesmo aceitando essa proposta, o modelo tem peculiaridades que importam: não tem modo de raciocínio dedicado, aceita texto e imagem mas só devolve texto, e roda a 31,91 tokens por segundo — mais lento que todos os pares com quem compete na mesma faixa de preço.
A conta contra os pares
Olha o que existe hoje, em modelos com proposta parecida ou mais forte, e quanto cada um cobra para sair:
- gpt-oss-20b (OpenAI): IQ 15,225 — US$ 0,03 entrada / US$ 0,13 saída. 21B open-weight, com raciocínio, a 112,6 t/s.
- Nemotron Nano 9B V2 (NVIDIA): IQ 8,677 — US$ 0,04 / US$ 0,16. 9B open-weight, raciocínio nativo, 147 t/s.
- Llama 4 Scout (Meta): IQ 10,256 — US$ 0,10 / US$ 0,30. 109B (17B ativos), multimodal, 111 t/s.
- Nemotron Super 49B V1.5 (NVIDIA): IQ 12,401 — US$ 0,40 / US$ 0,40. 49B open-weight, raciocínio, 52,85 t/s.
Em qualquer comparação, o Nova Premier cobra de 31 a 96 vezes mais na saída e entrega inteligência igual ou inferior. O blended (média ponderada de entrada e saída) dele é US$ 5 por milhão — ainda 54 vezes o US$ 0,0925 do gpt-oss-20b.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nova Premier 1.0 (o novo) | 12.7 | 2.5 | 12.5 | 1M |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
| Nemotron Nano 9B V2 | 8.7 | 0.04 | 0.16 | 131k |
| Llama 4 Scout | 10.3 | 0.1 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | 9.3 | 0.1 | 0.32 | 131k |
O que o Premier tem que os pares não
Três coisas aparecem no espelho quando você compara:
Janela de 1 milhão de tokens. Mesmo nível do Llama 4 Scout e o dobro dos modelos NVIDIA. Para workloads que precisam engolir um repositório inteiro ou transcrição longa em uma única passada, isso pesa.
Multimodal nativo de entrada. O Premier aceita imagem junto com texto sem rotear para um modelo de visão separado. Entre os pares, só o Llama 4 Scout faz o mesmo — e cobra uma fração.
Pacote Bedrock. SSO, VPC endpoints, residência de dados, compliance herdado. Para empresas travadas no AWS por política, isso é a variável de decisão real.
E o cache de prompt está em US$ 0,625 por milhão — não é barato, mas é um recurso que existe e ajuda em pipelines de RAG e agentes que reusam contexto.
Para quem vale — e para quem não muda nada
Vale considerar se você está construindo pipeline de destilação dentro do AWS Bedrock e precisa de um professor multimodal com 1M de contexto, ou se a carga exige o pacote de compliance da AWS e open weights não é opção. Para esses casos, o Premier existe; nenhum dos pares entrega o mesmo trio multimodal + 1M + Bedrock fechado.
Não muda nada para todo o resto. Se a fatura da API é a variável dominante, o gpt-oss-20b entrega mais inteligência por quase dois orders de grandeza menos. Se você precisa de raciocínio dedicado ou velocidade, o Nemotron Nano 9B V2 responde a 147 t/s por US$ 0,16, uma fração do preço de saída do Premier. E se o teto é "ficar no AWS", a Llama 4 Scout roda no mesmo Bedrock por US$ 0,30 de saída com multimodal e 1M de contexto.
O tabuleiro em 31 de outubro
O catálogo passa de 269 modelos hoje, com 25 lançamentos nos últimos 30 dias. No topo do índice, o OpenAI o3 lidera com IQ 31,096 a US$ 8 de saída, seguido do Claude Haiku 4.5 (29,892 / US$ 5). O Premier entra em uma faixa intermediária baixa e precificada como topo — combinação que só faz sentido se o que se compra não é inteligência bruta por dólar, e sim um pacote específico de compliance + multimodal + janela ampla dentro de ecossistema fechado.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
A implicação prática: antes de colocar o Premier numa rota de produção, meça qual fração do gasto mensal é multimodal com contexto longo dentro do AWS. Se for pequena, dá para substituir por Llama 4 Scout no mesmo Bedrock sem perder multimodal nem contexto. Se for grande, o Premier tem argumento — mas o IQ entra como variável secundária, não como a principal.
Antes de colocar o Nova Premier em produção, meça qual fração do gasto é multimodal com contexto longo dentro do AWS — se for pequena, dá para substituir por Llama 4 Scout no mesmo Bedrock sem perder multimodal nem contexto.
Perguntas frequentes
Quanto custa o Amazon Nova Premier 1.0?
Cobra US$ 2,50 por milhão de tokens de entrada e US$ 12,50 por milhão de saída, com cache de prompt a US$ 0,625 por milhão. O preço blended fica em US$ 5 por milhão — 54 vezes o do gpt-oss-20b.
O Nova Premier é o modelo multimodal mais inteligente da Amazon?
É o que a AWS apresenta como multimodal mais avançado do portfólio Nova, voltado a raciocínio complexo e destilação. No índice da Artificial Analysis, marca IQ 12,718 — abaixo do gpt-oss-20b (15,225), o que significa que 'mais capaz' descreve o catálogo interno, não o ranking geral do mercado.
Quando o Nova Premier vale a pena?
Quando você precisa de professor multimodal com 1M de contexto para destilação dentro do AWS Bedrock, ou quando o pacote de compliance do AWS fecha o uso de open weights por política interna. Para otimizar inteligência por dólar, os pares open-weight entregam mais por uma fração do custo.