Nova Premier 1.0 custa 96x mais e marca menos em inteligência que o gpt-oss-20b
O multimodal mais recente da Amazon entra no catálogo acima do o3 em preço de saída e fica abaixo do gpt-oss-20b da OpenAI no índice da Artificial Analysis.
A Amazon apresentou o Nova Premier 1.0 há três dias como o modelo "mais capaz" da família Nova. A conta de API, porém, conta outra história: são US$ 12,50 por milhão de tokens de saída, contra US$ 0,13 do gpt-oss-20b da OpenAI. Para cada token que o Premier gera, o gpt-oss-20b cobra o equivalente a cerca de 96. É o tipo de diferença que muda a arquitetura do produto, não só a fatura.
O que a Amazon entregou em 31 de outubro
O Nova Premier 1.0 é multimodal: aceita texto e imagem, devolve só texto. Tem 1 milhão de tokens de contexto, mais de sete vezes a janela do concorrente direto da OpenAI. A própria Amazon o posiciona como o "melhor professor" para destilar modelos customizados em workloads internos. É fechado, sem pesos abertos. Marca 12,718 no índice de inteligência do Artificial Analysis e roda a 31,91 tokens por segundo. Não tem raciocínio nativo habilitado, e o catálogo não publicou pontuação em coding nem agentic para ele — uma lacuna que pesa quando o caso de uso é código ou cadeia de ferramentas.
| Critério | gpt-oss-20b | Nova Premier 1.0 |
|---|---|---|
| Índice de inteligência | 15.2 | 12.7 |
| Entrada US$/M | 0.03 | 2.5 |
| Saída US$/M | 0.13 | 12.5 |
| Contexto | 131k | 1M |
| Pesos abertos | sim | não |
| Velocidade (tok/s) | 113 | 32 |
| Índice de código | 20.7 | — |
| Índice agêntico | 3.1 | — |
O que US$ 0,13 por milhão compra
O gpt-oss-20b é um modelo de pesos abertos, 21 bilhões de parâmetros totais com apenas 3,6 bilhões ativos por inferência — uma MoE enxuta que ajuda a explicar a velocidade. Lançado em 5 de agosto de 2025, custa US$ 0,03 por milhão de entrada e US$ 0,13 por milhão de saída, com cache de leitura no mesmo preço da entrada. Marca 15,225 no índice de inteligência, 20,697 em coding e 3,103 em agentic — superior ao Premier nas duas pontuações disponíveis, mesmo seis meses depois. Velocidade: 112,6 tokens por segundo, mais de três vezes o concorrente. Janela de 131 mil tokens, raciocínio habilitado, corte de conhecimento em junho de 2024.
Onde cada um ganha
Você escolhe o Nova Premier 1.0 quando precisa de entrada multimodal real — imagem junto com texto — ou de uma janela de 1 milhão de tokens em produção, sem montar infraestrutura própria. Também faz sentido quando a Amazon já é sua fornecedora de cloud e o objetivo é destilar um modelo menor para um caso proprietário; o Premier foi desenhado explicitamente para esse papel.
Você escolhe o gpt-oss-20b quando o gargalo é volume e custo. Roteamento de agentes, classificação em massa, geração curta repetitiva, qualquer workload que some milhões de tokens por dia: ali, pagar 96 vezes menos por token de saída muda a economia do produto. Os pesos abertos ainda permitem self-hosting, o que zera o custo marginal em workloads previsíveis, e o raciocínio nativo é coisa que o Premier não oferece.
O tabuleiro em 3 de novembro
O Premier entra no catálogo cobrando US$ 12,50 por milhão de tokens de saída, acima do o3 da OpenAI (US$ 8), que era o mais caro entre os cinco modelos no topo do índice de inteligência. E mesmo assim marca 12,718 — abaixo dos 15,225 do gpt-oss-20b, que tem quase três meses de mercado. O topo da tabela segue com o o3 em IQ 31,096, o Claude Haiku 4.5 da Anthropic em IQ 29,892 a US$ 5 por milhão, o gpt-oss-120b em IQ 24,126 a US$ 0,17 e o Qwen3 Next 80B em IQ 16,867 a US$ 1,2. Nenhum modelo do catálogo chega a IQ 45 hoje. Em custo, o gpt-oss-20b é outra ordem de grandeza: 96 vezes mais barato que o Premier no token de saída, e 61 vezes mais barato que o o3.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Antes de decidir, responda a uma pergunta: o workload exige imagem como entrada ou mais de 131 mil tokens de contexto? Se sim, o Premier é o caminho — e a fatura vai refletir. Se não, o gpt-oss-20b entrega mais por quase nada.
Para a maioria dos workloads textuais em volume, o gpt-oss-20b entrega mais por quase nada; o Nova Premier 1.0 só compensa quando a entrada traz imagem, o contexto passa de 131 mil tokens ou a destilação dentro da AWS já está no plano.
Perguntas frequentes
Quando vale pagar o Nova Premier 1.0 em vez do gpt-oss-20b?
Quando você precisa de entrada por imagem, de uma janela de 1 milhão de tokens ou está destilando um modelo menor dentro do ecossistema AWS. Fora desses três casos, o gpt-oss-20b entrega mais por quase nada.
O gpt-oss-20b roda na minha própria máquina?
Sim. Os pesos são abertos sob licença Apache 2.0 e a arquitetura MoE usa apenas 3,6 bilhões de parâmetros ativos por inferência, o que reduz a demanda de hardware para self-hosting em comparação com modelos densos do mesmo tamanho total.
Por que a Amazon cobra US$ 12,50 por milhão de tokens de saída?
Porque a Amazon posiciona o Nova Premier como o modelo premium da família, voltado para destilação de modelos customizados, e empacota multimodalidade com 1 milhão de tokens de contexto. É preço de modelo topo de linha, não de commodity.