Nova Premier custa 10x mais que Qwen3 Next e ainda fica atrás no IQ
Janela de 1M de tokens e entrada de imagem são os únicos argumentos do modelo da AWS contra um rival chinês mais barato, mais rápido e com índice de inteligência maior.
O preço que a Amazon escolheu cobrar
O Amazon Nova Premier 1.0 chegou ontem ao catálogo — e o número que salta aos olhos não é o do lançamento, é o da tabela de preços: US$ 12,50 por milhão de tokens de saída. Você leu certo. Isso é 10,4 vezes o que a Qwen cobra pelo Qwen3 Next 80B A3B Thinking, modelo chinês de 11 de setembro que, pelos números do próprio catálogo, entrega índice de inteligência maior.
Inteligência: Qwen na frente, e não por pouco
O índice Artificial Analysis posiciona o Qwen3 Next em 16,867 e o Nova Premier em 12,718. Em um mercado onde a diferença entre o primeiro e o quinto colocado do ranking de inteligência é de menos de 16 pontos, essa vantagem de ~4,1 pontos é relevante. Ela aparece também em coding (17,419 contra dado não publicado pela Amazon) e em agentic (2,062 contra dado não publicado). Ou seja, nos dois eixos em que a Qwen publicou número e a Amazon não, o modelo chinês lidera.
Onde a Amazon tenta ganhar: contexto e multimodalidade
Nova Premier traz 1 milhão de tokens de contexto, contra 262 mil do Qwen — quase 4x mais. E aceita imagem como entrada, enquanto o Qwen3 Next trabalha só com texto->texto. Se o seu caso de uso é despejar uma documentação inteira no prompt ou analisar imagem junto com a pergunta, esse delta existe e importa.
| Critério | Qwen3 Next 80B A3B Thinking | Nova Premier 1.0 |
|---|---|---|
| Índice de inteligência | 16.9 | 12.7 |
| Entrada US$/M | 0.15 | 2.5 |
| Saída US$/M | 1.2 | 12.5 |
| Contexto | 262k | 1M |
| Pesos abertos | sim | não |
| Velocidade (tok/s) | 197 | 32 |
| Índice de código | 17.4 | — |
| Índice agêntico | 2.1 | — |
Velocidade: 6x mais lento, sem a desculpa do "thinking"
Qwen3 Next roda a 196,94 tokens por segundo. Nova Premier, a 31,91. Seis vezes mais devagar. Curiosamente, o modelo da Amazon não é classificado como reasoning — então não tem a justificativa do "pensa mais, responde menos". É só mais lento.
Quando cada um ganha
Escolha o Qwen3 Next 80B A3B Thinking quando você roda carga em produção e a conta da API dói no fim do mês. US$ 0,15 de entrada e US$ 1,20 de saída por milhão colocam ele entre os modelos mais baratos do catálogo com IQ acima de 16. Bônus: é open weights, então você pode tirar do servidor da Qwen quando o volume justificar.
Escolha o Amazon Nova Premier quando você precisa de janela de 1 milhão de tokens, entrada de imagem, ou está montando um pipeline de destilação — a descrição do modelo no catálogo diz, literalmente, que ele é "o melhor professor para destilar modelos customizados". Para esse caso de uso específico, pagar o premium faz sentido. Para chatbot genérico ou agente de código, não.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O detalhe que ninguém comenta
A Amazon publicou preço de cache para o Nova Premier (US$ 0,625 por milhão). A Qwen não publicou cache para o Qwen3 Next — o que significa que você não tem como precificar cenários com prompt repetido no modelo chinês. Se seu fluxo é "mesmo system prompt, milhares de chamadas", o cache do Nova pode estreitar a diferença de custo mais do que parece à primeira vista. Mas mesmo assim, com 10x de distância no preço de tabela, a margem é grande.
Para a maioria das cargas de produção, o Qwen3 Next entrega mais por menos; o Nova Premier só se justifica quando multimodalidade, contexto de 1M ou destilação entram na equação.
Perguntas frequentes
Amazon Nova Premier vale a pena sendo 10x mais caro?
Vale quando você precisa de janela de 1M de tokens, entrada de imagem ou está destilando um modelo customizado — a própria descrição do catálogo posiciona ele como "teacher". Para chatbot ou agente de código, o Qwen3 Next entrega mais por uma fração do custo.
Qwen3 Next 80B A3B Thinking aceita imagem?
Não. A modalidade declarada é text->text. Se sua carga depende de visão, o Nova Premier (text+image->text) é a única opção entre os dois.
Qual a diferença real de velocidade entre os dois?
Qwen3 Next roda a 196,94 tokens por segundo; Nova Premier, a 31,91. São ~6x de diferença, e o modelo da Amazon não é classificado como reasoning, então não há justificativa técnica aparente para a lentidão.