Qwen3 Next 80B Thinking custa 10 vezes menos que o novo Nova Premier da Amazon
Lançado ontem nos EUA, o topo da Amazon cobra US$ 12,50 por milhão de tokens de saída — e perde em inteligência para um modelo chinês de código aberto.
O Amazon Nova Premier 1.0 chegou ontem. E já perdeu a régua.
A Amazon colocou no catálogo, em 31 de outubro, o modelo mais caro da sua linha Nova: US$ 2,50 por milhão de tokens de entrada e US$ 12,50 por milhão de tokens de saída. É o dobro do que a Anthropic cobra pelo Claude Sonnet e quase cinco vezes o preço do Gemini Pro. Em troca, o que você recebe? Um índice de inteligência de 12,72 — abaixo do Qwen3 Next 80B Thinking, que custa uma fração disso.
A conta é simples e ela dói no bolso de quem paga API.
O chinês de código aberto que faz mais por menos
O Qwen3 Next 80B A3B Thinking foi lançado em 11 de setembro de 2025 e é um modelo de raciocínio: ele emite traces de pensamento estruturados antes da resposta final. Foi desenhado para problemas multi-step — provas de matemática, síntese e debug de código, lógica, tarefas agentic. O índice de inteligência dele hoje é 16,87, com nota de coding em 17,42. E o preço de saída é US$ 1,20 por milhão de tokens.
Pensa assim: é como pagar por um sedã e receber um hatch turbinado. A Amazon vendeu o carro mais caro do estacionamento, mas o chinês já estava na pista com motor maior e tanque cheio.
| Critério | Qwen3 Next 80B A3B Thinking | Nova Premier 1.0 |
|---|---|---|
| Índice de inteligência | 16.9 | 12.7 |
| Entrada US$/M | 0.15 | 2.5 |
| Saída US$/M | 1.2 | 12.5 |
| Contexto | 262k | 1M |
| Pesos abertos | sim | não |
| Velocidade (tok/s) | 197 | 32 |
| Índice de código | 17.4 | — |
| Índice agêntico | 2.1 | — |
Onde o Nova Premier ainda tem argumento
Não é só preço contra preço. O Nova Premier traz três coisas que o Qwen3 não entrega:
- Contexto de 1 milhão de tokens, contra 262 mil do Qwen3. Para resumir livros inteiros ou despejar um codebase gigante numa janela só, isso muda o jogo.
- Entrada multimodal: aceita imagem além de texto. Se você precisa fazer OCR, analisar screenshot, ler gráfico, o Nova Premier entra; o Qwen3 não.
- Cache hit de US$ 0,625 por milhão. Em workloads com prompt repetido — chatbots de atendimento, RAG sobre a mesma base — esse custo de cache derruba a conta efetiva.
Em velocidade, porém, o Qwen3 Thinking entrega 196,94 tokens por segundo contra 31,91 do Nova Premier. Para quem monta agente que precisa iterar rápido, isso é seis vezes mais throughput.
Onde cada um ganha
Escolha o Qwen3 Next 80B Thinking se: seu workload é raciocínio puro, código, matemática, lógica. Você roda em volume alto e a conta de API importa. Você quer open weights para inspecionar, fazer fine-tune ou hospedar fora. Você precisa de velocidade — 197 tokens/s é outro patamar.
Escolha o Nova Premier 1.0 se: você precisa de janela de contexto de 1M tokens, entrada de imagem, ou um modelo que funcione como professor para destilar um modelo customizado da Amazon — caso de uso que o release da Amazon cita explicitamente. Aceite pagar o premium por isso.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
A leitura do tabuleiro
O catálogo tem hoje 269 modelos listados, vindos de 41 criadores. O topo da régua de inteligência segue com OpenAI o3 (31,10) e Claude Haiku 4.5 (29,89). O Qwen3 Thinking aparece em quarto lugar; o Nova Premier nem entra nos cinco primeiros. Em outras palavras: a Amazon entrou na corrida com o produto mais caro da prateleira e ficou fora do pódio.
Para o desenvolvedor que está fechando uma planilha de custos até o fim do mês, a mensagem é direta: enquanto o Nova Premier não justificar o preço com algum benchmark multimodal que ninguém mais entrega, o Qwen3 Thinking paga a conta melhor em quase todo cenário de texto e raciocínio.
Se você só precisa de texto e raciocínio, o Qwen3 Next 80B Thinking entrega índice de inteligência maior por um décimo do preço; só vale pagar o Nova Premier quando a multimodalidade ou a janela de 1M tokens forem bloqueios reais do seu produto.
Perguntas frequentes
Qwen3 Next 80B Thinking é gratuito?
Não. O catálogo lista preço de US$ 0,15 por milhão de tokens de entrada e US$ 1,20 por milhão de saída. Ele é open weights, então você pode hospedar por conta própria e zerar o custo de API — mas aí entra custo de GPU.
O Nova Premier aceita imagem?
Sim. A modalidade é text+image->text, então você pode mandar imagem junto com texto e receber resposta em texto. O Qwen3 Next 80B Thinking é text->text, sem entrada visual.
Qual dos dois é melhor para código?
Pelo índice de coding do catálogo, o Qwen3 Next 80B Thinking marca 17,42. O Nova Premier não tem nota de coding publicada no dado disponível — ou seja, não há base para comparar.