Qwen3 Next 80B custa 64% menos que Llama 3.3 70B na saída
Dois modelos abertos, preços e inteligências bem diferentes — e a conta de API não mente.
O que está em jogo
O Llama 3.3 70B virou o padrão de fato de modelo aberto em 2024. Hoje, em novembro de 2025, ele ainda aparece em quase toda lista de provedores — mas o Qwen3 Next 80B A3B Instruct, da chinesa Qwen, chegou cobrando US$ 1,10 por milhão de tokens de saída contra US$ 0,71 do Llama. Antes de torcer o nariz pelo preço, olhe o resto da conta: o índice de inteligência do Qwen3 Next é 13,754, contra 9,262 do Llama 3.3 70B. É uma diferença de quase 50%.
O que o preço diz e o que esconde
O Llama cobra o mesmo valor para entrada, saída e cache — US$ 0,71 nos três. O Qwen3 Next 80B cobra US$ 0,10 de entrada, US$ 1,10 de saída e US$ 0,07 de cache. Em um workload típico de chatbot com 3 tokens de saída para cada 1 de entrada, o custo blended do Llama fica em US$ 0,67 por milhão de tokens, enquanto o do Qwen3 Next bate US$ 0,41. O Qwen ganha em quase todo cenário de produção com tráfego real.
| Critério | Qwen3 Next 80B A3B Instruct | Llama 3.3 70B Instruct |
|---|---|---|
| Índice de inteligência | 13.8 | 9.3 |
| Entrada US$/M | 0.1 | 0.1 |
| Saída US$/M | 1.1 | 0.32 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 173 | 85 |
| Índice de código | — | 11.9 |
| Índice agêntico | — | — |
Velocidade, contexto e o detalhe dos 3 bilhões ativos
Aqui mora a curiosidade técnica que vale entender. O Qwen3 Next 80B A3B Instruct tem 80 bilhões de parâmetros totais, mas só 3 bilhões estão ativos em cada token — é uma arquitetura Mixture-of-Experts que aciona uma fração do modelo por vez. O Llama 3.3 70B é denso: usa os 70 bilhões inteiros a cada inferência. Na prática, isso explica a velocidade: 173,42 tokens por segundo no Qwen contra 84,6 no Llama. É mais que o dobro. Pense como um restaurante com 80 chefs no quadro, mas só três cozinham por pedido — sai mais rápido.
A janela de contexto do Qwen é de 262.144 tokens, o dobro dos 131.072 do Llama. Quem trabalha com documentos longos ou bases de código inteiras sente isso na pele.
Para quem cada um vale a pena
Qwen3 Next 80B A3B Instruct ganha quando: você roda volume alto, precisa de respostas rápidas, quer pagar menos por milhão de tokens e lida com contextos grandes. O custo de entrada é quase sete vezes menor, o que destrói qualquer comparativo ingênuo de preço de saída.
Llama 3.3 70B Instruct ganha quando: o seu caso de uso é estritamente em inglês, você já tem pipeline afinado para a família Llama ou precisa de compatibilidade com um ecossistema específico. Em inteligência bruta, hoje, ele perde.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O tabuleiro em novembro de 2025
O catálogo de modelos abertos já passa de 270 opções, com 41 criadores diferentes. Os dois modelos desta análise ficam bem abaixo do topo de inteligência — o OpenAI o3 lidera com 31,096, seguido do Claude Haiku 4.5 com 29,892. Mas o Qwen3 Next 80B Instruct custa US$ 1,10 de saída enquanto o o3 cobra US$ 8,00 e o Haiku 4.5 cobra US$ 5,00. Para a faixa de modelos abertos e baratos, o Qwen3 Next 80B Instruct é hoje a referência de qualidade por dólar — e o Llama 3.3 70B, lançado em dezembro de 2024, já não acompanha o passo.
O que você faz com isso amanhã
Se a sua fatura de API passa de algumas centenas de dólares por mês e o workload não exige inglês nativo, troque o Llama 3.3 70B pelo Qwen3 Next 80B A3B Instruct e meça o blended cost antes de comemorar. Se você roda prompts quase só em inglês ou tem integração profunda com ferramentas da família Llama, espere a próxima geração da Meta antes de mexer.
Para workloads de produção em volume, o Qwen3 Next 80B Instruct entrega quase 50% mais inteligência pela metade do preço blended — vale migrar, salvo integração crítica com o ecossistema Llama.
Perguntas frequentes
Qwen3 Next 80B Instruct é melhor que Llama 3.3 70B em novembro de 2025?
No índice de inteligência Artificial Analysis, sim: 13,754 contra 9,262. No preço blended, também: cerca de US$ 0,41 por milhão de tokens contra US$ 0,67 do Llama, considerando entrada, saída e cache.
Por que o Qwen3 Next é mais rápido se tem 80 bilhões de parâmetros?
Porque só 3 bilhões ficam ativos por inferência — é uma arquitetura Mixture-of-Experts. O resultado é 173 tokens por segundo, mais que o dobro dos 84,6 do Llama 3.3 70B, que é denso.
Qual dos dois tem janela de contexto maior?
O Qwen3 Next 80B Instruct, com 262.144 tokens, contra 131.072 do Llama 3.3 70B. Para quem processa documentos longos ou bases de código inteiras, a diferença pesa.