FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B custa 64% menos que Llama 3.3 70B na saída

Dois modelos abertos, preços e inteligências bem diferentes — e a conta de API não mente.

Redação FalaVIP IA 3 min de leitura
US$ 1,10por milhão de tokens de saída no Qwen3 Next
US$ 0,71por milhão de tokens de saída no Llama 3.3 70B
13,754 vs 9,262índice de inteligência Artificial Analysis

O que está em jogo

O Llama 3.3 70B virou o padrão de fato de modelo aberto em 2024. Hoje, em novembro de 2025, ele ainda aparece em quase toda lista de provedores — mas o Qwen3 Next 80B A3B Instruct, da chinesa Qwen, chegou cobrando US$ 1,10 por milhão de tokens de saída contra US$ 0,71 do Llama. Antes de torcer o nariz pelo preço, olhe o resto da conta: o índice de inteligência do Qwen3 Next é 13,754, contra 9,262 do Llama 3.3 70B. É uma diferença de quase 50%.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Instruct13,8Llama 3.3 70B Instruct9,3índice
Fonte: Artificial Analysis

O que o preço diz e o que esconde

O Llama cobra o mesmo valor para entrada, saída e cache — US$ 0,71 nos três. O Qwen3 Next 80B cobra US$ 0,10 de entrada, US$ 1,10 de saída e US$ 0,07 de cache. Em um workload típico de chatbot com 3 tokens de saída para cada 1 de entrada, o custo blended do Llama fica em US$ 0,67 por milhão de tokens, enquanto o do Qwen3 Next bate US$ 0,41. O Qwen ganha em quase todo cenário de produção com tráfego real.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Instruct1,1Llama 3.3 70B Instruct0,32US$/M
Fonte: OpenRouter
Qwen3 Next 80B A3B Instruct × Llama 3.3 70B Instruct
CritérioQwen3 Next 80B A3B InstructLlama 3.3 70B Instruct
Índice de inteligência13.89.3
Entrada US$/M0.10.1
Saída US$/M1.10.32
Contexto262k131k
Pesos abertossimsim
Velocidade (tok/s)17385
Índice de código11.9
Índice agêntico

Velocidade, contexto e o detalhe dos 3 bilhões ativos

Aqui mora a curiosidade técnica que vale entender. O Qwen3 Next 80B A3B Instruct tem 80 bilhões de parâmetros totais, mas só 3 bilhões estão ativos em cada token — é uma arquitetura Mixture-of-Experts que aciona uma fração do modelo por vez. O Llama 3.3 70B é denso: usa os 70 bilhões inteiros a cada inferência. Na prática, isso explica a velocidade: 173,42 tokens por segundo no Qwen contra 84,6 no Llama. É mais que o dobro. Pense como um restaurante com 80 chefs no quadro, mas só três cozinham por pedido — sai mais rápido.

A janela de contexto do Qwen é de 262.144 tokens, o dobro dos 131.072 do Llama. Quem trabalha com documentos longos ou bases de código inteiras sente isso na pele.

Para quem cada um vale a pena

Qwen3 Next 80B A3B Instruct ganha quando: você roda volume alto, precisa de respostas rápidas, quer pagar menos por milhão de tokens e lida com contextos grandes. O custo de entrada é quase sete vezes menor, o que destrói qualquer comparativo ingênuo de preço de saída.

Llama 3.3 70B Instruct ganha quando: o seu caso de uso é estritamente em inglês, você já tem pipeline afinado para a família Llama ou precisa de compatibilidade com um ecossistema específico. Em inteligência bruta, hoje, ele perde.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 270 modelos disponíveis no catálogo nesta data.

O tabuleiro em novembro de 2025

O catálogo de modelos abertos já passa de 270 opções, com 41 criadores diferentes. Os dois modelos desta análise ficam bem abaixo do topo de inteligência — o OpenAI o3 lidera com 31,096, seguido do Claude Haiku 4.5 com 29,892. Mas o Qwen3 Next 80B Instruct custa US$ 1,10 de saída enquanto o o3 cobra US$ 8,00 e o Haiku 4.5 cobra US$ 5,00. Para a faixa de modelos abertos e baratos, o Qwen3 Next 80B Instruct é hoje a referência de qualidade por dólar — e o Llama 3.3 70B, lançado em dezembro de 2024, já não acompanha o passo.

O que você faz com isso amanhã

Se a sua fatura de API passa de algumas centenas de dólares por mês e o workload não exige inglês nativo, troque o Llama 3.3 70B pelo Qwen3 Next 80B A3B Instruct e meça o blended cost antes de comemorar. Se você roda prompts quase só em inglês ou tem integração profunda com ferramentas da família Llama, espere a próxima geração da Meta antes de mexer.

Em uma frase

Para workloads de produção em volume, o Qwen3 Next 80B Instruct entrega quase 50% mais inteligência pela metade do preço blended — vale migrar, salvo integração crítica com o ecossistema Llama.

Perguntas frequentes

Qwen3 Next 80B Instruct é melhor que Llama 3.3 70B em novembro de 2025?

No índice de inteligência Artificial Analysis, sim: 13,754 contra 9,262. No preço blended, também: cerca de US$ 0,41 por milhão de tokens contra US$ 0,67 do Llama, considerando entrada, saída e cache.

Por que o Qwen3 Next é mais rápido se tem 80 bilhões de parâmetros?

Porque só 3 bilhões ficam ativos por inferência — é uma arquitetura Mixture-of-Experts. O resultado é 173 tokens por segundo, mais que o dobro dos 84,6 do Llama 3.3 70B, que é denso.

Qual dos dois tem janela de contexto maior?

O Qwen3 Next 80B Instruct, com 262.144 tokens, contra 131.072 do Llama 3.3 70B. Para quem processa documentos longos ou bases de código inteiras, a diferença pesa.

Leia também