FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B é 34% mais inteligente, mas 3,6x mais caro na saída

Mesmo preço de entrada, mesmo open weights — a diferença mora no token de saída e no tamanho da janela

Redação FalaVIP IA 3 min de leitura
3,6xmais caro no token de saída do Qwen
US$ 0,30preço de saída do Llama 4 Scout por milhão de tokens
1.310.720tokens de contexto do Llama 4 Scout

Qwen3 Next 80B A3B Instruct tem IQ 34% mais alto que Llama 4 Scout no índice da Artificial Analysis. Só que o token de saída do chinês custa US$ 1,10 por milhão, enquanto o americano fica em US$ 0,30. São 3,6 vezes de diferença em quem produz mais texto por chamada — e isso muda o tamanho da fatura antes da qualidade entrar na conta.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Instruct1,1Llama 4 Scout0,3US$/M
Fonte: OpenRouter

O que a conta mostra antes do que o release diz

O preço de entrada é idêntico nos dois: US$ 0,10 por milhão de tokens. A diferença mora toda na saída. Ambos são open weights, ambos são MoE. Mas não vêm do mesmo país: Qwen é da China, Meta dos Estados Unidos. No índice de inteligência, o chinês marca 13,754 contra 10,256 do Scout.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Instruct13,8Llama 4 Scout10,3índice
Fonte: Artificial Analysis
Qwen3 Next 80B A3B Instruct × Llama 4 Scout
CritérioQwen3 Next 80B A3B InstructLlama 4 Scout
Índice de inteligência13.810.3
Entrada US$/M0.10.1
Saída US$/M1.10.3
Contexto262k1.31M
Pesos abertossimsim
Velocidade (tok/s)173112
Índice de código8.2
Índice agêntico1.1

Olha o cenário completo e você vê por que essa escolha não é óbvia. O Qwen ganha em capacidade cognitiva, velocidade e atualidade de conhecimento. O Llama ganha em janela de contexto, multimodalidade e preço de saída. Em qual variável a sua aplicação pende?

Onde o Qwen3 Next 80B A3B Instruct ganha

Três argumentos do lado chinês.

Velocidade: 173,42 tokens por segundo contra 111,53 do Scout. É 55% mais rápido — em chamadas sensíveis a latência, faz diferença no tempo de resposta percebido pelo usuário final.

Conhecimento mais recente: o Qwen vai até 30 de setembro de 2025; o Llama para em 31 de agosto de 2024. Tem mais de um ano de diferença. Se o seu domínio depende de eventos, produtos ou dados posteriores a essa data, o chinês responde melhor e alucina menos sobre "não sei a data exata".

MoE mais agressivo: o Qwen tem 80B de parâmetros totais e só 3B ativos por inferência. Cada chamada gasta uma fração menor do que o Llama Scout, que ativa 17B dos seus 109B totais. Isso ajuda a explicar parte da velocidade sem perda grande de qualidade.

Onde o Llama 4 Scout ganha

Três pontos onde o americano desmonta a comparação.

Janela de contexto 5x maior: 1.310.720 tokens contra 262.144. Isso é uma codebase média, um livro técnico inteiro, um ano de logs de sistema — tudo em uma única chamada. O Qwen trava em 256K. Se seu app joga documento grande no prompt, o Scout é o único dos dois que aguenta sem truncar.

Multimodal nativo: o Scout aceita imagem junto com texto — print de bug, foto de produto, página de PDF com figura. O Qwen Instruct trabalha só com texto. Para pipelines de visão + linguagem, o americano resolve sem chamar modelo auxiliar.

Preço de saída que muda planilha: US$ 0,30 por milhão de tokens gerados. No preço blended, que pondera entrada e saída, o Llama fica em US$ 0,30 contra US$ 0,4125 do Qwen — 27% mais barato na média. Em apps que produzem muito texto por chamada, esse 3,6x de diferença na saída vira uma linha gorda no fim do mês.

O Llama ainda tem scores publicados de coding (8,168) e agentic (1,1). O catálogo não publicou esses números para o Qwen Next Instruct — então a comparação direta de capacidade de código e tool use fica em aberto do lado chinês.

Para quem cada um faz sentido

Vai de Qwen3 Next 80B A3B Instruct se: o seu caso precisa de respostas mais afinadas em raciocínio, latência baixa e depende de informação posterior a agosto de 2024. Cabe em contextos até 256K tokens. Como é open weights, dá para rodar em servidor próprio se a GPU permitir.

Vai de Llama 4 Scout se: você joga documento grande na chamada, precisa processar imagem junto com texto, ou tem workload com muito texto gerado por request. Os scores de coding e agentic publicados indicam que aguenta tarefas de código e tool use.

A conta final: para um app hipotético que escreve 500 tokens por chamada em 10 milhões de chamadas por mês, são US$ 5.500 no Qwen contra US$ 1.500 no Llama. Os 34% de inteligência a mais custam US$ 4.000 mensais — e essa decisão é sua, não do release.

Em uma frase

Se a conta da API pesa mais que a margem de qualidade, escolha Llama 4 Scout; se o que importa é resposta mais afinada e latência baixa, vá de Qwen3 Next 80B A3B Instruct.

Perguntas frequentes

Qual modelo é mais barato, Qwen3 Next 80B ou Llama 4 Scout?

Llama 4 Scout é mais barato na saída: US$ 0,30 por milhão de tokens contra US$ 1,10 do Qwen, uma diferença de 3,6x. No preço blended, que mistura entrada e saída, a vantagem cai para 27% mais barato (US$ 0,30 contra US$ 0,4125).

Qual tem contexto maior, Qwen3 Next 80B A3B Instruct ou Llama 4 Scout?

Llama 4 Scout tem a janela cinco vezes maior: 1.310.720 tokens contra 262.144 do Qwen. Para uma codebase inteira, um livro técnico ou um ano de logs em uma única chamada, só o Scout aguenta.

Os dois modelos são open weights?

Sim. Tanto Qwen3 Next 80B A3B Instruct quanto Llama 4 Scout têm pesos abertos no catálogo. Isso permite rodar localmente ou em servidor próprio, sem depender exclusivamente da API do provedor.

Leia também