FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B A3B Thinking cobra 1,2 dólar; Llama 3.3 70B cobra 0,71 — quem entrega mais pelo preço

Comparativo frente a frente entre o modelo de raciocínio chinês de 11 de setembro e o clássico aberto da Meta, com conta de API, contexto e benchmark na mesa

Redação FalaVIP IA 3 min de leitura
US$ 1,20por milhão de tokens de saída do Qwen3 Next
US$ 0,71por milhão de tokens do Llama 3.3 70B (entrada, saída e cache)
16,867 vs 9,262índice de inteligência Artificial Analysis

O que está em jogo

Você está olhando para dois modelos abertos com o mesmo "B" no nome — 80B e 70B — e preços que parecem próximos. Mas o Qwen3 Next 80B A3B Thinking cobra US$ 1,20 por milhão de tokens de saída, enquanto o Llama 3.3 70B Instruct cobra US$ 0,71 por milhão em todas as direções (entrada, saída e cache). A diferença real não está só no número: está no que cada um foi treinado para fazer e em quanto da conta sobra no fim do mês.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Thinking1,2Llama 3.3 70B Instruct0,32US$/M
Fonte: OpenRouter

Inteligência medida hoje

No índice de inteligência da Artificial Analysis, o Qwen3 Next marca 16,867 contra 9,262 do Llama 3.3. Em coding, a distância é parecida: 17,419 contra 11,926. Em agentic, o Qwen3 Next pontua 2,062; o Llama 3.3 nem aparece na métrica — o catálogo não publicou. O ponto importante: esses são os valores medidos hoje, não uma série histórica. O que dá para afirmar é que, nesta data, o modelo chinês de raciocínio está à frente do clássico da Meta no agregado.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Thinking16,9Llama 3.3 70B Instruct9,3índice
Fonte: Artificial Analysis

Conta de API: o que muda de verdade

O Llama 3.3 cobra US$ 0,71 para entrada, saída e cache — o mesmo valor nas três pontas, o que simplifica a previsão de gasto. O Qwen3 Next cobra US$ 0,15 de entrada e US$ 1,20 de saída; o campo de cache veio vazio, então o catálogo não publicou esse valor — não chute. Para uma chamada típica com 80% de entrada e 20% de saída, o Llama 3.3 fica em US$ 0,71 por milhão de tokens totais e o Qwen3 Next fica em US$ 0,36 — mais barato no agregado, mesmo com a saída mais cara.

Onde o cálculo muda: prompts curtos com respostas longas, como geração de código ou raciocínio encadeado, jogam a favor do Llama 3.3. Prompts longos com respostas curtas, como extração, classificação e sumarização, jogam a favor do Qwen3 Next.

Qwen3 Next 80B A3B Thinking × Llama 3.3 70B Instruct
CritérioQwen3 Next 80B A3B ThinkingLlama 3.3 70B Instruct
Índice de inteligência16.99.3
Entrada US$/M0.150.1
Saída US$/M1.20.32
Contexto262k131k
Pesos abertossimsim
Velocidade (tok/s)19785
Índice de código17.411.9
Índice agêntico2.1

Contexto, velocidade e arquitetura

O Qwen3 Next oferece 262.144 tokens de contexto, o dobro dos 131.072 do Llama 3.3. Em velocidade, o Qwen3 Next entrega 196,94 tokens/s contra 84,6 do Llama 3.3 — mais que o dobro. A diferença arquitetural explica parte disso: o Qwen3 Next é um MoE com 80B de parâmetros totais mas só 3B ativos por token, enquanto o Llama 3.3 ativa os 70B inteiros. Menos trabalho por token, mais throughput — é como comparar um restaurante com 80 cozinheiros onde só 3 trabalham por pedido contra um onde os 70 cozinheiros se revezam em cada prato.

O Qwen3 Next é um modelo de raciocínio, com traces de "thinking" por padrão; o Llama 3.3 não é. O knowledge cutoff também pesa: o Qwen3 Next vai até setembro de 2025, o Llama 3.3 trava em dezembro de 2023 — quase dois anos de defasagem.

Para quem cada um ganha

O Qwen3 Next 80B A3B Thinking ganha quando você precisa de raciocínio multi-etapa, código difícil, lógica pesada, contexto longo e velocidade alta, e está disposto a pagar a saída mais cara. Pensa em agente de programação, prova matemática, debug complexo, análise de documentos grandes.

O Llama 3.3 70B Instruct ganha quando você quer previsibilidade de custo (mesmo preço nas três pontas), tarefas mais simples — sumarização, extração, chat, geração curta — e não precisa de conhecimento recente nem de traces de raciocínio. É o canivete suíço para volume alto com orçamento apertado.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 230 modelos disponíveis no catálogo nesta data.

O tabuleiro em 20 de setembro

Os dois são chineses e americanos, respectivamente, e os dois têm pesos abertos. No topo do índice de inteligência desta data, o OpenAI o3 lidera com 31,096 e cobra US$ 8 por milhão de saída; o gpt-oss-120b da própria OpenAI vem em segundo com 24,126 e US$ 0,17 de saída. O Qwen3 Next é o terceiro colocado geral e o Llama 3.3 não figura no top 5. Em outras palavras: o Qwen3 Next está brigando com modelos abertos de ponta, e o Llama 3.3 está brigando com tudo que veio depois dele nos últimos dez meses.

Em uma frase

Se a tarefa é raciocínio pesado, código difícil ou contexto longo, escolha Qwen3 Next e pague US$ 1,20 de saída; se é volume alto de tarefas simples com orçamento apertado e previsibilidade de custo, fique no Llama 3.3 a US$ 0,70 fixo.

Perguntas frequentes

Qwen3 Next 80B A3B Thinking é mais barato que o Llama 3.3 70B?

Depende do formato do tráfego. Em chamadas com mais saída do que entrada, o Llama 3.3 ganha. Em chamadas com muito prompt e resposta curta, o Qwen3 Next fica mais barato no agregado, mesmo com a saída de US$ 1,20 por milhão.

O Qwen3 Next é modelo de raciocínio?

Sim. Ele é descrito como reasoning-first e emite traces de pensamento por padrão. O Llama 3.3 70B Instruct não é modelo de raciocínio e não gera essas traces.

Posso rodar os dois localmente?

Os dois são open weights. O Qwen3 Next é um MoE com 80B totais e 3B ativos por token; o Llama 3.3 ativa os 70B inteiros. Em hardware equivalente, o Qwen3 Next tende a ser mais rápido por token.

Leia também