Qwen3 Next 80B A3B Thinking cobra 1,2 dólar; Llama 3.3 70B cobra 0,71 — quem entrega mais pelo preço
Comparativo frente a frente entre o modelo de raciocínio chinês de 11 de setembro e o clássico aberto da Meta, com conta de API, contexto e benchmark na mesa
O que está em jogo
Você está olhando para dois modelos abertos com o mesmo "B" no nome — 80B e 70B — e preços que parecem próximos. Mas o Qwen3 Next 80B A3B Thinking cobra US$ 1,20 por milhão de tokens de saída, enquanto o Llama 3.3 70B Instruct cobra US$ 0,71 por milhão em todas as direções (entrada, saída e cache). A diferença real não está só no número: está no que cada um foi treinado para fazer e em quanto da conta sobra no fim do mês.
Inteligência medida hoje
No índice de inteligência da Artificial Analysis, o Qwen3 Next marca 16,867 contra 9,262 do Llama 3.3. Em coding, a distância é parecida: 17,419 contra 11,926. Em agentic, o Qwen3 Next pontua 2,062; o Llama 3.3 nem aparece na métrica — o catálogo não publicou. O ponto importante: esses são os valores medidos hoje, não uma série histórica. O que dá para afirmar é que, nesta data, o modelo chinês de raciocínio está à frente do clássico da Meta no agregado.
Conta de API: o que muda de verdade
O Llama 3.3 cobra US$ 0,71 para entrada, saída e cache — o mesmo valor nas três pontas, o que simplifica a previsão de gasto. O Qwen3 Next cobra US$ 0,15 de entrada e US$ 1,20 de saída; o campo de cache veio vazio, então o catálogo não publicou esse valor — não chute. Para uma chamada típica com 80% de entrada e 20% de saída, o Llama 3.3 fica em US$ 0,71 por milhão de tokens totais e o Qwen3 Next fica em US$ 0,36 — mais barato no agregado, mesmo com a saída mais cara.
Onde o cálculo muda: prompts curtos com respostas longas, como geração de código ou raciocínio encadeado, jogam a favor do Llama 3.3. Prompts longos com respostas curtas, como extração, classificação e sumarização, jogam a favor do Qwen3 Next.
| Critério | Qwen3 Next 80B A3B Thinking | Llama 3.3 70B Instruct |
|---|---|---|
| Índice de inteligência | 16.9 | 9.3 |
| Entrada US$/M | 0.15 | 0.1 |
| Saída US$/M | 1.2 | 0.32 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 197 | 85 |
| Índice de código | 17.4 | 11.9 |
| Índice agêntico | 2.1 | — |
Contexto, velocidade e arquitetura
O Qwen3 Next oferece 262.144 tokens de contexto, o dobro dos 131.072 do Llama 3.3. Em velocidade, o Qwen3 Next entrega 196,94 tokens/s contra 84,6 do Llama 3.3 — mais que o dobro. A diferença arquitetural explica parte disso: o Qwen3 Next é um MoE com 80B de parâmetros totais mas só 3B ativos por token, enquanto o Llama 3.3 ativa os 70B inteiros. Menos trabalho por token, mais throughput — é como comparar um restaurante com 80 cozinheiros onde só 3 trabalham por pedido contra um onde os 70 cozinheiros se revezam em cada prato.
O Qwen3 Next é um modelo de raciocínio, com traces de "thinking" por padrão; o Llama 3.3 não é. O knowledge cutoff também pesa: o Qwen3 Next vai até setembro de 2025, o Llama 3.3 trava em dezembro de 2023 — quase dois anos de defasagem.
Para quem cada um ganha
O Qwen3 Next 80B A3B Thinking ganha quando você precisa de raciocínio multi-etapa, código difícil, lógica pesada, contexto longo e velocidade alta, e está disposto a pagar a saída mais cara. Pensa em agente de programação, prova matemática, debug complexo, análise de documentos grandes.
O Llama 3.3 70B Instruct ganha quando você quer previsibilidade de custo (mesmo preço nas três pontas), tarefas mais simples — sumarização, extração, chat, geração curta — e não precisa de conhecimento recente nem de traces de raciocínio. É o canivete suíço para volume alto com orçamento apertado.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
O tabuleiro em 20 de setembro
Os dois são chineses e americanos, respectivamente, e os dois têm pesos abertos. No topo do índice de inteligência desta data, o OpenAI o3 lidera com 31,096 e cobra US$ 8 por milhão de saída; o gpt-oss-120b da própria OpenAI vem em segundo com 24,126 e US$ 0,17 de saída. O Qwen3 Next é o terceiro colocado geral e o Llama 3.3 não figura no top 5. Em outras palavras: o Qwen3 Next está brigando com modelos abertos de ponta, e o Llama 3.3 está brigando com tudo que veio depois dele nos últimos dez meses.
Se a tarefa é raciocínio pesado, código difícil ou contexto longo, escolha Qwen3 Next e pague US$ 1,20 de saída; se é volume alto de tarefas simples com orçamento apertado e previsibilidade de custo, fique no Llama 3.3 a US$ 0,70 fixo.
Perguntas frequentes
Qwen3 Next 80B A3B Thinking é mais barato que o Llama 3.3 70B?
Depende do formato do tráfego. Em chamadas com mais saída do que entrada, o Llama 3.3 ganha. Em chamadas com muito prompt e resposta curta, o Qwen3 Next fica mais barato no agregado, mesmo com a saída de US$ 1,20 por milhão.
O Qwen3 Next é modelo de raciocínio?
Sim. Ele é descrito como reasoning-first e emite traces de pensamento por padrão. O Llama 3.3 70B Instruct não é modelo de raciocínio e não gera essas traces.
Posso rodar os dois localmente?
Os dois são open weights. O Qwen3 Next é um MoE com 80B totais e 3B ativos por token; o Llama 3.3 ativa os 70B inteiros. Em hardware equivalente, o Qwen3 Next tende a ser mais rápido por token.