FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B A3B Thinking custa 72% mais caro na saída que o Llama 4 Maverick

O modelo chinês de raciocínio entrega nota mais alta de inteligência e codificação, mas cobra quase o dobro por token gerado e roda mais lento.

Redação FalaVIP IA 3 min de leitura
US$ 1,20por milhão de tokens de saída (Qwen3 Next)
US$ 0,696por milhão de tokens de saída (Llama 4 Maverick)
196,94 vs 86,45 tokens/svelocidade de geração

O que o release não te conta sobre a conta

A Qwen abriu a semana com um modelo de raciocínio novo, o Qwen3 Next 80B A3B Thinking, e a primeira reação é comparar nota de inteligência: 16,87 contra 14,48 do Llama 4 Maverick. Parece vitória chinesa tranquila. Aí você abre a tabela de preços e descobre que, por milhão de tokens de saída, o Qwen cobra US$ 1,20 e o Meta cobra US$ 0,696. Em outras palavras, o Qwen3 Next é cerca de 72% mais caro na saída — e é exatamente a parte da fatura que mais pesa quando o modelo passa a gerar respostas longas.

A nota mais alta vem com um custo de velocidade

O Qwen3 Next é um modelo reasoning-first: por padrão, ele cospe um bloco de "pensamento" antes da resposta final, e esse bloco conta como token de saída cobrado. É como pagar o táxi pelo tempo que o motorista fica parado estudando o caminho. O resultado aparece nos números: a velocidade de geração do Qwen é de 196,94 tokens por segundo, mais que o dobro dos 86,45 do Llama 4 Maverick. Parece ótimo, até lembrar que ele gera muito mais tokens por resposta porque está raciocinando. Na prática, a conta de API não é só preço × tokens — é preço × tokens × tamanho médio da resposta.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Thinking1,2Llama 4 Maverick0,696US$/M
Fonte: OpenRouter

Onde cada um realmente ganha

Em codificação, a vantagem do Qwen existe mas é magra: 17,42 contra 16,28 no índice da Artificial Analysis. Em tarefas agentic, a diferença explode na direção errada para o Qwen: 2,06 contra 1,24 do Maverick. Em outras palavras, quando o trabalho é encadear ferramentas e tomar decisões em sequência, o modelo chinês pontua melhor, mas o americano pontua pior ainda — nenhum dos dois é uma bala de prata aqui. O Llama 4 Maverick ainda traz multimodalidade nativa (texto + imagem → texto) e uma janela de contexto de 1.048.576 tokens, o dobro do Qwen. Se o seu pipeline recebe prints de tela, PDFs escaneados ou fotos de produto, o Maverick entra sem adaptador.

Qwen3 Next 80B A3B Thinking × Llama 4 Maverick
CritérioQwen3 Next 80B A3B ThinkingLlama 4 Maverick
Índice de inteligência16.914.5
Entrada US$/M0.150.2
Saída US$/M1.20.696
Contexto262k1.05M
Pesos abertossimsim
Velocidade (tok/s)19786
Índice de código17.416.3
Índice agêntico2.11.2

Onde eles se parecem (e isso importa)

Os dois são abertos por peso, ambos MoE — o Qwen declara 80 bilhões de parâmetros totais com só 3 bilhões ativos por inferência, enquanto o Maverick declara 402 bilhões totais com 17 bilhões ativos. Esse desenho explica por que o Qwen roda mais rápido mesmo sendo "menor" no papel. Nenhum dos dois publica preço de cache de leitura no catálogo, então quem usa prefix caching vai ter que pedir orçamento ao provedor antes de cravar a arquitetura. O conhecimento do Qwen vai até setembro de 2025; o do Maverick parou em agosto de 2024 —差距 de mais de um ano em dados de treino.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Thinking16,9Llama 4 Maverick14,5índice
Fonte: Artificial Analysis

Para quem vale cada um

Use o Qwen3 Next 80B A3B Thinking se o seu gargalo é raciocínio puro: provas matemáticas, síntese de código a partir de especificação, depuração de lógica intricada. A nota de intelligence mais alta e a janela de 262 mil tokens dão fôlego para problemas longos. Aceite pagar mais por token e engolir o bloco de pensamento na resposta.

Use o Llama 4 Maverick se multimodalidade e janela gigante já estão no seu fluxo, ou se o custo por token gerado é o fator decisivo. Para chatbots de atendimento que recebem foto do produto, análise de UI a partir de screenshot ou qualquer coisa que precise olhar imagem, o Maverick é a escolha direta. Para workloads onde cada centavo por milhão de tokens conta e o trabalho não exige raciocínio encadeado, o Meta ganha no preço.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 227 modelos disponíveis no catálogo nesta data.

O tabuleiro em 15 de setembro de 2025

O catálogo tem 227 modelos listados hoje, 38 criadores diferentes e 13 lançamentos nos últimos 30 dias. O topo de inteligência segue dominado pela OpenAI, com o3 em 31,10 e gpt-oss-120b em 24,13 — Qwen e Meta estão brigando na faixa intermediária, não no topo. Para o desenvolvedor que paga a conta, a lição é que "modelo de raciocínio chinês novo" não é automaticamente mais barato: a economia de inferência do MoE pode até acelerar a geração, mas o preço por token cobrado pelo provedor é outra conversa.

Em uma frase

Roteie prompts de raciocínio pesado para o Qwen3 Next e mantenha o Llama 4 Maverick para fluxos multimodais ou sensíveis a custo por token gerado.

Perguntas frequentes

Qwen3 Next 80B A3B Thinking é mais barato que o Llama 4 Maverick?

Não. Na saída, o Qwen cobra US$ 1,20 por milhão de tokens contra US$ 0,696 do Maverick, uma diferença de cerca de 72%. Na entrada os preços são parecidos (US$ 0,15 vs US$ 0,20).

Qual dos dois entende imagem?

Só o Llama 4 Maverick é multimodal nativo (texto + imagem → texto). O Qwen3 Next 80B A3B Thinking opera apenas em texto.

Por que o Qwen é mais rápido mesmo tendo mais parâmetros totais?

Ambos são MoE: o Qwen ativa só 3 bilhões de parâmetros por inferência contra 17 bilhões do Maverick. Menos trabalho por token significa mais tokens por segundo.

Leia também