FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Llama 4 Maverick custa o dobro do Qwen3 Next e entrega só 5% mais IQ

Comparativo frente a frente entre dois modelos abertos com arquitetura MoE: um americano de 402B e um chinês de 80B que cobram preços muito diferentes pelo mesmo tipo de tarefa.

Redação FalaVIP IA 3 min de leitura
US$ 0,696por milhão de tokens de saída no Llama 4 Maverick
US$ 1,10por milhão de tokens de saída no Qwen3 Next 80B
US$ 0,10por milhão de tokens de entrada no Qwen3 Next 80B (metade do Maverick)

O que a conta mostra antes do benchmark

A conta da API não perdoa: o Llama 4 Maverick cobra US$ 0,20 por milhão de tokens de entrada e US$ 0,696 por milhão de saída. O Qwen3 Next 80B A3B Instruct, da chinesa Alibaba, cobra US$ 0,10 de entrada e US$ 1,10 de saída. Em outras palavras, o chinês custa metade no input e 58% mais caro no output. Quem só lê release pensa que está olhando o mesmo produto em duas embalagens; quem paga a fatura sabe que a embalagem muda tudo.

Preço de saída (US$ por milhão de tokens)
Llama 4 Maverick0,696Qwen3 Next 80B A3B Instruct1,1US$/M
Fonte: OpenRouter

Tamanho não é documento

O Maverick é um monstro: 402 bilhões de parâmetros totais, com 17B ativos por passagem, distribuídos em 128 especialistas. O Qwen3 Next 80B tem 80B totais e só 3B ativos. Em arquitetura MoE, o que roda no seu servidor — ou no servidor do provedor — são os parâmetros ativos. É como comparar um restaurante com 128 chefs no quadro e só 17 trabalhando no turno contra um com 80 chefs no quadro e 3 no turno. O americano tem mais gente disponível; o chinês gasta menos gente por pedido.

E aí vem o detalhe que o marketing da Meta faz de conta que não existe: o índice de inteligência do Maverick é 14,477. O do Qwen3 Next Instruct é 13,754. Diferença de 0,723 ponto, algo em torno de 5%. Em troca, o chinês entrega quase o dobro de velocidade: 173 tokens por segundo contra 86 do Maverick.

Índice de inteligência (Artificial Analysis)
Llama 4 Maverick14,5Qwen3 Next 80B A3B Instruct13,8índice
Fonte: Artificial Analysis

Onde cada um ganha de verdade

Para geração de código, o Maverick tem nota 16,277 no índice de coding. O Qwen3 Next Instruct não tem nota publicada no catálogo — e isso não é detalhe menor: quando o catálogo não publica, você não tem como comparar, então você testa. Já em agentic, o cenário é pior para os dois: Maverick marca 1,237 e o Qwen3 Instruct não tem índice. O blended, que pondera uso geral, fica em 0,4225 para o americano e 0,4125 para o chinês — empate técnico dentro da margem de erro.

Llama 4 Maverick × Qwen3 Next 80B A3B Instruct
CritérioLlama 4 MaverickQwen3 Next 80B A3B Instruct
Índice de inteligência14.513.8
Entrada US$/M0.20.1
Saída US$/M0.6961.1
Contexto1.05M262k
Pesos abertossimsim
Velocidade (tok/s)86173
Índice de código16.3
Índice agêntico1.2

Contexto importa — e contexto aqui é gigante

O Maverick abre janela de 1.048.576 tokens, um milhão. O Qwen3 Next Instruct abre 262.144, um quarto disso. Se o seu caso de uso é enfiar um repositório inteiro, um livro ou uma base de código num único prompt, o americano é o único dos dois que aguenta sem cortar. O chinês, por outro lado, tem knowledge cutoff de 2025-09-30 — ou seja, foi treinado com dados até o fim de setembro. O Maverick para em agosto de 2024. Em coisas que mudaram nos últimos doze meses, o Qwen3 Instruct simplesmente sabe mais.

E tem o país de origem: Meta, EUA; Alibaba, China. Para algumas equipes, isso é detalhe; para outras, é critério de compra.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 244 modelos disponíveis no catálogo nesta data.

Para quem vale cada um

Maverick vale para você se: precisa de contexto de um milhão de tokens, roda cargas multimodais (texto + imagem → texto, o Qwen3 Instruct só faz texto → texto), tem orçamento para US$ 0,696 por milhão de saída e não se importa que o conhecimento do modelo pare em agosto de 2024. Não vale se você quer velocidade pura ou está rodando prompts curtos em volume — aí o chinês entrega quase o dobro de tokens por segundo pelo mesmo dinheiro.

Qwen3 Next 80B A3B Instruct vale para você se: roda tarefas de texto puro, quer velocidade (173 t/s contra 86), precisa de conhecimento atualizado até setembro de 2025 e aceita pagar US$ 1,10 por milhão de saída em troca de US$ 0,10 de entrada. Não vale se o seu fluxo depende de imagem ou se a janela de 262K tokens não cobre o documento.

O que fazer com isso hoje

Se a sua fila é majoritariamente input-pesada — classificação, extração, embeddings de texto longo —, o Qwen3 Next Instruct custa metade e roda mais rápido. Se a sua fila é output-pesada com contexto gigante ou exige visão, o Maverick ainda é o único dos dois que faz o trabalho, e o custo extra de US$ 0,30 por milhão de tokens de saída é o preço de não ter alternativa nessa faixa. O resto é marketing.

Em uma frase

Escolha o Qwen3 Next 80B para texto puro em volume e velocidade; escolha o Llama 4 Maverick quando precisar de contexto de 1M tokens, multimodalidade ou aceitar pagar mais caro no output.

Perguntas frequentes

Llama 4 Maverick ou Qwen3 Next 80B: qual é mais barato?

Depende do lado do token. O Qwen3 custa metade no input (US$ 0,10 contra US$ 0,20 por milhão), mas é 58% mais caro no output (US$ 1,10 contra US$ 0,696). Quem gera pouco texto e lê muito paga menos no chinês; quem escreve muito paga menos no americano.

Qual dos dois tem a maior janela de contexto?

O Llama 4 Maverick, com 1.048.576 tokens (um milhão). O Qwen3 Next 80B A3B Instruct suporta 262.144 tokens, quatro vezes menos. Para documentos que não cabem em 262K, o Maverick é o único dos dois que resolve.

Os dois modelos são abertos?

Sim. Tanto o Llama 4 Maverick quanto o Qwen3 Next 80B A3B Instruct são listados com pesos abertos no catálogo. Isso significa que, além de usar pela API, é possível baixar e rodar localmente — desde que você tenha hardware compatível com a arquitetura MoE de cada um.

Leia também