Llama 4 Maverick custa o dobro do Qwen3 Next e entrega só 5% mais IQ
Comparativo frente a frente entre dois modelos abertos com arquitetura MoE: um americano de 402B e um chinês de 80B que cobram preços muito diferentes pelo mesmo tipo de tarefa.
O que a conta mostra antes do benchmark
A conta da API não perdoa: o Llama 4 Maverick cobra US$ 0,20 por milhão de tokens de entrada e US$ 0,696 por milhão de saída. O Qwen3 Next 80B A3B Instruct, da chinesa Alibaba, cobra US$ 0,10 de entrada e US$ 1,10 de saída. Em outras palavras, o chinês custa metade no input e 58% mais caro no output. Quem só lê release pensa que está olhando o mesmo produto em duas embalagens; quem paga a fatura sabe que a embalagem muda tudo.
Tamanho não é documento
O Maverick é um monstro: 402 bilhões de parâmetros totais, com 17B ativos por passagem, distribuídos em 128 especialistas. O Qwen3 Next 80B tem 80B totais e só 3B ativos. Em arquitetura MoE, o que roda no seu servidor — ou no servidor do provedor — são os parâmetros ativos. É como comparar um restaurante com 128 chefs no quadro e só 17 trabalhando no turno contra um com 80 chefs no quadro e 3 no turno. O americano tem mais gente disponível; o chinês gasta menos gente por pedido.
E aí vem o detalhe que o marketing da Meta faz de conta que não existe: o índice de inteligência do Maverick é 14,477. O do Qwen3 Next Instruct é 13,754. Diferença de 0,723 ponto, algo em torno de 5%. Em troca, o chinês entrega quase o dobro de velocidade: 173 tokens por segundo contra 86 do Maverick.
Onde cada um ganha de verdade
Para geração de código, o Maverick tem nota 16,277 no índice de coding. O Qwen3 Next Instruct não tem nota publicada no catálogo — e isso não é detalhe menor: quando o catálogo não publica, você não tem como comparar, então você testa. Já em agentic, o cenário é pior para os dois: Maverick marca 1,237 e o Qwen3 Instruct não tem índice. O blended, que pondera uso geral, fica em 0,4225 para o americano e 0,4125 para o chinês — empate técnico dentro da margem de erro.
| Critério | Llama 4 Maverick | Qwen3 Next 80B A3B Instruct |
|---|---|---|
| Índice de inteligência | 14.5 | 13.8 |
| Entrada US$/M | 0.2 | 0.1 |
| Saída US$/M | 0.696 | 1.1 |
| Contexto | 1.05M | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 86 | 173 |
| Índice de código | 16.3 | — |
| Índice agêntico | 1.2 | — |
Contexto importa — e contexto aqui é gigante
O Maverick abre janela de 1.048.576 tokens, um milhão. O Qwen3 Next Instruct abre 262.144, um quarto disso. Se o seu caso de uso é enfiar um repositório inteiro, um livro ou uma base de código num único prompt, o americano é o único dos dois que aguenta sem cortar. O chinês, por outro lado, tem knowledge cutoff de 2025-09-30 — ou seja, foi treinado com dados até o fim de setembro. O Maverick para em agosto de 2024. Em coisas que mudaram nos últimos doze meses, o Qwen3 Instruct simplesmente sabe mais.
E tem o país de origem: Meta, EUA; Alibaba, China. Para algumas equipes, isso é detalhe; para outras, é critério de compra.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para quem vale cada um
Maverick vale para você se: precisa de contexto de um milhão de tokens, roda cargas multimodais (texto + imagem → texto, o Qwen3 Instruct só faz texto → texto), tem orçamento para US$ 0,696 por milhão de saída e não se importa que o conhecimento do modelo pare em agosto de 2024. Não vale se você quer velocidade pura ou está rodando prompts curtos em volume — aí o chinês entrega quase o dobro de tokens por segundo pelo mesmo dinheiro.
Qwen3 Next 80B A3B Instruct vale para você se: roda tarefas de texto puro, quer velocidade (173 t/s contra 86), precisa de conhecimento atualizado até setembro de 2025 e aceita pagar US$ 1,10 por milhão de saída em troca de US$ 0,10 de entrada. Não vale se o seu fluxo depende de imagem ou se a janela de 262K tokens não cobre o documento.
O que fazer com isso hoje
Se a sua fila é majoritariamente input-pesada — classificação, extração, embeddings de texto longo —, o Qwen3 Next Instruct custa metade e roda mais rápido. Se a sua fila é output-pesada com contexto gigante ou exige visão, o Maverick ainda é o único dos dois que faz o trabalho, e o custo extra de US$ 0,30 por milhão de tokens de saída é o preço de não ter alternativa nessa faixa. O resto é marketing.
Escolha o Qwen3 Next 80B para texto puro em volume e velocidade; escolha o Llama 4 Maverick quando precisar de contexto de 1M tokens, multimodalidade ou aceitar pagar mais caro no output.
Perguntas frequentes
Llama 4 Maverick ou Qwen3 Next 80B: qual é mais barato?
Depende do lado do token. O Qwen3 custa metade no input (US$ 0,10 contra US$ 0,20 por milhão), mas é 58% mais caro no output (US$ 1,10 contra US$ 0,696). Quem gera pouco texto e lê muito paga menos no chinês; quem escreve muito paga menos no americano.
Qual dos dois tem a maior janela de contexto?
O Llama 4 Maverick, com 1.048.576 tokens (um milhão). O Qwen3 Next 80B A3B Instruct suporta 262.144 tokens, quatro vezes menos. Para documentos que não cabem em 262K, o Maverick é o único dos dois que resolve.
Os dois modelos são abertos?
Sim. Tanto o Llama 4 Maverick quanto o Qwen3 Next 80B A3B Instruct são listados com pesos abertos no catálogo. Isso significa que, além de usar pela API, é possível baixar e rodar localmente — desde que você tenha hardware compatível com a arquitetura MoE de cada um.