FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B Instruct cobra 9× menos que Command A e entrega quase o dobro de inteligência

Mesmo com 3 bilhões de parâmetros ativos contra 111 bilhões do rival canadense, o modelo chinês vence em IQ, velocidade e preço por token de saída.

Redação FalaVIP IA 3 min de leitura
US$ 1,10por milhão de tokens de saída no Qwen3 Next Instruct
US$ 10,00por milhão de tokens de saída no Command A
13,75 vs 7,46índice de inteligência Artificial Analysis

Você está olhando para dois modelos que custam ordens de grandeza diferentes na fatura, mas pertencem ao mesmo clube: ambos são open weights, ambos prometem 256k de contexto, ambos rodam em produção. A diferença aparece quando o boleto chega.

O preço que não mente

O Qwen3 Next 80B A3B Instruct cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de tokens de saída. O Command A cobra US$ 2,50 de entrada e US$ 10,00 de saída. Na prática, gerar 1 milhão de tokens de resposta no modelo da Cohere custa nove vezes mais do que no modelo da Qwen — e a entrada custa 25 vezes mais.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Instruct1,1Command A10US$/M
Fonte: OpenRouter

Para um produto que gera, digamos, 50 milhões de tokens de saída por mês, a conta fecha em US$ 55 com o Qwen3 Next Instruct e US$ 500 com o Command A. São US$ 445 de diferença por mês em um único caso de uso. Multiplique pelo número de clientes e o número começa a doer.

Inteligência medida, não prometida

O índice de inteligência da Artificial Analysis coloca o Qwen3 Next Instruct em 13,75 e o Command A em 7,46. O modelo chinês quase dobra a marca do canadense nessa régua.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Instruct13,8Command A7,5índice
Fonte: Artificial Analysis

Lembre-se: esse é o índice atual, não uma série histórica. O que dá para afirmar é que, nesta data, o Qwen3 Next Instruct está à frente do Command A nessa métrica, e também à frente de outros modelos maiores da casa, como o gpt-oss-20b da OpenAI, que marca 15,23 — uma diferença pequena, mas com o Qwen custando 0,13 e o gpt-oss-20b custando 0,13 também na saída. Ou seja, em alguns recortes, eles empatam em IQ e o Qwen custa uma fração.

Tamanho não é documento

Aqui mora a curiosidade técnica que justifica uma analogia. Pense no Command A como um restaurante com 111 chefs na cozinha, todos trabalhando ao mesmo tempo em cada pedido. O Qwen3 Next Instruct é um restaurante com 80 chefs no quadro, mas só 3 entram na cozinha por pedido — os outros 77 ficam de prontidão para situações específicas. É a tal da arquitetura MoE (mixture of experts), que usa só uma fração dos parâmetros por inferência.

Qwen3 Next 80B A3B Instruct × Command A
CritérioQwen3 Next 80B A3B InstructCommand A
Índice de inteligência13.87.5
Entrada US$/M0.12.5
Saída US$/M1.110
Contexto262k256k
Pesos abertossimsim
Velocidade (tok/s)17358
Índice de código
Índice agêntico

O resultado prático: o Qwen3 Next Instruct roda a 173 tokens por segundo, contra 58 do Command A. Em workloads sensíveis a latência — chatbots, geração em tempo real, pipelines de RAG — essa diferença de 3× aparece no bolso do usuário final.

Onde cada um ganha

Qwen3 Next 80B A3B Instruct ganha quando o que importa é custo por token, latência e você roda em volume. Chatbots de atendimento, geração de conteúdo em massa, tradução, classificação, sumarização — qualquer workload em que cada centavo por milhão de tokens entra no P&L. Também ganha se você quer manter a porta aberta para self-hosting, já que os pesos são públicos.

Command A ganha quando o que importa é o nome na nota fiscal. Cohere é uma empresa canadense com contrato enterprise, SLA formal e suporte comercial em horário comercial. Para uma fintech regulada, um hospital ou um cliente europeu que precisa de GDPR com assinatura, isso tem valor que não cabe em benchmark. O Command A também tem knowledge cutoff mais antigo (agosto de 2024 contra setembro de 2025 do Qwen), o que pode ser desvantagem ou não — depende do seu domínio.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 276 modelos disponíveis no catálogo nesta data.

E tem um detalhe que costuma passar batido: o Command A não publicou preço de cache no catálogo. Isso geralmente significa que o provedor não oferece cache de prompt com desconto — outra economia que some da conta.

O tabuleiro em 15 de novembro

O catálogo tem 276 modelos listados, 42 criadores diferentes, e 17 foram lançados nos últimos 30 dias. O topo da régua de inteligência segue sendo o OpenAI o3 (IQ 31,10), seguido do Claude Haiku 4.5 (29,89). Nenhum dos dois modelos deste comparativo está nesse pódio — mas nenhum dos dois também custa US$ 8 por milhão de tokens de saída como o o3, nem US$ 5 como o Haiku. Eles brigam em outra faixa: a do volume com orçamento apertado.

Se você está migrando de Command A para Qwen3 Next Instruct, o movimento faz sentido em 9 de cada 10 workloads de produção. Se está assinando Command A hoje, provavelmente tem um motivo que não aparece em planilha de preço.

Em uma frase

Se a sua decisão cabe em planilha de custo por token, migre para o Qwen3 Next Instruct; se o que vale é contrato enterprise e SLA formal, o Command A continua sendo a escolha.

Perguntas frequentes

Qwen3 Next 80B Instruct é realmente mais barato que Command A?

Sim. O Qwen cobra US$ 1,10 por milhão de tokens de saída contra US$ 10,00 do Command A — uma diferença de 9×. Na entrada, a diferença é ainda maior: US$ 0,10 contra US$ 2,50.

Por que o Qwen3 Next Instruct é mais rápido mesmo tendo mais parâmetros totais?

Porque só 3 dos 80 bilhões de parâmetros são ativados por inferência (arquitetura MoE). O Command A ativa todos os 111 bilhões a cada token gerado, o que custa mais computação e tempo.

Posso rodar o Qwen3 Next Instruct na minha própria infraestrutura?

Sim. Ambos os modelos são open weights, então é possível fazer self-hosting. Na prática, o Qwen3 Next Instruct exige menos GPU por causa dos 3 bilhões de parâmetros ativos, o que barateia a operação.

Leia também