Qwen3 Next 80B Instruct cobra 9× menos que Command A e entrega quase o dobro de inteligência
Mesmo com 3 bilhões de parâmetros ativos contra 111 bilhões do rival canadense, o modelo chinês vence em IQ, velocidade e preço por token de saída.
Você está olhando para dois modelos que custam ordens de grandeza diferentes na fatura, mas pertencem ao mesmo clube: ambos são open weights, ambos prometem 256k de contexto, ambos rodam em produção. A diferença aparece quando o boleto chega.
O preço que não mente
O Qwen3 Next 80B A3B Instruct cobra US$ 0,10 por milhão de tokens de entrada e US$ 1,10 por milhão de tokens de saída. O Command A cobra US$ 2,50 de entrada e US$ 10,00 de saída. Na prática, gerar 1 milhão de tokens de resposta no modelo da Cohere custa nove vezes mais do que no modelo da Qwen — e a entrada custa 25 vezes mais.
Para um produto que gera, digamos, 50 milhões de tokens de saída por mês, a conta fecha em US$ 55 com o Qwen3 Next Instruct e US$ 500 com o Command A. São US$ 445 de diferença por mês em um único caso de uso. Multiplique pelo número de clientes e o número começa a doer.
Inteligência medida, não prometida
O índice de inteligência da Artificial Analysis coloca o Qwen3 Next Instruct em 13,75 e o Command A em 7,46. O modelo chinês quase dobra a marca do canadense nessa régua.
Lembre-se: esse é o índice atual, não uma série histórica. O que dá para afirmar é que, nesta data, o Qwen3 Next Instruct está à frente do Command A nessa métrica, e também à frente de outros modelos maiores da casa, como o gpt-oss-20b da OpenAI, que marca 15,23 — uma diferença pequena, mas com o Qwen custando 0,13 e o gpt-oss-20b custando 0,13 também na saída. Ou seja, em alguns recortes, eles empatam em IQ e o Qwen custa uma fração.
Tamanho não é documento
Aqui mora a curiosidade técnica que justifica uma analogia. Pense no Command A como um restaurante com 111 chefs na cozinha, todos trabalhando ao mesmo tempo em cada pedido. O Qwen3 Next Instruct é um restaurante com 80 chefs no quadro, mas só 3 entram na cozinha por pedido — os outros 77 ficam de prontidão para situações específicas. É a tal da arquitetura MoE (mixture of experts), que usa só uma fração dos parâmetros por inferência.
| Critério | Qwen3 Next 80B A3B Instruct | Command A |
|---|---|---|
| Índice de inteligência | 13.8 | 7.5 |
| Entrada US$/M | 0.1 | 2.5 |
| Saída US$/M | 1.1 | 10 |
| Contexto | 262k | 256k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 173 | 58 |
| Índice de código | — | — |
| Índice agêntico | — | — |
O resultado prático: o Qwen3 Next Instruct roda a 173 tokens por segundo, contra 58 do Command A. Em workloads sensíveis a latência — chatbots, geração em tempo real, pipelines de RAG — essa diferença de 3× aparece no bolso do usuário final.
Onde cada um ganha
Qwen3 Next 80B A3B Instruct ganha quando o que importa é custo por token, latência e você roda em volume. Chatbots de atendimento, geração de conteúdo em massa, tradução, classificação, sumarização — qualquer workload em que cada centavo por milhão de tokens entra no P&L. Também ganha se você quer manter a porta aberta para self-hosting, já que os pesos são públicos.
Command A ganha quando o que importa é o nome na nota fiscal. Cohere é uma empresa canadense com contrato enterprise, SLA formal e suporte comercial em horário comercial. Para uma fintech regulada, um hospital ou um cliente europeu que precisa de GDPR com assinatura, isso tem valor que não cabe em benchmark. O Command A também tem knowledge cutoff mais antigo (agosto de 2024 contra setembro de 2025 do Qwen), o que pode ser desvantagem ou não — depende do seu domínio.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
E tem um detalhe que costuma passar batido: o Command A não publicou preço de cache no catálogo. Isso geralmente significa que o provedor não oferece cache de prompt com desconto — outra economia que some da conta.
O tabuleiro em 15 de novembro
O catálogo tem 276 modelos listados, 42 criadores diferentes, e 17 foram lançados nos últimos 30 dias. O topo da régua de inteligência segue sendo o OpenAI o3 (IQ 31,10), seguido do Claude Haiku 4.5 (29,89). Nenhum dos dois modelos deste comparativo está nesse pódio — mas nenhum dos dois também custa US$ 8 por milhão de tokens de saída como o o3, nem US$ 5 como o Haiku. Eles brigam em outra faixa: a do volume com orçamento apertado.
Se você está migrando de Command A para Qwen3 Next Instruct, o movimento faz sentido em 9 de cada 10 workloads de produção. Se está assinando Command A hoje, provavelmente tem um motivo que não aparece em planilha de preço.
Se a sua decisão cabe em planilha de custo por token, migre para o Qwen3 Next Instruct; se o que vale é contrato enterprise e SLA formal, o Command A continua sendo a escolha.
Perguntas frequentes
Qwen3 Next 80B Instruct é realmente mais barato que Command A?
Sim. O Qwen cobra US$ 1,10 por milhão de tokens de saída contra US$ 10,00 do Command A — uma diferença de 9×. Na entrada, a diferença é ainda maior: US$ 0,10 contra US$ 2,50.
Por que o Qwen3 Next Instruct é mais rápido mesmo tendo mais parâmetros totais?
Porque só 3 dos 80 bilhões de parâmetros são ativados por inferência (arquitetura MoE). O Command A ativa todos os 111 bilhões a cada token gerado, o que custa mais computação e tempo.
Posso rodar o Qwen3 Next Instruct na minha própria infraestrutura?
Sim. Ambos os modelos são open weights, então é possível fazer self-hosting. Na prática, o Qwen3 Next Instruct exige menos GPU por causa dos 3 bilhões de parâmetros ativos, o que barateia a operação.