Qwen3 Next 80B A3B Thinking e INTELLECT-3: qual vale o token?
Dois modelos de raciocínio chineses e americanos disputam a faixa dos US$ 1 por milhão de saída — e a diferença está no que cada um mede melhor.
Você está olhando dois modelos de raciocínio com pesos abertos, lançados com menos de três meses de diferença, e a conta de API dos dois cabe no mesmo dígito. A diferença não está no preço — está no que cada um faz com o dinheiro que sobra.
O duelo em uma linha
O Qwen3 Next 80B A3B Thinking é chinês, da Alibaba/Qwen, e foi lançado em 11 de setembro de 2025. O INTELLECT-3 é americano, da Prime Intellect, e estreou ontem no catálogo. Os dois cobram entre US$ 1,10 e US$ 1,20 por milhão de tokens de saída — uma diferença de 9% que some no fim do mês. O resto da conversa é outra.
Inteligência e raciocínio medido
No índice de inteligência da Artificial Analysis medido hoje, o Qwen marca 16,87 e o INTELLECT-3 marca 15,72. Em programação, a vantagem do Qwen é maior: 17,42 no Coding Index, com o INTELLECT-3 sem nota publicada nessa categoria. Em tarefas agentic, o Qwen registra 2,06 — o INTELLECT-3 também não traz número. Ou seja: em três das quatro dimensões que normalmente decidem uma compra, o Qwen aparece sozinho na planilha.
Isso não significa que o INTELLECT-3 seja pior em tudo. Significa que, para esta comparação, o catálogo ainda não tem dados suficientes nas categorias em que ele poderia brilhar. É uma assimetria de medição, não necessariamente de capacidade.
Preço e o que sobra da conta
O Qwen cobra US$ 0,15 por milhão de tokens de entrada e US$ 1,20 por milhão de saída. O INTELLECT-3 cobra US$ 0,20 de entrada e US$ 1,10 de saída. Para um workload típico de raciocínio — muito mais tokens de saída do que de entrada — o INTELLECT-3 fica marginalmente mais barato no papel. Mas o Qwen entrega um índice de inteligência 7% maior pelo mesmo dinheiro. Pense como quem paga conta de luz: a tarifa é parecida, mas um aparelho consome menos kilowatt-hora para entregar o mesmo serviço.
Nenhum dos dois divulga preço de cache de leitura. Se você usa o mesmo prompt repetido em chamadas longas, não tem como comparar esse pedaço da fatura com os dados públicos.
Janela de contexto e velocidade
Aqui a história muda de sinal. O Qwen oferece 262.144 tokens de contexto — o dobro do INTELLECT-3, que fica em 131.072. Em velocidade, o Qwen registra 196,94 tokens por segundo; o INTELLECT-3 não tem número publicado. Para quem joga livros inteiros, bases de código longas ou logs de agente na janela, a vantagem do Qwen é estrutural, não negociável.
Tamanho, arquitetura e procedência
O Qwen é um modelo de 80 bilhões de parâmetros totais com 3 bilhões ativos — uma arquitetura MoE enxuta. O INTELLECT-3 é um MoE de 106 bilhões totais com 12 bilhões ativos, pós-treinado a partir do GLM-4.5-Air-Base com SFT e RL em larga escala. Os dois são de pesos abertos. O Qwen vem da China; o INTELLECT-3 vem dos Estados Unidos. Em workloads sensíveis a jurisdição de dados, essa linha importa.
| Critério | Qwen3 Next 80B A3B Thinking | INTELLECT-3 |
|---|---|---|
| Índice de inteligência | 16.9 | 15.7 |
| Entrada US$/M | 0.15 | 0.2 |
| Saída US$/M | 1.2 | 1.1 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 197 | — |
| Índice de código | 17.4 | — |
| Índice agêntico | 2.1 | — |
Onde cada um ganha
O Qwen3 Next 80B A3B Thinking ganha quando você precisa de janela de contexto ampla, tem medição de coding e agentic que sustentam a decisão, e quer o melhor índice de inteligência da faixa. É a escolha para refatoração de código grande, provas matemáticas longas e pipelines agentic com muito histórico.
O INTELLECT-3 ganha quando o orçamento de saída é o gargalo absoluto, quando a procedência americana pesa na decisão regulatória, ou quando você está testando um modelo pós-treinado com RL em escala e aceita esperar benchmarks mais completos. Para a maioria dos workloads de raciocínio do dia a dia, porém, o Qwen entrega mais por quase o mesmo preço.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| INTELLECT-3 | 15.7 | 1.1 |
Se a sua fila de jobs cabe em 131 mil tokens e a nota de coding não importa, o INTELLECT-3 cumpre. Em todo o resto, o Qwen ainda lidera esta comparação.
Para a maioria dos workloads de raciocínio com janela ampla, o Qwen3 Next 80B A3B Thinking entrega mais inteligência pelo mesmo preço; o INTELLECT-3 só vence quando o custo de saída é o único critério ou a procedência americana é exigência.
Perguntas frequentes
Qual a diferença de preço entre Qwen3 Next 80B A3B Thinking e INTELLECT-3?
O Qwen cobra US$ 0,15 por milhão de tokens de entrada e US$ 1,20 por milhão de saída. O INTELLECT-3 cobra US$ 0,20 de entrada e US$ 1,10 de saída. A diferença efetiva depende do equilíbrio entre tokens de entrada e saída no seu workload.
Qual dos dois tem a maior janela de contexto?
O Qwen3 Next 80B A3B Thinking oferece 262.144 tokens de contexto, o dobro dos 131.072 do INTELLECT-3. Para bases de código longas, documentos extensos ou históricos de agente, essa diferença é decisiva.
O INTELLECT-3 é melhor que o Qwen3 Next em raciocínio?
Não pelos dados públicos desta data: o Qwen marca 16,87 no índice de inteligência contra 15,72 do INTELLECT-3, e tem nota de coding e agentic que o INTELLECT-3 ainda não publicou no catálogo.