US$ 1,10 por milhão na saída — e o resto da conta?
Intellect-3 raciocina, Qwen3 Next voa. Mesma fatura de saída, custos opostos para quem paga a API no fim do mês.
US$ 1,10 por milhão na saída — e o resto da conta?
Se você só olhasse o preço de saída, Intellect-3 e Qwen3 Next 80B A3B Instruct dariam empate. A conta, claro, não para na saída. E nem começa nela para quem roda muito input ou cache.
Mesma saída, apostas opostas
Token de saída custa US$ 1,10 nos dois modelos. A diferença começa no input — US$ 0,20 por milhão no Intellect-3 contra US$ 0,10 no Qwen3 Next. Em workloads onde a resposta é curta e o prompt é longo, isso pesa. Mas o ponto mais interessante está num campo que o Intellect-3 nem publica: o preço de cache. O Qwen3 Next cobra US$ 0,07 por milhão de tokens cached. O Intellect-3 não informa — e onde não há número, você geralmente não tem o desconto.
Faça uma conta rápida. Imagine 4 milhões de tokens de input e 1 milhão de saída numa única chamada:
- Intellect-3: US$ 0,80 + US$ 1,10 = US$ 1,90
- Qwen3 Next sem cache: US$ 0,40 + US$ 1,10 = US$ 1,50
- Qwen3 Next com cache total: US$ 0,28 + US$ 1,10 = US$ 1,38
São 27% mais barato no cenário com cache, em workload idêntico, mesmo preço de saída.
Inteligência: vantagem pequena para o americano
O índice de inteligência Artificial Analysis coloca o Intellect-3 em 15,718 e o Qwen3 Next em 13,754. Diferença real, mas pequena — algo em torno de 14% no índice bruto. Se você colocar os dois ao lado do topo do catálogo hoje, Xiaomi MiMo-V2-Flash lidera com 34,024 (US$ 0,30 de saída), seguido por OpenAI o3 (31,096 a US$ 8) e Claude Haiku 4.5 (29,892 a US$ 5). Os dois da pauta ficam bem abaixo — são modelos de peso aberto e preço baixo, não estão brigando pelo topo da prateleira.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Onde cada um ganha de verdade
| Critério | INTELLECT-3 | Qwen3 Next 80B A3B Instruct |
|---|---|---|
| Índice de inteligência | 15.7 | 13.8 |
| Entrada US$/M | 0.2 | 0.1 |
| Saída US$/M | 1.1 | 1.1 |
| Contexto | 131k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | — | 173 |
| Índice de código | — | — |
| Índice agêntico | — | — |
Tem uma diferença que a tabela de preço não conta: o Intellect-3 é um modelo com raciocínio (reasoning), o Qwen3 Next Instruct, não. Para tarefas que pedem cadeia longa de pensamento — problemas matemáticos, agentes de vários passos, debugging intricado — o modo reasoning muda o resultado. Em tarefas conversacionais, RAG puro ou extração factual, o raciocínio só adiciona latência e custo sem ganho claro.
Aí entra outro número que o Qwen3 Next publica e o Intellect-3 não: velocidade. São 173,42 tokens por segundo medidos para o chinês. É throughput de modelo pequeno, reflexo dos 3 bilhões de parâmetros ativos (MoE com 80B totais). O Intellect-3 tem 12B ativos de 106B totais — quatro vezes mais trabalho por token gerado.
Contexto, país e o que muda na prateleira
A janela de contexto também conta uma história. O Qwen3 Next oferece 262.144 tokens — o dobro do Intellect-3, que trava em 131.072. Para alimentar bases de código inteiras, contratos longos, transcrições de reunião ou documentação técnica, isso pesa.
Os dois são modelos abertos, então dá para rodar self-hosted se a operação justificar. Mas o Intellect-3 vem da Prime Intellect (EUA), o Qwen3 Next da Alibaba (China). Em fevereiro de 2026, isso ainda pesa para algumas cadeias de compliance — a origem dos pesos influencia política de uso em setores regulados.
O veredito prático
Intellect-3 ganha quando o trabalho pede raciocínio encadeado e a fatura de input não domina — agentes de coding, resolução matemática, análise estruturada de poucos documentos onde os 14% de índice de inteligência fazem diferença no resultado.
Qwen3 Next 80B A3B Instruct ganha quando o volume de tokens consumidos domina a conta — RAG pesado, sistemas com cache agressivo, prompts longos em contextos de 200K+ tokens, e qualquer fluxo onde latência e throughput importam mais que os últimos pontos percentuais de IQ.
Se sua fatura é dominada por input com cache e você precisa de velocidade, vai de Qwen3 Next; se a tarefa exige raciocínio encadeado e o prompt é curto, os 14% a mais de IQ do Intellect-3 pelo mesmo token de saída valem o dobro do input.
Perguntas frequentes
Intellect-3 ou Qwen3 Next 80B: qual gasta menos no fim do mês?
Depende do perfil de uso. Em workload com muito input cached, o Qwen3 Next fica até 27% mais barato mesmo com a saída igual. Em tarefas curtas de raciocínio, o Intellect-3 não cobra overhead extra e entrega 14% a mais de IQ pelo mesmo US$ 1,10 por milhão na saída.
Os dois modelos são open weights?
Sim, ambos têm pesos abertos. O Intellect-3 soma 106B parâmetros totais com 12B ativos por inferência; o Qwen3 Next tem 80B totais com apenas 3B ativos, o que ajuda a explicar a velocidade de 173 t/s medida.
Qual tem a maior janela de contexto?
Qwen3 Next, com 262.144 tokens — exatamente o dobro do Intellect-3, que trava em 131.072. Para bases de código inteiras, contratos longos ou transcrições extensas, o Qwen3 Next aceita sem precisar truncar.