FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

US$ 1,10 por milhão na saída — e o resto da conta?

Intellect-3 raciocina, Qwen3 Next voa. Mesma fatura de saída, custos opostos para quem paga a API no fim do mês.

Redação FalaVIP IA 3 min de leitura
US$ 1,10por milhão de tokens de saída nos dois modelos
US$ 0,07por milhão de tokens cached (só no Qwen3 Next)
173 t/svelocidade medida do Qwen3 Next

US$ 1,10 por milhão na saída — e o resto da conta?

Se você só olhasse o preço de saída, Intellect-3 e Qwen3 Next 80B A3B Instruct dariam empate. A conta, claro, não para na saída. E nem começa nela para quem roda muito input ou cache.

Mesma saída, apostas opostas

Preço de saída (US$ por milhão de tokens)
INTELLECT-31,1Qwen3 Next 80B A3B Instruct1,1US$/M
Fonte: OpenRouter

Token de saída custa US$ 1,10 nos dois modelos. A diferença começa no input — US$ 0,20 por milhão no Intellect-3 contra US$ 0,10 no Qwen3 Next. Em workloads onde a resposta é curta e o prompt é longo, isso pesa. Mas o ponto mais interessante está num campo que o Intellect-3 nem publica: o preço de cache. O Qwen3 Next cobra US$ 0,07 por milhão de tokens cached. O Intellect-3 não informa — e onde não há número, você geralmente não tem o desconto.

Faça uma conta rápida. Imagine 4 milhões de tokens de input e 1 milhão de saída numa única chamada:

  • Intellect-3: US$ 0,80 + US$ 1,10 = US$ 1,90
  • Qwen3 Next sem cache: US$ 0,40 + US$ 1,10 = US$ 1,50
  • Qwen3 Next com cache total: US$ 0,28 + US$ 1,10 = US$ 1,38

São 27% mais barato no cenário com cache, em workload idêntico, mesmo preço de saída.

Inteligência: vantagem pequena para o americano

Índice de inteligência (Artificial Analysis)
INTELLECT-315,7Qwen3 Next 80B A3B Instruct13,8índice
Fonte: Artificial Analysis

O índice de inteligência Artificial Analysis coloca o Intellect-3 em 15,718 e o Qwen3 Next em 13,754. Diferença real, mas pequena — algo em torno de 14% no índice bruto. Se você colocar os dois ao lado do topo do catálogo hoje, Xiaomi MiMo-V2-Flash lidera com 34,024 (US$ 0,30 de saída), seguido por OpenAI o3 (31,096 a US$ 8) e Claude Haiku 4.5 (29,892 a US$ 5). Os dois da pauta ficam bem abaixo — são modelos de peso aberto e preço baixo, não estão brigando pelo topo da prateleira.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 327 modelos disponíveis no catálogo nesta data.

Onde cada um ganha de verdade

INTELLECT-3 × Qwen3 Next 80B A3B Instruct
CritérioINTELLECT-3Qwen3 Next 80B A3B Instruct
Índice de inteligência15.713.8
Entrada US$/M0.20.1
Saída US$/M1.11.1
Contexto131k262k
Pesos abertossimsim
Velocidade (tok/s)173
Índice de código
Índice agêntico

Tem uma diferença que a tabela de preço não conta: o Intellect-3 é um modelo com raciocínio (reasoning), o Qwen3 Next Instruct, não. Para tarefas que pedem cadeia longa de pensamento — problemas matemáticos, agentes de vários passos, debugging intricado — o modo reasoning muda o resultado. Em tarefas conversacionais, RAG puro ou extração factual, o raciocínio só adiciona latência e custo sem ganho claro.

Aí entra outro número que o Qwen3 Next publica e o Intellect-3 não: velocidade. São 173,42 tokens por segundo medidos para o chinês. É throughput de modelo pequeno, reflexo dos 3 bilhões de parâmetros ativos (MoE com 80B totais). O Intellect-3 tem 12B ativos de 106B totais — quatro vezes mais trabalho por token gerado.

Contexto, país e o que muda na prateleira

A janela de contexto também conta uma história. O Qwen3 Next oferece 262.144 tokens — o dobro do Intellect-3, que trava em 131.072. Para alimentar bases de código inteiras, contratos longos, transcrições de reunião ou documentação técnica, isso pesa.

Os dois são modelos abertos, então dá para rodar self-hosted se a operação justificar. Mas o Intellect-3 vem da Prime Intellect (EUA), o Qwen3 Next da Alibaba (China). Em fevereiro de 2026, isso ainda pesa para algumas cadeias de compliance — a origem dos pesos influencia política de uso em setores regulados.

O veredito prático

Intellect-3 ganha quando o trabalho pede raciocínio encadeado e a fatura de input não domina — agentes de coding, resolução matemática, análise estruturada de poucos documentos onde os 14% de índice de inteligência fazem diferença no resultado.

Qwen3 Next 80B A3B Instruct ganha quando o volume de tokens consumidos domina a conta — RAG pesado, sistemas com cache agressivo, prompts longos em contextos de 200K+ tokens, e qualquer fluxo onde latência e throughput importam mais que os últimos pontos percentuais de IQ.

Em uma frase

Se sua fatura é dominada por input com cache e você precisa de velocidade, vai de Qwen3 Next; se a tarefa exige raciocínio encadeado e o prompt é curto, os 14% a mais de IQ do Intellect-3 pelo mesmo token de saída valem o dobro do input.

Perguntas frequentes

Intellect-3 ou Qwen3 Next 80B: qual gasta menos no fim do mês?

Depende do perfil de uso. Em workload com muito input cached, o Qwen3 Next fica até 27% mais barato mesmo com a saída igual. Em tarefas curtas de raciocínio, o Intellect-3 não cobra overhead extra e entrega 14% a mais de IQ pelo mesmo US$ 1,10 por milhão na saída.

Os dois modelos são open weights?

Sim, ambos têm pesos abertos. O Intellect-3 soma 106B parâmetros totais com 12B ativos por inferência; o Qwen3 Next tem 80B totais com apenas 3B ativos, o que ajuda a explicar a velocidade de 173 t/s medida.

Qual tem a maior janela de contexto?

Qwen3 Next, com 262.144 tokens — exatamente o dobro do Intellect-3, que trava em 131.072. Para bases de código inteiras, contratos longos ou transcrições extensas, o Qwen3 Next aceita sem precisar truncar.

Leia também