FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next Thinking cobra 8x mais no output que o Ministral 3 8B

Dois modelos open-weights disputam o meio de tabela: um emite traços de pensamento, o outro responde direto. O preço na fatura é menos óbvio do que parece.

Redação FalaVIP IA 3 min de leitura
US$ 1,20por milhão de tokens de saída no Qwen3 Next Thinking
8xdiferença de preço de saída contra o Ministral 3 8B
16,867índice de inteligência do Qwen3 Next Thinking (vs 8,974 do Ministral)

A conta que não cabe no exemplo de marketing

Você está olhando para dois modelos open-weights com a mesma porta de entrada — US$ 0,15 por milhão de tokens. Aí você abre a coluna de saída: US$ 1,20 no Qwen3 Next 80B A3B Thinking, US$ 0,15 no Ministral 3 8B 2512. São oito vezes mais caro no papel. Mas o papel esconde uma armadilha que só aparece quando a fatura chega.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Thinking1,2Ministral 3 8B 25120,15US$/M
Fonte: OpenRouter

O detalhe sujo está nos tokens de raciocínio

O Qwen3 Next Thinking é um modelo reasoning-first: por padrão, emite um traço de pensamento estruturado antes da resposta final. Esse traço é cobrado como output, ao mesmo US$ 1,20 por milhão. Em tarefas de várias etapas — prova matemática, debug de código, planejamento de agente — o volume de tokens consumidos é maior do que em um modelo sem raciocínio. O preço unitário é honesto; o volume por tarefa não é comparável lado a lado.

O Ministral 3 8B não raciocina. Responde direto. Os US$ 0,15 por milhão na saída são o que você paga, ponto. Para classificação, extração, chat curto e leitura de imagem (sim, ele tem visão), o motor é mais barato e mais previsível.

A diferença de capacidade e de arquitetura que o preço não esconde

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Thinking16,9Ministral 3 8B 25129índice
Fonte: Artificial Analysis

No índice de inteligência da Artificial Analysis, o Qwen3 Next 80B Thinking marca 16,867 contra 8,974 do Ministral 3 8B. Em coding, 17,419 contra 9,691. Se o trabalho é genuinamente difícil — provas, arquitetura de código, fluxos agentic longos — o Ministral 8B simplesmente não está na mesma prateleira.

Mas olha o custo por inteligência. O preço blended do Qwen é US$ 0,4125 por milhão; o do Ministral é US$ 0,15. Isso é 2,75x mais caro por token blended. A diferença de IQ é 1,88x. Se a tarefa está dentro do alcance do Ministral, parte do que se paga no Qwen é capacidade ociosa.

E há outra diferença debaixo do capô. O Qwen é mixture-of-experts: 80 bilhões de parâmetros no total, mas só 3 bilhões ativos por token. Pense num hospital com dezenas de especialistas no quadro — você aciona só os relevantes para o caso. O Ministral é denso: 8 bilhões, todos disparando a cada token. Mesmo hospital, mas cada médico examina cada paciente. Na prática, isso explica por que o Qwen roda mais rápido em tokens por segundo — 196,94 contra 112,03 do Ministral.

Quem ganha em que situação

Qwen3 Next 80B A3B Thinking × Ministral 3 8B 2512
CritérioQwen3 Next 80B A3B ThinkingMinistral 3 8B 2512
Índice de inteligência16.99.0
Entrada US$/M0.150.15
Saída US$/M1.20.15
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)197112
Índice de código17.49.7
Índice agêntico2.11.2

O Qwen3 Next 80B A3B Thinking leva quando: o trabalho exige raciocínio pesado (matemática, lógica, síntese de código multi-etapa); o volume de output por chamada é baixo, mas a qualidade é crítica; fluxos agentic longos se beneficiam de pensar antes de agir.

O Ministral 3 8B 2512 leva quando: o pipeline processa alto volume de tarefas curtas (classificação, extração, FAQ); há entrada de imagem (o Qwen é só texto); o custo de saída precisa ser previsível e baixo; o caso de uso roda em hardware próprio modesto (8B denso cabe em GPU de consumo); e quando cache de prompt importa — o Ministral publica US$ 0,015 por milhão para leitura cacheada; o Qwen não publicou preço de cache no catálogo.

Onde isso te deixa no tabuleiro

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 314 modelos disponíveis no catálogo nesta data.

Para referência, o topo do índice hoje é o Xiaomi MiMo-V2-Flash, com 34,024 de IQ a US$ 0,30 por milhão de saída. Logo atrás vem o OpenAI o3 (31,096) a US$ 8,00. Os dois modelos deste comparativo ficam bem abaixo desse teto, mas custam uma fração. O Qwen tem cerca de metade do IQ do Xiaomi por 4x o preço de saída; o Ministral tem cerca de um quarto do IQ por metade do preço de saída.

Nenhum dos dois compete com a fronteira. Eles disputam o meio de tabela — onde cada centavo no output vira reais no fim do mês.

Em uma frase

Se o seu gargalo é volume de output e tarefas curtas, o Ministral 3 8B entrega mais inteligência por real; se o gargalo é raciocínio pesado em poucas chamadas, o Qwen3 Next Thinking paga a conta — mas a fatura cresce junto com cada token de pensamento.

Perguntas frequentes

O Qwen3 Next Thinking é 8x mais inteligente que o Ministral 3 8B?

Não. O índice de inteligência da Artificial Analysis mostra 16,867 contra 8,974 — uma diferença de 1,88x. Os 8x aparecem no preço de saída por milhão de tokens, não na capacidade. Como o Qwen é raciocínio-first, ele consome mais tokens por tarefa, o que amplia o custo real por chamada.

Qual dos dois aceita imagem?

O Ministral 3 8B 2512 é multimodal text+image → text. O Qwen3 Next 80B A3B Thinking aceita apenas texto. Se o seu pipeline inclui OCR, descrição de imagem ou qualquer entrada visual, o Ministral é a única opção entre os dois.

Posso rodar o Ministral 3 8B localmente?

Sim. São 8 bilhões de parâmetros densos e open weights, o que cabe em uma GPU de consumo moderna com quantização. O Qwen3 Next é mixture-of-experts com 80B totais, mais exigente para self-host, especialmente se você quiser ativar todos os especialistas.

Leia também