Qwen3 Next Thinking cobra 8x mais no output que o Ministral 3 8B
Dois modelos open-weights disputam o meio de tabela: um emite traços de pensamento, o outro responde direto. O preço na fatura é menos óbvio do que parece.
A conta que não cabe no exemplo de marketing
Você está olhando para dois modelos open-weights com a mesma porta de entrada — US$ 0,15 por milhão de tokens. Aí você abre a coluna de saída: US$ 1,20 no Qwen3 Next 80B A3B Thinking, US$ 0,15 no Ministral 3 8B 2512. São oito vezes mais caro no papel. Mas o papel esconde uma armadilha que só aparece quando a fatura chega.
O detalhe sujo está nos tokens de raciocínio
O Qwen3 Next Thinking é um modelo reasoning-first: por padrão, emite um traço de pensamento estruturado antes da resposta final. Esse traço é cobrado como output, ao mesmo US$ 1,20 por milhão. Em tarefas de várias etapas — prova matemática, debug de código, planejamento de agente — o volume de tokens consumidos é maior do que em um modelo sem raciocínio. O preço unitário é honesto; o volume por tarefa não é comparável lado a lado.
O Ministral 3 8B não raciocina. Responde direto. Os US$ 0,15 por milhão na saída são o que você paga, ponto. Para classificação, extração, chat curto e leitura de imagem (sim, ele tem visão), o motor é mais barato e mais previsível.
A diferença de capacidade e de arquitetura que o preço não esconde
No índice de inteligência da Artificial Analysis, o Qwen3 Next 80B Thinking marca 16,867 contra 8,974 do Ministral 3 8B. Em coding, 17,419 contra 9,691. Se o trabalho é genuinamente difícil — provas, arquitetura de código, fluxos agentic longos — o Ministral 8B simplesmente não está na mesma prateleira.
Mas olha o custo por inteligência. O preço blended do Qwen é US$ 0,4125 por milhão; o do Ministral é US$ 0,15. Isso é 2,75x mais caro por token blended. A diferença de IQ é 1,88x. Se a tarefa está dentro do alcance do Ministral, parte do que se paga no Qwen é capacidade ociosa.
E há outra diferença debaixo do capô. O Qwen é mixture-of-experts: 80 bilhões de parâmetros no total, mas só 3 bilhões ativos por token. Pense num hospital com dezenas de especialistas no quadro — você aciona só os relevantes para o caso. O Ministral é denso: 8 bilhões, todos disparando a cada token. Mesmo hospital, mas cada médico examina cada paciente. Na prática, isso explica por que o Qwen roda mais rápido em tokens por segundo — 196,94 contra 112,03 do Ministral.
Quem ganha em que situação
| Critério | Qwen3 Next 80B A3B Thinking | Ministral 3 8B 2512 |
|---|---|---|
| Índice de inteligência | 16.9 | 9.0 |
| Entrada US$/M | 0.15 | 0.15 |
| Saída US$/M | 1.2 | 0.15 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 197 | 112 |
| Índice de código | 17.4 | 9.7 |
| Índice agêntico | 2.1 | 1.2 |
O Qwen3 Next 80B A3B Thinking leva quando: o trabalho exige raciocínio pesado (matemática, lógica, síntese de código multi-etapa); o volume de output por chamada é baixo, mas a qualidade é crítica; fluxos agentic longos se beneficiam de pensar antes de agir.
O Ministral 3 8B 2512 leva quando: o pipeline processa alto volume de tarefas curtas (classificação, extração, FAQ); há entrada de imagem (o Qwen é só texto); o custo de saída precisa ser previsível e baixo; o caso de uso roda em hardware próprio modesto (8B denso cabe em GPU de consumo); e quando cache de prompt importa — o Ministral publica US$ 0,015 por milhão para leitura cacheada; o Qwen não publicou preço de cache no catálogo.
Onde isso te deixa no tabuleiro
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para referência, o topo do índice hoje é o Xiaomi MiMo-V2-Flash, com 34,024 de IQ a US$ 0,30 por milhão de saída. Logo atrás vem o OpenAI o3 (31,096) a US$ 8,00. Os dois modelos deste comparativo ficam bem abaixo desse teto, mas custam uma fração. O Qwen tem cerca de metade do IQ do Xiaomi por 4x o preço de saída; o Ministral tem cerca de um quarto do IQ por metade do preço de saída.
Nenhum dos dois compete com a fronteira. Eles disputam o meio de tabela — onde cada centavo no output vira reais no fim do mês.
Se o seu gargalo é volume de output e tarefas curtas, o Ministral 3 8B entrega mais inteligência por real; se o gargalo é raciocínio pesado em poucas chamadas, o Qwen3 Next Thinking paga a conta — mas a fatura cresce junto com cada token de pensamento.
Perguntas frequentes
O Qwen3 Next Thinking é 8x mais inteligente que o Ministral 3 8B?
Não. O índice de inteligência da Artificial Analysis mostra 16,867 contra 8,974 — uma diferença de 1,88x. Os 8x aparecem no preço de saída por milhão de tokens, não na capacidade. Como o Qwen é raciocínio-first, ele consome mais tokens por tarefa, o que amplia o custo real por chamada.
Qual dos dois aceita imagem?
O Ministral 3 8B 2512 é multimodal text+image → text. O Qwen3 Next 80B A3B Thinking aceita apenas texto. Se o seu pipeline inclui OCR, descrição de imagem ou qualquer entrada visual, o Ministral é a única opção entre os dois.
Posso rodar o Ministral 3 8B localmente?
Sim. São 8 bilhões de parâmetros densos e open weights, o que cabe em uma GPU de consumo moderna com quantização. O Qwen3 Next é mixture-of-experts com 80B totais, mais exigente para self-host, especialmente se você quiser ativar todos os especialistas.