FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B Thinking custa 6× mais caro na saída que o Ministral 3 14B

Comparativo frente a frente entre dois modelos chineses e franceses de pesos abertos, e o que essa diferença de preço significa na fatura do final do mês.

Redação FalaVIP IA 3 min de leitura
US$ 1,20por milhão de tokens de saída no Qwen3 Next 80B Thinking
US$ 0,20por milhão de tokens de saída no Ministral 3 14B 2512
16,87 vs 11,24índice de inteligência (Artificial Analysis)

O preço de saída é onde a conta explode

Quando você compara dois modelos, a primeira coisa que olha é o número de cabeça: o Qwen3 Next 80B A3B Thinking tem índice de inteligência 16,87 e o Ministral 3 14B 2512 tem 11,24. Parece uma vitória clara do chinês. Mas quem paga a fatura sabe: o que decide o mês é o preço de saída, não o placar do benchmark.

E aí a história muda de figura. O Qwen3 cobra US$ 1,20 por milhão de tokens de saída. O Ministral 3 14B cobra US$ 0,20. São seis vezes mais caro por cada milhão de tokens que o modelo cospe para o usuário — e em tarefas de raciocínio, o Qwen gera muito mais tokens por resposta, porque pensa em voz alta antes de responder.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Thinking1,2Ministral 3 14B 25120,2US$/M
Fonte: OpenRouter

O que cada um traz de diferente

O Qwen3 Next 80B é um modelo de raciocínio: por padrão, ele devolve um bloco de "thinking" antes da resposta final, com passos intermediários. Foi lançado em 11 de setembro de 2025, tem 80 bilhões de parâmetros totais mas só 3 bilhões ativos por token (arquitetura mixture-of-experts), e aceita 262 mil tokens de contexto. É chinês, da Qwen, e tem pesos abertos.

O Ministral 3 14B 2512 é o maior da família Ministral 3, lançado em 2 de dezembro de 2025 pela Mistral, da França. Não é modelo de raciocínio — responde direto. Tem 14 bilhões de parâmetros, todos ativos, e o mesmo contexto de 262 mil tokens. Também tem pesos abertos. E aceita imagem como entrada, coisa que o Qwen desta comparação não faz.

Em velocidade, o Qwen entrega 196,94 tokens por segundo contra 107,47 do Ministral. Em coding, 17,42 contra 14,36. Em agentic, quase empate: 2,06 contra 2,20.

Qwen3 Next 80B A3B Thinking × Ministral 3 14B 2512
CritérioQwen3 Next 80B A3B ThinkingMinistral 3 14B 2512
Índice de inteligência16.911.2
Entrada US$/M0.150.2
Saída US$/M1.20.2
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)197107
Índice de código17.414.4
Índice agêntico2.12.2

Onde cada um ganha

O Qwen3 Next 80B Thinking ganha quando o problema é difícil e o tempo de pensar compensa. Prova de matemática, debug de código cabeludo, lógica multi-passo, agente que precisa planejar antes de agir. O bloco de raciocínio existe justamente para isso: quanto mais passos o problema exige, mais o thinking ajuda, e mais o Qwen se distancia do Ministral no índice de inteligência. A diferença de 5,6 pontos no IQ não é aceno de marketing — é a tradução numérica de "pensa mais antes de responder".

O Ministral 3 14B 2512 ganha quando o volume é grande e a tarefa é direta. Chat de atendimento, classificação, resumo, extração de informação, qualquer coisa em que o modelo não precisa raciocinar — só precisa responder rápido e barato. O US$ 0,20 por milhão de saída é o mesmo preço de entrada, o que é raro: significa que gerar texto custa o mesmo que consumir texto. Some a isso o suporte a imagem e você tem um canivete suíço para pipelines de produção que não podem estourar o orçamento.

Índice de inteligência (Artificial Analysis)
Qwen3 Next 80B A3B Thinking16,9Ministral 3 14B 251211,2índice
Fonte: Artificial Analysis

E o tabuleiro maior?

Para situar os dois: o topo do índice de inteligência nesta data tem Xiaomi MiMo-V2-Flash em 34,02, OpenAI o3 em 31,10 e Claude Haiku 4.5 em 29,89. Os dois modelos deste comparativo estão bem abaixo disso — o Qwen em 16,87, o Ministral em 11,24. Isso não é demérito: são modelos de pesos abertos, menores, otimizados para outro tipo de problema. O catálogo tem 314 modelos listados hoje, vindos de 48 criadores diferentes. Em outras palavras, você não está escolhendo entre o melhor do mundo e o segundo melhor — está escolhendo entre duas ferramentas de propósito específico que custam uma fração do que os líderes cobram.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 314 modelos disponíveis no catálogo nesta data.

O que fazer com isso na prática

Se você está rodando um agente que planeja, depura código ou resolve problemas de lógica, e o orçamento permite, o Qwen3 Next 80B Thinking entrega o trabalho — mas meça o custo por chamada antes de colocar em produção, porque o thinking inflada o token de saída. Se você está processando alto volume de texto ou imagem com tarefas de complexidade média, o Ministral 3 14B 2512 cobre 90% do que você precisa por um sexto do preço. E se a tarefa é multimodal, o Ministral é o único dos dois que aceita imagem.

Em uma frase

Use o Qwen3 Next 80B Thinking quando o problema exige raciocínio multi-passo e o orçamento aguenta a conta de saída; use o Ministral 3 14B 2512 quando volume e multimodalidade pesam mais que o índice de inteligência.

Perguntas frequentes

Qwen3 Next 80B Thinking ou Ministral 3 14B para um agente de código?

Para agente de código que precisa planejar antes de agir, o Qwen3 Next 80B Thinking tem índice de coding 17,42 contra 14,36 do Ministral e é modelo de raciocínio. A conta de saída, porém, é seis vezes maior — meça o custo por execução antes de colocar em produção.

Qual dos dois aceita imagem?

O Ministral 3 14B 2512 é multimodal e aceita entrada de texto e imagem. O Qwen3 Next 80B A3B Thinking desta comparação é apenas texto para texto.

Os dois modelos têm pesos abertos?

Sim. Tanto o Qwen3 Next 80B A3B Thinking quanto o Ministral 3 14B 2512 são distribuídos com pesos abertos, o que permite rodar localmente ou em infraestrutura própria, além de usar via API.

Leia também