FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Mistral Large 3 2512 cobra 5 vezes mais caro que o Qwen3 Next 80B A3B

Comparativo entre dois modelos abertos com MoE esparsa, mesma janela de contexto e preços em patamares opostos

Redação FalaVIP IA 3 min de leitura
US$ 1,50por milhão de tokens de saída no Mistral Large 3 2512
US$ 1,10por milhão de tokens de saída no Qwen3 Next 80B A3B
15,9 vs 13,8índice de inteligência Artificial Analysis

A diferença está no recibo, não no placar

Você está olhando dois modelos com a mesma proposta de papel: abertos, com mistura esparsa de especialistas, janela de 262 mil tokens, sem etapa de raciocínio dedicada. O Mistral Large 3 2512 e o Qwen3 Next 80B A3B Instruct são candidatos óbvios para a mesma vaga no seu pipeline. O que separa um do outro, em janeiro de 2026, é quem paga a conta no fim do mês.

Índice de inteligência (Artificial Analysis)
Mistral Large 3 251215,9Qwen3 Next 80B A3B Instruct13,8índice
Fonte: Artificial Analysis

Pelo índice de inteligência da Artificial Analysis medido hoje, o Mistral Large 3 2512 marca 15,9 e o Qwen3 Next 80B A3B marca 13,8. Diferença real, mas não abissal — pouco mais de dois pontos numa escala em que o topo do catálogo passa de 34 com o Xiaomi MiMo-V2-Flash e o segundo colocado, OpenAI o3, está em 31. Os dois modelos que você está comparando vivem no meio do pacote, e nenhum dos dois disputa a ponta.

O preço de saída conta uma história diferente

Preço de saída (US$ por milhão de tokens)
Mistral Large 3 25121,5Qwen3 Next 80B A3B Instruct1,1US$/M
Fonte: OpenRouter

Aqui a conversa muda. O Mistral cobra US$ 0,50 por milhão de tokens de entrada e US$ 1,50 por milhão na saída. O Qwen3 Next 80B A3B cobra US$ 0,10 na entrada e US$ 1,10 na saída. Na ponta mais cara, a diferença é de US$ 0,40 por milhão — parece pouco até você multiplicar pelo volume real de um produto em produção. Em cache, o Mistral fica em US$ 0,05 e o Qwen em US$ 0,07, único item em que o francês não é mais barato.

Traduzindo o marketing: quando a Mistral diz que o Large 3 2512 é o modelo mais capaz da casa, ela está certa dentro do catálogo dela. Quando você compara com um modelo aberto chinês de preço agressivo, a conta precisa entrar na equação antes do placar de benchmark.

O que cada um entrega de verdade

O Mistral Large 3 2512 é uma MoE esparsa com 675 bilhões de parâmetros totais e 41 bilhões ativos, multimodal (texto, imagem e arquivo como entrada), sob Apache 2.0, lançado em 1º de dezembro de 2025. Em coding, marca 20,1 — o melhor entre os dois. Em agentic, 5,5. Velocidade: 77 tokens por segundo. O Qwen3 Next 80B A3B Instruct, lançado em 11 de setembro de 2025, é menor em tudo: 80 bilhões totais, 3 bilhões ativos, só texto. Em contrapartida, dispara em velocidade: 173 tokens por segundo, mais que o dobro do francês. As notas de coding e agentic do Qwen3 Next 80B A3B Instruct não foram publicadas pelo catálogo nesta data.

Pense na MoE como um restaurante com cardápio enorme mas só alguns cozinheiros na cozinha por pedido. O Mistral tem 41 bilhões de “cozinheiros” ativos; o Qwen, 3 bilhões. Por isso o francês responde com mais cuidado em tarefas densas, e o chinês responde com mais pressa.

Mistral Large 3 2512 × Qwen3 Next 80B A3B Instruct
CritérioMistral Large 3 2512Qwen3 Next 80B A3B Instruct
Índice de inteligência15.913.8
Entrada US$/M0.50.1
Saída US$/M1.51.1
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)77173
Índice de código20.1
Índice agêntico5.5

Onde cada um ganha

O Mistral Large 3 2512 ganha quando a tarefa exige leitura multimodal — imagem e arquivo entram no mesmo contexto — e quando coding é o gargalo. Para times que já rodam fluxos com PDF, print de tela e código no mesmo prompt, é a escolha coerente. Também é a escolha para quem precisa de um modelo francês sob licença Apache 2.0 sem amarras geopolíticas no código.

O Qwen3 Next 80B A3B Instruct ganha quando o gargalo é volume de tokens de entrada. Em workloads de RAG, sumarização em massa, classificação de tickets e qualquer cenário em que o custo de entrada domina a fatura, pagar US$ 0,10 por milhão em vez de US$ 0,50 muda a economia do produto. A velocidade de 173 tokens por segundo também ajuda em UX de chat onde latência de primeiro token pesa.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 315 modelos disponíveis no catálogo nesta data.

Implicação prática

Se você está rodando os dois via API e o tráfego é predominantemente de entrada, troque o Mistral pelo Qwen e meça coding em produção antes de bater o martelo — a economia pode passar de três vezes sem perder qualidade aceitável. Se a multimodalidade é requisito e coding é o gargalo, fique com o Mistral e aceite pagar o premium.

Em uma frase

Para tráfego de entrada massivo, Qwen3 Next 80B A3B Instruct entrega economia imediata; para multimodalidade e coding, Mistral Large 3 2512 vale o preço maior.

Perguntas frequentes

Qual é mais barato, Mistral Large 3 2512 ou Qwen3 Next 80B A3B Instruct?

O Qwen3 Next 80B A3B Instruct é mais barato na entrada (US$ 0,10 vs US$ 0,50 por milhão) e também na saída (US$ 1,10 vs US$ 1,50 por milhão). A única exceção é o cache, onde o Mistral cobra US$ 0,05 contra US$ 0,07 do Qwen.

Qual tem melhor nota de inteligência?

O Mistral Large 3 2512, com 15,9 contra 13,8 do Qwen3 Next 80B A3B Instruct no índice da Artificial Analysis medido em janeiro de 2026. Os dois ficam distantes do topo do catálogo, ocupado pelo Xiaomi MiMo-V2-Flash (34,0).

Posso rodar os dois localmente?

Sim, os dois são open weights. O Mistral Large 3 2512 tem 675B parâmetros totais (41B ativos) sob Apache 2.0; o Qwen3 Next 80B A3B Instruct tem 80B totais (3B ativos). Em hardware modesto, o Qwen é claramente mais viável por exigir bem menos memória ativa por inferência.

Leia também