Mistral Large 3 2512 cobra 5 vezes mais caro que o Qwen3 Next 80B A3B
Comparativo entre dois modelos abertos com MoE esparsa, mesma janela de contexto e preços em patamares opostos
A diferença está no recibo, não no placar
Você está olhando dois modelos com a mesma proposta de papel: abertos, com mistura esparsa de especialistas, janela de 262 mil tokens, sem etapa de raciocínio dedicada. O Mistral Large 3 2512 e o Qwen3 Next 80B A3B Instruct são candidatos óbvios para a mesma vaga no seu pipeline. O que separa um do outro, em janeiro de 2026, é quem paga a conta no fim do mês.
Pelo índice de inteligência da Artificial Analysis medido hoje, o Mistral Large 3 2512 marca 15,9 e o Qwen3 Next 80B A3B marca 13,8. Diferença real, mas não abissal — pouco mais de dois pontos numa escala em que o topo do catálogo passa de 34 com o Xiaomi MiMo-V2-Flash e o segundo colocado, OpenAI o3, está em 31. Os dois modelos que você está comparando vivem no meio do pacote, e nenhum dos dois disputa a ponta.
O preço de saída conta uma história diferente
Aqui a conversa muda. O Mistral cobra US$ 0,50 por milhão de tokens de entrada e US$ 1,50 por milhão na saída. O Qwen3 Next 80B A3B cobra US$ 0,10 na entrada e US$ 1,10 na saída. Na ponta mais cara, a diferença é de US$ 0,40 por milhão — parece pouco até você multiplicar pelo volume real de um produto em produção. Em cache, o Mistral fica em US$ 0,05 e o Qwen em US$ 0,07, único item em que o francês não é mais barato.
Traduzindo o marketing: quando a Mistral diz que o Large 3 2512 é o modelo mais capaz da casa, ela está certa dentro do catálogo dela. Quando você compara com um modelo aberto chinês de preço agressivo, a conta precisa entrar na equação antes do placar de benchmark.
O que cada um entrega de verdade
O Mistral Large 3 2512 é uma MoE esparsa com 675 bilhões de parâmetros totais e 41 bilhões ativos, multimodal (texto, imagem e arquivo como entrada), sob Apache 2.0, lançado em 1º de dezembro de 2025. Em coding, marca 20,1 — o melhor entre os dois. Em agentic, 5,5. Velocidade: 77 tokens por segundo. O Qwen3 Next 80B A3B Instruct, lançado em 11 de setembro de 2025, é menor em tudo: 80 bilhões totais, 3 bilhões ativos, só texto. Em contrapartida, dispara em velocidade: 173 tokens por segundo, mais que o dobro do francês. As notas de coding e agentic do Qwen3 Next 80B A3B Instruct não foram publicadas pelo catálogo nesta data.
Pense na MoE como um restaurante com cardápio enorme mas só alguns cozinheiros na cozinha por pedido. O Mistral tem 41 bilhões de “cozinheiros” ativos; o Qwen, 3 bilhões. Por isso o francês responde com mais cuidado em tarefas densas, e o chinês responde com mais pressa.
| Critério | Mistral Large 3 2512 | Qwen3 Next 80B A3B Instruct |
|---|---|---|
| Índice de inteligência | 15.9 | 13.8 |
| Entrada US$/M | 0.5 | 0.1 |
| Saída US$/M | 1.5 | 1.1 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 77 | 173 |
| Índice de código | 20.1 | — |
| Índice agêntico | 5.5 | — |
Onde cada um ganha
O Mistral Large 3 2512 ganha quando a tarefa exige leitura multimodal — imagem e arquivo entram no mesmo contexto — e quando coding é o gargalo. Para times que já rodam fluxos com PDF, print de tela e código no mesmo prompt, é a escolha coerente. Também é a escolha para quem precisa de um modelo francês sob licença Apache 2.0 sem amarras geopolíticas no código.
O Qwen3 Next 80B A3B Instruct ganha quando o gargalo é volume de tokens de entrada. Em workloads de RAG, sumarização em massa, classificação de tickets e qualquer cenário em que o custo de entrada domina a fatura, pagar US$ 0,10 por milhão em vez de US$ 0,50 muda a economia do produto. A velocidade de 173 tokens por segundo também ajuda em UX de chat onde latência de primeiro token pesa.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Implicação prática
Se você está rodando os dois via API e o tráfego é predominantemente de entrada, troque o Mistral pelo Qwen e meça coding em produção antes de bater o martelo — a economia pode passar de três vezes sem perder qualidade aceitável. Se a multimodalidade é requisito e coding é o gargalo, fique com o Mistral e aceite pagar o premium.
Para tráfego de entrada massivo, Qwen3 Next 80B A3B Instruct entrega economia imediata; para multimodalidade e coding, Mistral Large 3 2512 vale o preço maior.
Perguntas frequentes
Qual é mais barato, Mistral Large 3 2512 ou Qwen3 Next 80B A3B Instruct?
O Qwen3 Next 80B A3B Instruct é mais barato na entrada (US$ 0,10 vs US$ 0,50 por milhão) e também na saída (US$ 1,10 vs US$ 1,50 por milhão). A única exceção é o cache, onde o Mistral cobra US$ 0,05 contra US$ 0,07 do Qwen.
Qual tem melhor nota de inteligência?
O Mistral Large 3 2512, com 15,9 contra 13,8 do Qwen3 Next 80B A3B Instruct no índice da Artificial Analysis medido em janeiro de 2026. Os dois ficam distantes do topo do catálogo, ocupado pelo Xiaomi MiMo-V2-Flash (34,0).
Posso rodar os dois localmente?
Sim, os dois são open weights. O Mistral Large 3 2512 tem 675B parâmetros totais (41B ativos) sob Apache 2.0; o Qwen3 Next 80B A3B Instruct tem 80B totais (3B ativos). Em hardware modesto, o Qwen é claramente mais viável por exigir bem menos memória ativa por inferência.