Qwen3 Next 80B e Mistral Large 3 2512: US$ 0,35 que separam a conta
Os dois têm 262K de contexto, IQ próximo de 16 e são open weights. Mas um cobra 82% a mais no blended — e cada um brilha num tipo de tarefa.
O duelo que o catálogo não destaca
Você não vai ver Qwen3 Next 80B A3B Thinking nem Mistral Large 3 2512 no topo do índice de inteligência. Em 7 de janeiro de 2026, com mais de 314 modelos no catálogo, os dois aparecem na faixa de IQ 16 — bem abaixo do Xiaomi MiMo-V2-Flash (34,024), do OpenAI o3 (31,096) e do Claude Haiku 4.5 (29,892). Mas quem paga a conta olha preço, não só ranking. E aí o jogo muda.
A diferença começa no input
Para a mesma janela de contexto — 262.144 tokens nos dois casos — o Qwen cobra US$ 0,15 por milhão de tokens de entrada. O Mistral, US$ 0,50. Em um job com 1 milhão de tokens de prompt, são US$ 0,35 de diferença só na leitura. Na saída, a diferença cai para US$ 0,30 (US$ 1,20 contra US$ 1,50).
Some a isso o blended, que é o indicador que mais se aproxima do que se paga num uso misto: 0,4125 para o Qwen, 0,75 para o Mistral. O modelo francês custa 82% a mais no agregado. Para um app de produção que roda milhares de chamadas por dia, isso é a diferença entre uma assinatura previsível e uma surpresa no fim do mês.
| Critério | Qwen3 Next 80B A3B Thinking | Mistral Large 3 2512 |
|---|---|---|
| Índice de inteligência | 16.9 | 15.9 |
| Entrada US$/M | 0.15 | 0.5 |
| Saída US$/M | 1.2 | 1.5 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 197 | 77 |
| Índice de código | 17.4 | 20.1 |
| Índice agêntico | 2.1 | 5.5 |
Quem entende de código, escolha o francês
O Mistral Large 3 2512 não é multimodal à toa: 675 bilhões de parâmetros totais, 41 bilhões ativos, mistura de especialistas mais densa. O modelo aceita texto, imagem e arquivo, e devolve texto. É o que coloca ele na frente em duas pontuações que importam em produção:
- Coding: 20,066 (contra 17,419 do Qwen)
- Agentic: 5,519 (contra 2,062)
A distância em agentic é grande. Se você está montando um agente que precisa seguir instruções em várias etapas e devolver resultado estruturado, o Mistral entrega quase 2,7 vezes mais. Em coding, são 15% a mais — folgado o bastante para fazer diferença num benchmark automatizado de PR review.
Outra coisa que o Qwen não publicou e o Mistral sim: preço de cache de US$ 0,05 por milhão de tokens. Se o seu sistema repete o mesmo system prompt em toda chamada, esse número é o que faz a conta fechar — é menos de 1/3 do input cheio do Qwen e 1/10 do input cheio do Mistral.
Quem pensa, escolha o chinês
Qwen3 Next 80B A3B Thinking é "reasoning-first" — o modelo devolve traces de pensamento por padrão. Foi treinado para isso, e a arquitetura entrega: 80 bilhões de parâmetros totais com apenas 3 bilhões ativos por inferência, mistura de especialistas enxuta. É sparse de verdade — a maior parte do modelo fica parada em cada chamada.
Em tarefas de raciocínio multi-passo, prova matemática, lógica pura e debug pesado, o Qwen entrega a resposta de forma estruturada onde o Mistral responde direto. Para um problema que precisa de cadeia explícita, esse trace é insumo para a próxima etapa, não lixo a descartar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
A velocidade também joga a favor do Qwen: 196,94 tokens por segundo contra 77,45 do Mistral. Em fluxos interativos ou agentes que devolvem texto em loop, isso é a diferença entre conversar e esperar.
O detalhe do conhecimento
Qwen declara knowledge cutoff em 30 de setembro de 2025. Mistral Large 3 2512 não publica essa data no catálogo. Para perguntas sobre eventos recentes, qualquer um dos dois pode desatualizar — mas o Qwen pelo menos diz até onde foi treinado. Isso ajuda a calibrar a expectativa antes de colocar o modelo em produção sobre um tema novo.
Quando cada um ganha
- Pegue o Qwen3 Next 80B A3B Thinking quando o job for raciocínio multi-passo, matemática, debug com cadeia de pensamento visível, ou quando latência e preço de entrada forem o gargalo. Pague US$ 0,15 de input e tenha resposta rápida com trace.
- Pegue o Mistral Large 3 2512 quando o job envolver código em pipeline, agente de várias etapas, entrada multimodal (imagem, arquivo) ou alto volume de prompt repetido onde o cache de US$ 0,05 faz a conta fechar.
Roteie por tarefa. Misturar os dois na mesma pilha sai mais barato que forçar um modelo único a fazer tudo — e entrega melhor nos dois extremos.
Roteie por tarefa na sua pilha: Qwen3 Next 80B para raciocínio e Mistral Large 3 2512 para código e multimodal — misturar os dois sai mais barato e mais competente que forçar um único modelo a cobrir as duas pontas.
Perguntas frequentes
Qual é mais barato, Qwen3 Next 80B ou Mistral Large 3 2512?
O Qwen3 Next 80B A3B Thinking. No agregado (blended), ele sai a US$ 0,4125 por milhão de tokens, contra US$ 0,75 do Mistral. A diferença pesa mais no input (US$ 0,15 contra US$ 0,50) do que no output (US$ 1,20 contra US$ 1,50).
Qual dos dois é melhor para programação e agentes?
O Mistral Large 3 2512, disparado. Coding dele é 20,066 (contra 17,419 do Qwen) e agentic é 5,519 (contra 2,062) — quase 2,7 vezes mais. Em pipelines de código e agentes de várias etapas, o francês leva vantagem clara.
Algum dos dois aceita imagem ou arquivo como entrada?
Só o Mistral Large 3 2512: a modalidade dele é texto+imagem+arquivo → texto. O Qwen3 Next 80B A3B Thinking é text→text puro e ainda traz traces de raciocínio por padrão.