FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B e Mistral Large 3 2512: US$ 0,35 que separam a conta

Os dois têm 262K de contexto, IQ próximo de 16 e são open weights. Mas um cobra 82% a mais no blended — e cada um brilha num tipo de tarefa.

Redação FalaVIP IA 3 min de leitura
US$ 0,35diferença no input por milhão de tokens
82%a mais no preço blended do Mistral
2,7×a vantagem do Mistral em agentic sobre o Qwen

O duelo que o catálogo não destaca

Você não vai ver Qwen3 Next 80B A3B Thinking nem Mistral Large 3 2512 no topo do índice de inteligência. Em 7 de janeiro de 2026, com mais de 314 modelos no catálogo, os dois aparecem na faixa de IQ 16 — bem abaixo do Xiaomi MiMo-V2-Flash (34,024), do OpenAI o3 (31,096) e do Claude Haiku 4.5 (29,892). Mas quem paga a conta olha preço, não só ranking. E aí o jogo muda.

Preço de saída (US$ por milhão de tokens)
Qwen3 Next 80B A3B Thinking1,2Mistral Large 3 25121,5US$/M
Fonte: OpenRouter

A diferença começa no input

Para a mesma janela de contexto — 262.144 tokens nos dois casos — o Qwen cobra US$ 0,15 por milhão de tokens de entrada. O Mistral, US$ 0,50. Em um job com 1 milhão de tokens de prompt, são US$ 0,35 de diferença só na leitura. Na saída, a diferença cai para US$ 0,30 (US$ 1,20 contra US$ 1,50).

Some a isso o blended, que é o indicador que mais se aproxima do que se paga num uso misto: 0,4125 para o Qwen, 0,75 para o Mistral. O modelo francês custa 82% a mais no agregado. Para um app de produção que roda milhares de chamadas por dia, isso é a diferença entre uma assinatura previsível e uma surpresa no fim do mês.

Qwen3 Next 80B A3B Thinking × Mistral Large 3 2512
CritérioQwen3 Next 80B A3B ThinkingMistral Large 3 2512
Índice de inteligência16.915.9
Entrada US$/M0.150.5
Saída US$/M1.21.5
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)19777
Índice de código17.420.1
Índice agêntico2.15.5

Quem entende de código, escolha o francês

O Mistral Large 3 2512 não é multimodal à toa: 675 bilhões de parâmetros totais, 41 bilhões ativos, mistura de especialistas mais densa. O modelo aceita texto, imagem e arquivo, e devolve texto. É o que coloca ele na frente em duas pontuações que importam em produção:

  • Coding: 20,066 (contra 17,419 do Qwen)
  • Agentic: 5,519 (contra 2,062)

A distância em agentic é grande. Se você está montando um agente que precisa seguir instruções em várias etapas e devolver resultado estruturado, o Mistral entrega quase 2,7 vezes mais. Em coding, são 15% a mais — folgado o bastante para fazer diferença num benchmark automatizado de PR review.

Outra coisa que o Qwen não publicou e o Mistral sim: preço de cache de US$ 0,05 por milhão de tokens. Se o seu sistema repete o mesmo system prompt em toda chamada, esse número é o que faz a conta fechar — é menos de 1/3 do input cheio do Qwen e 1/10 do input cheio do Mistral.

Quem pensa, escolha o chinês

Qwen3 Next 80B A3B Thinking é "reasoning-first" — o modelo devolve traces de pensamento por padrão. Foi treinado para isso, e a arquitetura entrega: 80 bilhões de parâmetros totais com apenas 3 bilhões ativos por inferência, mistura de especialistas enxuta. É sparse de verdade — a maior parte do modelo fica parada em cada chamada.

Em tarefas de raciocínio multi-passo, prova matemática, lógica pura e debug pesado, o Qwen entrega a resposta de forma estruturada onde o Mistral responde direto. Para um problema que precisa de cadeia explícita, esse trace é insumo para a próxima etapa, não lixo a descartar.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 314 modelos disponíveis no catálogo nesta data.

A velocidade também joga a favor do Qwen: 196,94 tokens por segundo contra 77,45 do Mistral. Em fluxos interativos ou agentes que devolvem texto em loop, isso é a diferença entre conversar e esperar.

O detalhe do conhecimento

Qwen declara knowledge cutoff em 30 de setembro de 2025. Mistral Large 3 2512 não publica essa data no catálogo. Para perguntas sobre eventos recentes, qualquer um dos dois pode desatualizar — mas o Qwen pelo menos diz até onde foi treinado. Isso ajuda a calibrar a expectativa antes de colocar o modelo em produção sobre um tema novo.

Quando cada um ganha

  • Pegue o Qwen3 Next 80B A3B Thinking quando o job for raciocínio multi-passo, matemática, debug com cadeia de pensamento visível, ou quando latência e preço de entrada forem o gargalo. Pague US$ 0,15 de input e tenha resposta rápida com trace.
  • Pegue o Mistral Large 3 2512 quando o job envolver código em pipeline, agente de várias etapas, entrada multimodal (imagem, arquivo) ou alto volume de prompt repetido onde o cache de US$ 0,05 faz a conta fechar.

Roteie por tarefa. Misturar os dois na mesma pilha sai mais barato que forçar um modelo único a fazer tudo — e entrega melhor nos dois extremos.

Em uma frase

Roteie por tarefa na sua pilha: Qwen3 Next 80B para raciocínio e Mistral Large 3 2512 para código e multimodal — misturar os dois sai mais barato e mais competente que forçar um único modelo a cobrir as duas pontas.

Perguntas frequentes

Qual é mais barato, Qwen3 Next 80B ou Mistral Large 3 2512?

O Qwen3 Next 80B A3B Thinking. No agregado (blended), ele sai a US$ 0,4125 por milhão de tokens, contra US$ 0,75 do Mistral. A diferença pesa mais no input (US$ 0,15 contra US$ 0,50) do que no output (US$ 1,20 contra US$ 1,50).

Qual dos dois é melhor para programação e agentes?

O Mistral Large 3 2512, disparado. Coding dele é 20,066 (contra 17,419 do Qwen) e agentic é 5,519 (contra 2,062) — quase 2,7 vezes mais. Em pipelines de código e agentes de várias etapas, o francês leva vantagem clara.

Algum dos dois aceita imagem ou arquivo como entrada?

Só o Mistral Large 3 2512: a modalidade dele é texto+imagem+arquivo → texto. O Qwen3 Next 80B A3B Thinking é text→text puro e ainda traz traces de raciocínio por padrão.

Leia também