FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Devstral 2 2512 cobra 67% a mais que o Qwen3 Next em saída

Os dois são modelos abertos disputando a faixa dos US$ 1 a US$ 2 por milhão de tokens de saída. Em código e agentic o francês ganha por larga margem — mas o chinês é 70% mais rápido e custa quase metade.

Redação FalaVIP IA 3 min de leitura
67%preço a mais por milhão de tokens de saída do Devstral vs Qwen3
31.259score de coding do Devstral 2 2512
196,94tokens por segundo do Qwen3 Next 80B Thinking

Você olha o preço e vê duas fichas parecidas. Um cobra US$ 2,00 por milhão de tokens de saída; o outro, US$ 1,20. Parece detalhe. Quando você coloca os dois lado a lado num prompt de programação, a diferença de 67% no preço some diante de outra diferença que ninguém colocou no cardápio.

Devstral 2 2512 e Qwen3 Next 80B A3B Thinking são os dois modelos abertos que disputam a faixa dos US$ 1 a US$ 2 por milhão de tokens de saída. Um é francês, denso, especialista em código. O outro é chinês, sparse, com pensamento explícito. No papel, concorrentes. Na prática, ferramentas para trabalhos diferentes.

Índice de inteligência (Artificial Analysis)
Devstral 2 251219,2Qwen3 Next 80B A3B Thinking16,9índice
Fonte: Artificial Analysis

Preço de tábua

A conta é simples. Para 1 milhão de tokens de entrada e 1 milhão de saída:

  • Devstral 2 2512: US$ 0,40 + US$ 2,00 = US$ 2,40
  • Qwen3 Next 80B Thinking: US$ 0,15 + US$ 1,20 = US$ 1,35

São 78% mais caro rodar o francês do que o chinês. Em escala — uma esteira CI que gasta 50 milhões de tokens por mês só em saída — são US$ 40 a mais por mês. Nada absurdo. Mas se o benchmark não acompanha, é dinheiro jogado fora. Vale notar que o Devstral publica preço de cache (US$ 0,04 por milhão), o que derruba custo quando você reutiliza contexto. O Qwen3 não publicou esse número no catálogo.

Preço de saída (US$ por milhão de tokens)
Devstral 2 25122Qwen3 Next 80B A3B Thinking1,2US$/M
Fonte: OpenRouter

Código não é tudo, mas aqui decide

E aí vem o número que importa. Em coding, o Devstral marca 31,259. O Qwen3 Next marca 17,419. São 80% a mais para o francês. Em tarefas agentic — aquelas em que o modelo precisa orquestrar ferramentas e tomar decisões em cadeia — a vantagem explode: 10,642 contra 2,062. Cinco vezes mais.

Devstral 2 2512 × Qwen3 Next 80B A3B Thinking
CritérioDevstral 2 2512Qwen3 Next 80B A3B Thinking
Índice de inteligência19.216.9
Entrada US$/M0.40.15
Saída US$/M21.2
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)117197
Índice de código31.317.4
Índice agêntico10.62.1

Se o seu produto é um agente que mexe em repositório, abre PR, roda testes e itera, o Qwen3 não acompanha. Não por falta de inteligência geral: o IQ geral é parecido (19,242 contra 16,867), distância bem menor do que nos benchmarks específicos. É porque o Devstral foi treinado para isso. Foi lançado em 9 de dezembro de 2025, quatro dias atrás — não é um retrofit de modelo de chat reaproveitado.

Arquitetura muda o custo escondido

Devstral tem 125 bilhões de parâmetros, todos ativos a cada inferência. Qwen3 tem 80 bilhões no total, mas só 3 bilhões são ativados por token — uma MoE (mixture of experts) que deixa o modelo leve para rodar. Isso explica a velocidade medida: 196,94 tokens/s contra 117,08 do Devstral. Quase 70% mais rápido.

Pense assim: o Devstral é um cozinheiro que faz cada prato usando as duas mãos o tempo todo. O Qwen3 tem 80 sous-chefs na cozinha, mas só três entram em ação por pedido. Em horário de pico, o segundo atende muito mais mesas — e a conta do gás também.

Quem escolhe quem

Devstral 2 2512 vence quando:

  • Você precisa de agente de código sério — editar múltiplos arquivos, rodar comandos, validar.
  • A fila de trabalho é cara (tarefa longa, poucas chamadas) e o tempo de execução não é gargalo.
  • Você quer pesos abertos para self-host com previsibilidade de latência.

Qwen3 Next 80B A3B Thinking vence quando:

  • O problema exige raciocínio explícito — provas, síntese lógica, planejamento multi-etapa visível.
  • Latência de resposta importa: atendimento, copilots em chat, alto volume.
  • Orçamento é variável sensível e você roda dezenas de milhões de tokens por mês.

Nenhum dos dois muda nada para:

  • Quem já está preso a um modelo proprietário com contratos anuais.
  • Quem precisa de multimodal — os dois são só texto (Devstral aceita arquivo, mas não gera).
  • Quem precisa de conhecimento depois de setembro de 2025 — o Qwen3 tem cutoff explícito em 30/09/2025; o Devstral não publicou.
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Nova 2 Lite19.22.5
Entre os 304 modelos disponíveis no catálogo nesta data.

O catálogo desta data tem 304 modelos, 46 criadores, e os dois abertos disputam uma faixa que até três meses atrás era dominada por pesos fechados. O topo da tabela segue sendo o OpenAI o3, com IQ 31,096 — fora do alcance de qualquer um dos dois. Para o desenvolvedor que escolhe modelo amanhã de manhã, o teste é simples: rode o seu caso real em ambos, meça custo por tarefa concluída, e decida pelo numerador que importa para a sua esteira.

Em uma frase

Para agente de código sério, paga-se o Devstral 2 2512; para raciocínio explícito e alto volume com latência apertada, o Qwen3 Next 80B Thinking sai mais barato, mais rápido e ainda mostra o passo a passo.

Perguntas frequentes

Devstral 2 2512 ou Qwen3 Next: qual é melhor para agente de código?

Para agente de código sério — editar múltiplos arquivos, abrir PR, validar — o Devstral 2 2512 ganha por larga margem: 31,259 em coding contra 17,419 do Qwen3. Em agentic a diferença é ainda maior: 10,642 contra 2,062. O Qwen3 Next é um modelo de raciocínio genérico, não especializado em engenharia de software.

Quanto custa rodar cada modelo por milhão de tokens?

Devstral 2 2512 cobra US$ 2,00 por milhão de tokens de saída e US$ 0,40 de entrada. Qwen3 Next 80B A3B Thinking cobra US$ 1,20 de saída e US$ 0,15 de entrada. Para 1M de entrada + 1M de saída, são US$ 2,40 contra US$ 1,35 — 78% mais caro rodar o francês. O Devstral ainda publica preço de cache a US$ 0,04 por milhão; o Qwen3 não publicou esse valor.

O que é MoE no Qwen3 Next 80B A3B Thinking?

MoE é mixture-of-experts: o modelo tem 80 bilhões de parâmetros no total, mas só 3 bilhões são ativados por token. Isso deixa a inferência mais barata e rápida — por isso os 196,94 tokens/s do Qwen3 contra 117,08 do Devstral, que é denso de 125B com todos os parâmetros ativos a cada chamada.

Leia também