Devstral 2 2512 cobra 67% a mais que o Qwen3 Next em saída
Os dois são modelos abertos disputando a faixa dos US$ 1 a US$ 2 por milhão de tokens de saída. Em código e agentic o francês ganha por larga margem — mas o chinês é 70% mais rápido e custa quase metade.
Você olha o preço e vê duas fichas parecidas. Um cobra US$ 2,00 por milhão de tokens de saída; o outro, US$ 1,20. Parece detalhe. Quando você coloca os dois lado a lado num prompt de programação, a diferença de 67% no preço some diante de outra diferença que ninguém colocou no cardápio.
Devstral 2 2512 e Qwen3 Next 80B A3B Thinking são os dois modelos abertos que disputam a faixa dos US$ 1 a US$ 2 por milhão de tokens de saída. Um é francês, denso, especialista em código. O outro é chinês, sparse, com pensamento explícito. No papel, concorrentes. Na prática, ferramentas para trabalhos diferentes.
Preço de tábua
A conta é simples. Para 1 milhão de tokens de entrada e 1 milhão de saída:
- Devstral 2 2512: US$ 0,40 + US$ 2,00 = US$ 2,40
- Qwen3 Next 80B Thinking: US$ 0,15 + US$ 1,20 = US$ 1,35
São 78% mais caro rodar o francês do que o chinês. Em escala — uma esteira CI que gasta 50 milhões de tokens por mês só em saída — são US$ 40 a mais por mês. Nada absurdo. Mas se o benchmark não acompanha, é dinheiro jogado fora. Vale notar que o Devstral publica preço de cache (US$ 0,04 por milhão), o que derruba custo quando você reutiliza contexto. O Qwen3 não publicou esse número no catálogo.
Código não é tudo, mas aqui decide
E aí vem o número que importa. Em coding, o Devstral marca 31,259. O Qwen3 Next marca 17,419. São 80% a mais para o francês. Em tarefas agentic — aquelas em que o modelo precisa orquestrar ferramentas e tomar decisões em cadeia — a vantagem explode: 10,642 contra 2,062. Cinco vezes mais.
| Critério | Devstral 2 2512 | Qwen3 Next 80B A3B Thinking |
|---|---|---|
| Índice de inteligência | 19.2 | 16.9 |
| Entrada US$/M | 0.4 | 0.15 |
| Saída US$/M | 2 | 1.2 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 117 | 197 |
| Índice de código | 31.3 | 17.4 |
| Índice agêntico | 10.6 | 2.1 |
Se o seu produto é um agente que mexe em repositório, abre PR, roda testes e itera, o Qwen3 não acompanha. Não por falta de inteligência geral: o IQ geral é parecido (19,242 contra 16,867), distância bem menor do que nos benchmarks específicos. É porque o Devstral foi treinado para isso. Foi lançado em 9 de dezembro de 2025, quatro dias atrás — não é um retrofit de modelo de chat reaproveitado.
Arquitetura muda o custo escondido
Devstral tem 125 bilhões de parâmetros, todos ativos a cada inferência. Qwen3 tem 80 bilhões no total, mas só 3 bilhões são ativados por token — uma MoE (mixture of experts) que deixa o modelo leve para rodar. Isso explica a velocidade medida: 196,94 tokens/s contra 117,08 do Devstral. Quase 70% mais rápido.
Pense assim: o Devstral é um cozinheiro que faz cada prato usando as duas mãos o tempo todo. O Qwen3 tem 80 sous-chefs na cozinha, mas só três entram em ação por pedido. Em horário de pico, o segundo atende muito mais mesas — e a conta do gás também.
Quem escolhe quem
Devstral 2 2512 vence quando:
- Você precisa de agente de código sério — editar múltiplos arquivos, rodar comandos, validar.
- A fila de trabalho é cara (tarefa longa, poucas chamadas) e o tempo de execução não é gargalo.
- Você quer pesos abertos para self-host com previsibilidade de latência.
Qwen3 Next 80B A3B Thinking vence quando:
- O problema exige raciocínio explícito — provas, síntese lógica, planejamento multi-etapa visível.
- Latência de resposta importa: atendimento, copilots em chat, alto volume.
- Orçamento é variável sensível e você roda dezenas de milhões de tokens por mês.
Nenhum dos dois muda nada para:
- Quem já está preso a um modelo proprietário com contratos anuais.
- Quem precisa de multimodal — os dois são só texto (Devstral aceita arquivo, mas não gera).
- Quem precisa de conhecimento depois de setembro de 2025 — o Qwen3 tem cutoff explícito em 30/09/2025; o Devstral não publicou.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
| Nova 2 Lite | 19.2 | 2.5 |
O catálogo desta data tem 304 modelos, 46 criadores, e os dois abertos disputam uma faixa que até três meses atrás era dominada por pesos fechados. O topo da tabela segue sendo o OpenAI o3, com IQ 31,096 — fora do alcance de qualquer um dos dois. Para o desenvolvedor que escolhe modelo amanhã de manhã, o teste é simples: rode o seu caso real em ambos, meça custo por tarefa concluída, e decida pelo numerador que importa para a sua esteira.
Para agente de código sério, paga-se o Devstral 2 2512; para raciocínio explícito e alto volume com latência apertada, o Qwen3 Next 80B Thinking sai mais barato, mais rápido e ainda mostra o passo a passo.
Perguntas frequentes
Devstral 2 2512 ou Qwen3 Next: qual é melhor para agente de código?
Para agente de código sério — editar múltiplos arquivos, abrir PR, validar — o Devstral 2 2512 ganha por larga margem: 31,259 em coding contra 17,419 do Qwen3. Em agentic a diferença é ainda maior: 10,642 contra 2,062. O Qwen3 Next é um modelo de raciocínio genérico, não especializado em engenharia de software.
Quanto custa rodar cada modelo por milhão de tokens?
Devstral 2 2512 cobra US$ 2,00 por milhão de tokens de saída e US$ 0,40 de entrada. Qwen3 Next 80B A3B Thinking cobra US$ 1,20 de saída e US$ 0,15 de entrada. Para 1M de entrada + 1M de saída, são US$ 2,40 contra US$ 1,35 — 78% mais caro rodar o francês. O Devstral ainda publica preço de cache a US$ 0,04 por milhão; o Qwen3 não publicou esse valor.
O que é MoE no Qwen3 Next 80B A3B Thinking?
MoE é mixture-of-experts: o modelo tem 80 bilhões de parâmetros no total, mas só 3 bilhões são ativados por token. Isso deixa a inferência mais barata e rápida — por isso os 196,94 tokens/s do Qwen3 contra 117,08 do Devstral, que é denso de 125B com todos os parâmetros ativos a cada chamada.