FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Devstral 2 custa 12 vezes mais caro que o gpt-oss-120b e quase empata em código

Mistral lança modelo focado em agentic coding com 123B parâmetros abertos, mas cobra US$ 2 por milhão de tokens de saída enquanto a OpenAI cobra US$ 0,17.

Redação FalaVIP IA 3 min de leitura
US$ 2por milhão de tokens de saída no Devstral 2
US$ 0,17por milhão de tokens de saída no gpt-oss-120b
31,26índice de coding do Devstral 2 vs 30,44 do gpt-oss-120b

A conta de API não mente. A Mistral colocou o Devstral 2 2512 no mercado hoje cobrando US$ 2 por milhão de tokens de saída — quase 12 vezes o que a OpenAI cobra pelo gpt-oss-120b, que entrega um índice de coding de 30,44 contra 31,26 do francês. Em outras palavras: você paga um premium enorme por uma vantagem que cabe na margem de erro.

O que a Mistral está vendendo

O Devstral 2 é um transformer denso de 123B parâmetros, com pesos abertos e janela de 256K tokens. A proposta oficial é agentic coding: deixar o modelo sair explorando repositórios, lendo arquivos e propondo mudanças em cadeia. O índice agentic, porém, conta uma história menos generosa: 10,64, contra 13,43 do gpt-oss-120b. Em coding puro, onde o Devstral 2 deveria brilhar, a diferença para o rival americano é de menos de um ponto.

Índice de inteligência (Artificial Analysis)
Devstral 2 251219,2gpt-oss-20b15,2gpt-oss-120b24,1Llama 4 Maverick14,5Qwen3 Next 80B A3B Instruct13,8índice
Fonte: Artificial Analysis

A conta que ninguém quer fazer

O preço de entrada é US$ 0,40 por milhão de tokens, e o cache sai por US$ 0,04 — números até razoáveis. O problema mora na saída. Quem usa modelo de código em produção sabe que a maior parte do custo vem do que o modelo escreve de volta: patches, diffs, comandos de ferramenta. Em volume, US$ 2 por milhão pesa.

Para dimensionar: o Llama 4 Maverick, multimodal e com 1M de contexto, cobra US$ 0,696 de saída. O Qwen3 Next 80B A3B Instruct, chinês e também focado em velocidade, cobra US$ 1,10. O Devstral 2 é o mais caro da turma de pesos abertos listada hoje.

Preço de saída (US$ por milhão de tokens)
Devstral 2 25122gpt-oss-20b0,13gpt-oss-120b0,17Llama 4 Maverick0,696Qwen3 Next 80B A3B Instruct1,1US$/M
Fonte: OpenRouter
Inteligência × preço de saída
Devstral 2 2512gpt-oss-20bgpt-oss-120bLlama 4 MaverickQwen3 Next 80B A3B InstructUS$ por milhão (saída, escala log)índice de inteligência

Comparação com quem já estava no jogo

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Devstral 2 2512 (o novo)19.20.42262k
gpt-oss-20b15.20.030.13131k
gpt-oss-120b24.10.0370.17131k
Llama 4 Maverick14.50.20.6961.05M
Qwen3 Next 80B A3B Instruct13.80.11.1262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Olhando para os pares diretos, o Devstral 2 só ganha do gpt-oss-120b em coding — e por pouco. Em agentic, perde. Em velocidade, fica devendo: 117 tokens por segundo contra 155 do rival. O Qwen3 Next entrega 173 e custa quase a metade. O Llama 4 Maverick, multimodal, custa um terço.

Ficha técnica — Devstral 2 2512
CampoValor
Identificadormistralai/devstral-2512
Criadormistralai
Preço de entradaUS$ 0.400 / M tokens
Preço de saídaUS$ 2.00 / M tokens
Janela de contexto262k
Modalidadetext+file->text
Leitura de cacheUS$ 0.040 / M (90% de desconto)
Índice de inteligência (AA)19.2
Índice de código31.3
Índice agêntico10.6
Parâmetros125B (125B ativos por token)
Pesosabertos
Velocidade de saída117 tokens/s

Para quem vale a pena

Se você precisa de pesos abertos por exigência contratual ou regulatória e quer o melhor índice de coding entre modelos europeus, o Devstral 2 entra na lista. A Mistral é francesa, e isso importa para empresas sob jurisdição da UE que preferem não depender de modelos americanos ou chineses.

Se o seu critério for puramente custo-benefício em agentic coding, o gpt-oss-120b continua sendo a referência entre os abertos: custa uma fração, é mais rápido e tem agentic maior.

Para quem NÃO muda nada

Se você já roda gpt-oss-120b em produção, não há motivo para trocar. A diferença de coding está dentro do ruído. Se você usa Claude Haiku 4.5 ou o3 para tarefas de raciocínio mais pesado, o Devstral 2 nem entra na conversa — o índice de inteligência geral dele é 19,24, contra 29,89 do Haiku e 31,10 do o3.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Nova 2 Lite19.22.5
Entre os 299 modelos disponíveis no catálogo nesta data.

A escolha real é entre pagar caro por um modelo de coding marginalmente superior e ficar com o gpt-oss-120b, que entrega 97% do resultado por 8,5% do preço de saída. Para a maioria das equipes, essa conta fecha no rival americano.

O que fazer agora

Se você está avaliando o Devstral 2 hoje, rode um benchmark interno de coding com seu próprio repositório antes de assinar qualquer contrato. Se a diferença real ficar abaixo de 5%, mantenha o gpt-oss-120b e use o dinheiro que sobra para subir o volume de cache hits. Se a diferença for maior e você precisar de pesos abertos europeus, o Devstral 2 justifica o preço — mas só nesse caso.

Em uma frase

Só vale pagar US$ 2/M de saída no Devstral 2 se você precisa de pesos abertos europeus e o benchmark interno confirmar ganho real de coding acima de 5% sobre o gpt-oss-120b.

Perguntas frequentes

Devstral 2 é melhor que gpt-oss-120b para coding?

Marginalmente: 31,26 contra 30,44 no índice de coding. A diferença está dentro da margem de erro da maioria dos benchmarks internos. Em agentic, o gpt-oss-120b ganha por 13,43 contra 10,64.

Quanto custa o Devstral 2 2512 por milhão de tokens?

US$ 0,40 de entrada, US$ 2 de saída e US$ 0,04 com cache. O preço de saída é o mais caro entre os modelos de pesos abertos listados no catálogo hoje.

Devstral 2 serve para tarefas que não sejam código?

Não é o foco. O índice de inteligência geral é 19,24, abaixo do Claude Haiku 4.5 (29,89) e do o3 (31,10). Para raciocínio geral, há opções melhores e mais baratas.

Leia também