Devstral 2 custa 12 vezes mais caro que o gpt-oss-120b e quase empata em código
Mistral lança modelo focado em agentic coding com 123B parâmetros abertos, mas cobra US$ 2 por milhão de tokens de saída enquanto a OpenAI cobra US$ 0,17.
A conta de API não mente. A Mistral colocou o Devstral 2 2512 no mercado hoje cobrando US$ 2 por milhão de tokens de saída — quase 12 vezes o que a OpenAI cobra pelo gpt-oss-120b, que entrega um índice de coding de 30,44 contra 31,26 do francês. Em outras palavras: você paga um premium enorme por uma vantagem que cabe na margem de erro.
O que a Mistral está vendendo
O Devstral 2 é um transformer denso de 123B parâmetros, com pesos abertos e janela de 256K tokens. A proposta oficial é agentic coding: deixar o modelo sair explorando repositórios, lendo arquivos e propondo mudanças em cadeia. O índice agentic, porém, conta uma história menos generosa: 10,64, contra 13,43 do gpt-oss-120b. Em coding puro, onde o Devstral 2 deveria brilhar, a diferença para o rival americano é de menos de um ponto.
A conta que ninguém quer fazer
O preço de entrada é US$ 0,40 por milhão de tokens, e o cache sai por US$ 0,04 — números até razoáveis. O problema mora na saída. Quem usa modelo de código em produção sabe que a maior parte do custo vem do que o modelo escreve de volta: patches, diffs, comandos de ferramenta. Em volume, US$ 2 por milhão pesa.
Para dimensionar: o Llama 4 Maverick, multimodal e com 1M de contexto, cobra US$ 0,696 de saída. O Qwen3 Next 80B A3B Instruct, chinês e também focado em velocidade, cobra US$ 1,10. O Devstral 2 é o mais caro da turma de pesos abertos listada hoje.
Comparação com quem já estava no jogo
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Devstral 2 2512 (o novo) | 19.2 | 0.4 | 2 | 262k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Llama 4 Maverick | 14.5 | 0.2 | 0.696 | 1.05M |
| Qwen3 Next 80B A3B Instruct | 13.8 | 0.1 | 1.1 | 262k |
Olhando para os pares diretos, o Devstral 2 só ganha do gpt-oss-120b em coding — e por pouco. Em agentic, perde. Em velocidade, fica devendo: 117 tokens por segundo contra 155 do rival. O Qwen3 Next entrega 173 e custa quase a metade. O Llama 4 Maverick, multimodal, custa um terço.
| Campo | Valor |
|---|---|
| Identificador | mistralai/devstral-2512 |
| Criador | mistralai |
| Preço de entrada | US$ 0.400 / M tokens |
| Preço de saída | US$ 2.00 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+file->text |
| Leitura de cache | US$ 0.040 / M (90% de desconto) |
| Índice de inteligência (AA) | 19.2 |
| Índice de código | 31.3 |
| Índice agêntico | 10.6 |
| Parâmetros | 125B (125B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 117 tokens/s |
Para quem vale a pena
Se você precisa de pesos abertos por exigência contratual ou regulatória e quer o melhor índice de coding entre modelos europeus, o Devstral 2 entra na lista. A Mistral é francesa, e isso importa para empresas sob jurisdição da UE que preferem não depender de modelos americanos ou chineses.
Se o seu critério for puramente custo-benefício em agentic coding, o gpt-oss-120b continua sendo a referência entre os abertos: custa uma fração, é mais rápido e tem agentic maior.
Para quem NÃO muda nada
Se você já roda gpt-oss-120b em produção, não há motivo para trocar. A diferença de coding está dentro do ruído. Se você usa Claude Haiku 4.5 ou o3 para tarefas de raciocínio mais pesado, o Devstral 2 nem entra na conversa — o índice de inteligência geral dele é 19,24, contra 29,89 do Haiku e 31,10 do o3.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
| Nova 2 Lite | 19.2 | 2.5 |
A escolha real é entre pagar caro por um modelo de coding marginalmente superior e ficar com o gpt-oss-120b, que entrega 97% do resultado por 8,5% do preço de saída. Para a maioria das equipes, essa conta fecha no rival americano.
O que fazer agora
Se você está avaliando o Devstral 2 hoje, rode um benchmark interno de coding com seu próprio repositório antes de assinar qualquer contrato. Se a diferença real ficar abaixo de 5%, mantenha o gpt-oss-120b e use o dinheiro que sobra para subir o volume de cache hits. Se a diferença for maior e você precisar de pesos abertos europeus, o Devstral 2 justifica o preço — mas só nesse caso.
Só vale pagar US$ 2/M de saída no Devstral 2 se você precisa de pesos abertos europeus e o benchmark interno confirmar ganho real de coding acima de 5% sobre o gpt-oss-120b.
Perguntas frequentes
Devstral 2 é melhor que gpt-oss-120b para coding?
Marginalmente: 31,26 contra 30,44 no índice de coding. A diferença está dentro da margem de erro da maioria dos benchmarks internos. Em agentic, o gpt-oss-120b ganha por 13,43 contra 10,64.
Quanto custa o Devstral 2 2512 por milhão de tokens?
US$ 0,40 de entrada, US$ 2 de saída e US$ 0,04 com cache. O preço de saída é o mais caro entre os modelos de pesos abertos listados no catálogo hoje.
Devstral 2 serve para tarefas que não sejam código?
Não é o foco. O índice de inteligência geral é 19,24, abaixo do Claude Haiku 4.5 (29,89) e do o3 (31,10). Para raciocínio geral, há opções melhores e mais baratas.