Devstral 2 cobra US$ 2 por milhão de saída e ainda assim custa mais que o gpt-oss-20b
Um modelo de 125B parâmetros da Mistral contra um MoE de 21B da OpenAI: a conta não fecha do jeito que parece.
Você abre a tabela de preços, vê "US$ 2 por milhão" no Devstral 2 e pensa: ok, modelo sério, preço compatível. Aí você rola uma linha e encontra o gpt-oss-20b cobrando US$ 0,13 pela mesma saída. A diferença é de 15 vezes. Antes de escolher pelo menor número, vale entender o que cada um está te entregando.
O tamanho da conta, traduzido
O Devstral 2 cobra US$ 0,40 por milhão de tokens de entrada e US$ 2,00 por milhão de saída. O gpt-oss-20b cobra US$ 0,03 de entrada e US$ 0,13 de saída. Em um caso típico de agente de código — muito mais leitura de repositório do que escrita — a maior parte do gasto fica na entrada, mas a saída continua mandando na fatura porque tokens de saída são mais caros em qualquer provedor.
Pegando um cenário concreto: 1 milhão de tokens de entrada e 200 mil de saída. No Devstral 2, isso dá US$ 0,40 + US$ 0,40 = US$ 0,80. No gpt-oss-20b, US$ 0,03 + US$ 0,026 = US$ 0,056. O Devstral custa cerca de 14 vezes mais nesse perfil de uso. Não é detalhe: é o que decide se o seu bot de PR review cabe no orçamento do mês.
Inteligência e código, lado a lado
| Critério | Devstral 2 2512 | gpt-oss-20b |
|---|---|---|
| Índice de inteligência | 19.2 | 15.2 |
| Entrada US$/M | 0.4 | 0.03 |
| Saída US$/M | 2 | 0.13 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 117 | 113 |
| Índice de código | 31.3 | 20.7 |
| Índice agêntico | 10.6 | 3.1 |
O índice de inteligência do Devstral 2 está em 19,24 contra 15,23 do gpt-oss-20b. Em coding, a diferença salta: 31,26 contra 20,70. Em agentic, 10,64 contra 3,10. Em outras palavras, o Mistral não está só um pouco à frente — está em outra faixa quando o assunto é mexer em código de verdade.
O contexto também pesa: 262 mil tokens no Devstral contra 131 mil no gpt-oss-20b. Para quem joga um repositório inteiro na janela, esse 2x de janela muda o tipo de tarefa que dá para fazer sem truque.
Onde o gpt-oss-20b ainda vence na ponta do lápis
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O gpt-oss-20b é um MoE de 21B com apenas 3,6B ativos por passada. Isso explica em parte a velocidade de 112,6 tokens por segundo, praticamente igual à do Devstral 2 (117,08). E explica também o preço: menos trabalho efetivo por token, conta menor. Outro detalhe que conta: o gpt-oss-20b é raciocinante, o Devstral 2 não. Em tarefas que pedem cadeia de pensamento longa, o modelo da OpenAI pode compensar parte da diferença de IQ.
E há o país de origem: Mistral é francesa, OpenAI é americana. Para quem tem requisito de residência de dados ou simplesmente prefere fornecedor europeu, isso entra no cálculo.
Para quem cada um vale a pena
Se o seu gargalo é qualidade de código — revisão de PR, refactor grande, agente que precisa raciocinar sobre arquitetura — o Devstral 2 entrega mais. A diferença de IQ em coding não é marginal, e a janela de 256K permite passar contextos que o gpt-oss-20b não aguenta.
Se o seu gargalo é custo, o gpt-oss-20b vence disparado. Para workloads de alto volume onde cada milésimo de dólar importa — classificação, extração, geração curta — o modelo da OpenAI custa uma fração e ainda entrega velocidade equivalente.
A escolha real não é qual modelo é melhor. É qual restrição aperta mais no seu projeto: caixa ou qualidade.
Pague US$ 2 por milhão de saída no Devstral 2 quando o código que sai precisa estar certo; pague US$ 0,13 no gpt-oss-20b quando o volume é grande demais para o orçamento francês caber.
Perguntas frequentes
Devstral 2 ou gpt-oss-20b para agente de código?
Devstral 2, sem discussão. O índice de coding dele é 31,26 contra 20,70 do gpt-oss-20b, e a janela de 256K permite passar repositórios inteiros. A conta fica cerca de 14 vezes maior no perfil típico de agente, mas a diferença de qualidade justifica quando o código precisa funcionar de primeira.
Quanto custa na prática usar o Devstral 2 por mês?
Depende do volume, mas em um cenário de 1 milhão de tokens de entrada e 200 mil de saída por execução, cada chamada sai por US$ 0,80. Multiplique pelas execuções do seu pipeline e compare com o mesmo fluxo no gpt-oss-20b, que fica em torno de US$ 0,056 por chamada.
O gpt-oss-20b é raciocinante e o Devstral 2 não?
Sim. O gpt-oss-20b tem reasoning habilitado e o Devstral 2 não, segundo os dados do catálogo nesta data. Em tarefas que pedem cadeia de pensamento explícita, isso pode reduzir a vantagem do Mistral mesmo com IQ mais alto.