FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

gpt-oss-120b é 12 vezes mais barato que Devstral 2 — mas o código conta outra história

Comparativo frente a frente entre o modelo aberto da OpenAI e o coder da Mistral, com a conta de API na mão.

Redação FalaVIP IA 3 min de leitura
US$ 0,17por milhão de tokens de saída do gpt-oss-120b
US$ 2,00por milhão de tokens de saída do Devstral 2
30,441 vs 31,259índice de coding (Artificial Analysis)

O que o release não te conta

Saiu há dois dias o Devstral 2 2512, da Mistral, e o marketing da empresa francesa vendeu o modelo como coder de ponta. A conta, porém, é outra: US$ 2 por milhão de tokens de saída, contra US$ 0,17 do gpt-oss-120b da OpenAI. São quase 12 vezes de diferença no mesmo item da fatura — e é exatamente aí que a maioria das comparações tropeça. Você não escolhe modelo só pelo benchmark; escolhe pelo que sobra no fim do mês.

Preço de saída (US$ por milhão de tokens)
gpt-oss-120b0,17Devstral 2 25122US$/M
Fonte: OpenRouter

Inteligência geral: gpt-oss-120b ainda manda

No índice geral de inteligência da Artificial Analysis, o modelo aberto da OpenAI marca 24,126, enquanto o Devstral 2 fica em 19,242. A diferença é de cerca de 25% — não é briga de igual para igual em raciocínio amplo. O gpt-oss-120b é um MoE de 117B parâmetros que ativa só 5,1B por passada; o Devstral 2 é denso, 123B ativos em cada inferência. Em tarefas de conhecimento geral e raciocínio puro, o modelo da OpenAI entrega mais.

Índice de inteligência (Artificial Analysis)
gpt-oss-120b24,1Devstral 2 251219,2índice
Fonte: Artificial Analysis

Onde o Devstral 2 responde: coding e contexto

Quando o assunto vira código, a história muda. O índice de coding do Devstral 2 é 31,259, contra 30,441 do gpt-oss-120b — uma vantagem pequena, mas consistente. Em agentic coding, a diferença aumenta: 13,425 contra 10,642 do modelo da OpenAI. Traduzindo: se você está montando um agente que vasculha repositório, abre arquivo, edita e roda teste, o Devstral 2 entrega mais por token. E tem outro detalhe que pesa: a janela de contexto do coder francês é de 262 mil tokens, o dobro dos 131 mil do gpt-oss-120b. Para codebase grande, isso não é luxo, é necessidade.

gpt-oss-120b × Devstral 2 2512
Critériogpt-oss-120bDevstral 2 2512
Índice de inteligência24.119.2
Entrada US$/M0.0370.4
Saída US$/M0.172
Contexto131k262k
Pesos abertossimsim
Velocidade (tok/s)155117
Índice de código30.431.3
Índice agêntico13.410.6

Velocidade, país e modelo aberto

Nos dois casos o peso é aberto, então dá para self-host se a conta de API apertar — mas só quem tem GPU sobrando. Em inferência pela API, o gpt-oss-120b roda a 155 tokens por segundo, contra 117 do Devstral 2. Em geração longa, isso aparece no tempo de resposta. O catálogo também mostra a origem: OpenAI nos Estados Unidos, Mistral na França. Em latência para o Brasil, nenhum dos dois tem servidor local declarado nos dados, então vale testar antes de comprometer o pipeline.

Em que situação cada um ganha

Se o seu uso é raciocínio geral, análise de texto, perguntas e respostas amplas, ou qualquer coisa que não seja código de produção — o gpt-oss-120b ganha. É mais barato por um fator de quase 12x na saída, é mais rápido, e pontua mais no índice geral. Para um chatbot, um sumarizador, um classificador, ele é a escolha racional.

Se o seu uso é agentic coding em codebase grande, edição multi-arquivo, tarefas que exigem 200 mil tokens de contexto de uma vez — o Devstral 2 ganha. A vantagem em coding é real, a janela maior é real, e o preço de US$ 2/M de saída é o que você paga por isso. Para um agente dev que vai gastar horas varrendo repositório, a diferença de US$ 1,83 por milhão de tokens vira economia ou prejuízo dependendo do volume.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Nova 2 Lite19.22.5
Entre os 304 modelos disponíveis no catálogo nesta data.

O que muda no seu setup

Antes de migrar, faça a conta: multiplica o volume mensal de tokens de saída pelo preço. Se você está emitindo 100 milhões de tokens por mês em coding agent, são US$ 200 com Devstral 2 e US$ 17 com gpt-oss-120b — mas se a taxa de sucesso do agente francês for 5% maior e isso evitar um retrabalho humano, o cálculo inverte. O melhor dos dois mundos, se a infra permitir, é self-host do gpt-oss-120b para tarefas gerais e API do Devstral 2 só para o coding agent pesado. É o tipo de decisão que cabe em uma planilha, não em um tweet.

Em uma frase

Para texto e raciocínio geral, gpt-oss-120b custa quase 12x menos e é mais rápido; para agentic coding em codebase grande, Devstral 2 entrega mais por token mesmo cobrando US$ 2/M de saída.

Perguntas frequentes

gpt-oss-120b ou Devstral 2 2512 para programar?

Depende do tipo de coding. Em benchmarks sintéticos de código, o Devstral 2 marca 31,259 contra 30,441 do gpt-oss-120b — vantagem pequena mas consistente, maior ainda em agentic coding (13,425 vs 10,642). Em coding puro e codebase grande, o Devstral 2 ganha.

Quanto custa cada modelo por milhão de tokens?

O gpt-oss-120b cobra US$ 0,037 de entrada e US$ 0,17 de saída por milhão de tokens. O Devstral 2 2512 cobra US$ 0,40 de entrada e US$ 2,00 de saída, com cache a US$ 0,04. A diferença na saída é de quase 12x.

Os dois modelos são open weights?

Sim. O gpt-oss-120b é um MoE de 117B parâmetros (5,1B ativos) e o Devstral 2 é um transformer denso de 123B. Ambos podem ser baixados e rodados localmente, mas exigem GPU compatível — na API, o preço é o que vale.

Leia também