Devstral 2 2512 e Nemotron Super 49B: qual vale os 400 dólares por milhão
Dois modelos abertos com mesmo preço de entrada, mas filosofias opostas: 123B da Mistral contra 49B da NVIDIA, e a conta não fecha igual.
O que você paga pelo mesmo dólar
Você está olhando dois modelos abertos lançados no fim de 2025, ambos cobram US$ 0,40 por milhão de tokens de entrada e nenhum dos dois é gratuito. A partir daí as contas divergem — e é aí que mora a escolha.
O Mistral Devstral 2 2512, da Mistral AI francesa, é um transformer denso de 123 bilhões de parâmetros com 256K de contexto, especializado em coding agentic. O Llama 3.3 Nemotron Super 49B V1.5, da NVIDIA americana, é um modelo de raciocínio de 49 bilhões derivado do Llama 3.3 70B da Meta, ajustado para fluxos agentic via SFT em matemática, código e ciência. Mesma categoria no papel, números diferentes na fatura.
Onde a diferença aparece
O Devstral 2 cobra US$ 2,00 por milhão de tokens de saída. O Nemotron Super 49B cobra US$ 0,40 — o mesmo preço da entrada. Em um trabalho agentic típico, em que o modelo consome contexto longo e devolve pouco (tool calls curtos, diffs de código), essa diferença pesa menos do que parece. Em tarefas em que o modelo escreve muito — geração de documentação, refatoração pesada, explicações longas — o Devstral custa cinco vezes mais por token emitido.
A janela de contexto também joga a favor do francês: 262 mil tokens contra 131 mil do NVIDIA. Em codebases inteiras ou sessões longas de agente, isso é a diferença entre caber tudo no prompt ou ter que paginar.
| Critério | Devstral 2 2512 | Llama 3.3 Nemotron Super 49B |
|---|---|---|
| Índice de inteligência | 19.2 | 12.4 |
| Entrada US$/M | 0.4 | 0.4 |
| Saída US$/M | 2 | 0.4 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 117 | 53 |
| Índice de código | 31.3 | — |
| Índice agêntico | 10.6 | — |
Inteligência e velocidade: o que os números dizem
O índice de inteligência do Devstral 2 marca 19,24, contra 12,40 do Nemotron — uma diferença de mais de 50% no agregado. Em coding especificamente, o Devstral pontua 31,26; o Nemotron não tem nota publicada nesse recorte. Em agentic, 10,64 contra dado ausente.
Velocidade conta outra história: 117 tokens por segundo no Devstral contra 52,85 no Nemotron — mais que o dobro. Para quem roda agente em loop, isso significa iterações mais rápidas, não só respostas mais baratas. O Devstral também não é modelo de raciocínio explícito; o Nemotron é. Em tarefas que pedem cadeia de pensamento antes da resposta, o NVIDIA pode entregar melhor qualidade por token — mas você não tem benchmark publicado para confirmar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Quem está na frente hoje
Olhando o topo do catálogo nesta data, o Devstral 2 aparece em quinto lugar com IQ 19,24 — acima do Devstral médio, mas distante do MiMo-V2-Flash da Xiaomi (34,02) e do o3 da OpenAI (31,10). O Nemotron, com IQ 12,40, não figura entre os cinco primeiros. Os dois são modelos abertos voltados para coding; nenhum dos dois disputa a ponta em inteligência geral.
Quando cada um ganha
Você escolhe o Devstral 2 2512 quando o trabalho é coding agentic sério em codebase grande: a janela de 256K cabe um repositório inteiro, a velocidade de 117 tps encurta loops de agente, e o IQ 19,24 com nota 31,26 em coding entrega mais qualidade onde importa. Aceita pagar US$ 2,00 por milhão de saída e rodar um modelo de 123B.
Você escolhe o Llama 3.3 Nemotron Super 49B V1.5 quando o orçamento de saída é o gargalo — geração de texto longo, resumos, documentação — porque os US$ 0,40 por milhão de saída são imbatíveis entre modelos abertos desse porte. Também faz sentido quando você precisa de raciocínio explícito e quer um modelo menor (49B) que cabe em hardware mais modesto. Aceita perder em inteligência agregada e em janela de contexto.
Para a maioria dos desenvolvedores que já roda agentes de código, o Devstral 2 é a escolha mais cara por token mas mais barata por projeto entregue.
Se você roda agentes de código em codebase grande, pague os US$ 2,00 de saída do Devstral 2 e ganhe velocidade e janela; se o que você faz é gerar texto longo com orçamento apertado, os US$ 0,40 do Nemotron Super 49B não têm concorrente aberto à altura.
Perguntas frequentes
Devstral 2 2512 ou Nemotron Super 49B: qual é melhor para coding?
O Devstral 2 tem nota publicada de 31,26 em coding e janela de 256K, ideal para codebases grandes. O Nemotron não tem benchmark público nesse recorte, então a comparação direta não é possível pelos dados disponíveis.
Por que o Nemotron Super 49B é tão mais barato na saída?
Porque a NVIDIA precificou saída igualando a entrada, em US$ 0,40 por milhão. O Devstral cobra US$ 2,00 na saída, cinco vezes mais — reflexo do porte maior (123B contra 49B) e do foco em agente de código.
Os dois modelos são realmente abertos?
Sim. Ambos têm pesos abertos segundo o catálogo: o Devstral 2 é da Mistral AI (França) e o Nemotron Super 49B V1.5 é da NVIDIA (EUA), derivado do Llama 3.3 70B da Meta.