Nemotron Nano custa 10× menos que Devstral 2 e a nota cai junto
Comparativo frente a frente entre os dois modelos open-weights lançados em dezembro para codificação agentic — quando cada um compensa de verdade.
O preço que você paga
Dois modelos com pesos abertos, ambos vendidos como "para codificação agentic", foram lançados em dezembro com cinco dias de diferença entre um e outro. Nemotron 3 Nano, da NVIDIA, cobra US$ 0,20 por milhão de tokens de saída; Devstral 2, da Mistral, cobra US$ 2 pela mesma janela. A diferença é de dez vezes — e a pergunta que você, desenvolvedor, precisa responder hoje é simples: a nota compensa a fatura?
Onde eles ficam no tabuleiro
Nenhum dos dois está no topo. O ranking desta data coloca o Xiaomi MiMo-V2-Flash na frente (IQ 34,024 a US$ 0,30/M de saída), seguido pelo o3 da OpenAI (31,096 a US$ 8/M) e pelo Claude Haiku 4.5 (29,892 a US$ 5/M). O quarto colocado é o gpt-oss-120b da OpenAI (24,126 a US$ 0,17/M) — esse sim concorre por preço com o Nemotron. Devstral 2 (IQ 19,242) e Nemotron Nano (14,538) ocupam posições intermediárias no catálogo, que tem hoje 309 modelos. Compará-los entre si faz sentido; nenhum dos dois está pronto para substituir o3 ou Haiku em produção pesada.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Codificação agentic é onde a diferença pesa
Aqui o fosso aparece. Devstral 2 marca 31,259 em coding e 10,642 em agentic — números robustos para um modelo open-weights de 125B parâmetros. Nemotron Nano registra 14,371 em coding e só 1,993 em agentic. Em tarefa agentic de verdade, Devstral entrega mais de cinco vezes o resultado do Nemotron. Não é marketing — é a métrica da Artificial Analysis, e é o tipo de diferença que explode no fim de um pipeline agêntico encadeado com várias chamadas de ferramenta.
| Critério | Devstral 2 2512 | Nemotron 3 Nano 30B A3B |
|---|---|---|
| Índice de inteligência | 19.2 | 14.5 |
| Entrada US$/M | 0.4 | 0.05 |
| Saída US$/M | 2 | 0.2 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 117 | 248 |
| Índice de código | 31.3 | 14.4 |
| Índice agêntico | 10.6 | 2.0 |
A arquitetura ajuda a explicar parte do preço. Devstral é um transformer denso de 125 bilhões de parâmetros — toda a potência roda em cada token. Nemotron é uma MoE de 31,6 bilhões totais com só 3,6 bilhões ativos por inferência. É por isso que o Nano cobra dez vezes menos e roda mais rápido: a NVIDIA só aciona 3,6B dos 31,6B por token, e isso aparece na velocidade medida (247,99 contra 117,08 tokens por segundo). Para quem chama o modelo em loop dentro de um agente, essa diferença de latência também é dinheiro — em tempo de resposta, não em fatura direta.
Outro ponto que pesa: Nemotron suporta raciocínio estruturado; Devstral não. Se o seu pipeline depende de cadeia de pensamento explícita, Nano entra com vantagem — desde que você não esteja contando com capacidade agentic pesada.
Quando cada um ganha
Devstral 2 ganha quando você está construindo um agente de codificação que precisa de planos longos, várias chamadas de ferramenta encadeadas e você já estourou o orçamento com Claude ou OpenAI. O salto em agentic (10,6 contra 1,99) compensa os US$ 2 por milhão de saída — desde que a tarefa realmente exija capacidade agêntica.
Nemotron Nano ganha quando você precisa de classificador barato, parser de código, sumarizador de PR ou qualquer fluxo de alto volume em que cada chamada precisa custar centavos. Os US$ 0,05 de entrada e US$ 0,20 de saída são imbatíveis entre modelos open-weights hoje, e os US$ 0,025 por milhão em cache hit chegam perto de gratuito.
O que você faz com isso amanhã
Se hoje você está pagando modelo premium por tarefas que o Nemotron resolve, está queimando caixa. A conta mais rápida começa aí: roteie chamadas de alto volume e baixo risco para o Nano, e reserve o Devstral 2 para o núcleo agêntico. A fatura cai sem perder o resultado onde ele importa.
Roteie o alto volume e o baixo risco para o Nemotron Nano e reserve o Devstral 2 para o núcleo agêntico — a fatura cai sem perder o resultado onde ele importa.
Perguntas frequentes
Devstral 2 ou Nemotron Nano, qual escolher para coding agentic?
Devstral 2 marca 31,259 em coding e 10,642 em agentic — mais que o dobro do Nemotron Nano nos dois quesitos. Se o pipeline precisa de agente encadeado de verdade, Devstral compensa o preço maior. Se a chamada é classificar, resumir ou parsear código em alto volume, Nemotron Nano entrega por uma fração do preço.
Quanto custa rodar Nemotron Nano em produção?
Cota publicada no catálogo: US$ 0,05 por milhão de tokens de entrada, US$ 0,20 por milhão de saída e US$ 0,025 por milhão em cache hit. É o modelo open-weights mais barato do ranking de hoje entre os que trazem raciocínio estruturado.
Posso rodar Nemotron Nano e Devstral 2 localmente?
Os dois têm pesos abertos. Nemotron Nano cabe em hardware menor porque é MoE com só 3,6B de parâmetros ativos por inferência. Devstral 2, com 125B densos, exige GPU de peso — uma única GPU comum de 24 GB não dá conta.