Mistral Large 3 2512 cobra 4× mais caro que o Nemotron da NVIDIA
Os dois são modelos abertos e rodam bem em uma GPU só — só que um fala francês e custa em dólar, o outro fala inglês e custa em centavo.
Você abre a fatura da API e vê dois modelos abertos, dois pesos abertos, dois pesos pesados — e uma diferença de quase 4× no token de saída. É isso que separa o Mistral Large 3 2512 do Llama 3.3 Nemotron Super 49B V1.5 da NVIDIA nesta semana. A escolha não é sobre qual é melhor no vácuo; é sobre qual tarefa paga a conta.
O que cada um entrega em inteligência
Os números do Artificial Analysis colocam o Mistral Large 3 2512 na frente, mas não por muito: 15,9 de IQ contra 12,4 do Nemotron. Em coding, a distância abre: 20,1 contra uma nota que a NVIDIA não publicou. Em agentic, a coisa inverte feio — o Mistral marca 5,5 e o Nemotron também não tem nota pública. Ou seja, o Mistral tem mais sinal medido; o Nemotron tem mais promessa descrita em release.
Pense assim: o Mistral é o candidato que já fez a prova e tirou nota. O Nemotron é o candidato que diz "fui treinado pra isso" e ainda não mostrou o boletim. Para quem precisa de referência em benchmark hoje, a escolha é simples.
A conta que dói
Aqui mora a tensão. O Mistral cobra US$ 0,50 por milhão de tokens de entrada e US$ 1,50 por milhão de saída. O Nemotron cobra US$ 0,40 em ambos os lados — entrada e saída iguais. Sem cache publicado pela NVIDIA, o que significa que o catálogo não trouxe o número.
Traduzindo: se você gera muito texto — agente, sumarização longa, código — a diferença explode. Em um workload de 100 milhões de tokens de saída por mês, o Mistral custa US$ 150 e o Nemotron, US$ 40. São US$ 110 que sobram ou que faltam, dependendo de qual lado você está.
A arquitetura conta, e muito
O Mistral Large 3 2512 é sparse mixture-of-experts: 675 bilhões de parâmetros totais, mas só 41 bilhões ativos por token. É como ter um restaurante com 675 chefs no quadro, mas só 41 cozinham seu prato. O Nemotron é denso: 49 bilhões ativos, todos os 49 bilhões trabalhando em cada token. Isso explica parte da diferença de velocidade — o Mistral marca 77,4 tokens por segundo contra 52,8 do Nemotron — e por que cada um pede um tipo de hardware.
| Critério | Mistral Large 3 2512 | Llama 3.3 Nemotron Super 49B |
|---|---|---|
| Índice de inteligência | 15.9 | 12.4 |
| Entrada US$/M | 0.5 | 0.4 |
| Saída US$/M | 1.5 | 0.4 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 77 | 53 |
| Índice de código | 20.1 | — |
| Índice agêntico | 5.5 | — |
O contexto também diverge: 262 mil tokens no Mistral contra 131 mil no Nemotron. Quem joga PDFs inteiros ou bases de código longas no prompt vai sentir o dobro de janela no modelo francês.
Onde cada um ganha — sem "depende"
Mistral Large 3 2512 ganha quando: você precisa de benchmark auditável hoje, de janela de contexto longa (acima de 130 mil tokens) e está rodando em hardware que aguenta um sparse MoE. Codificação é o terreno onde a nota publicada (20,1) sustenta o uso. Pague os US$ 1,50 por milhão de saída sem chorar — é o preço de ter referência.
Nemotron Super 49B V1.5 ganha quando: o orçamento é o gargalo real, o workload é em inglês e você quer pagar o mesmo preço na entrada e na saída. É o modelo para agente de alto volume, RAG com muito texto gerado e qualquer cenário em que cada centavo por token conta mais que três pontos de IQ. A nota de raciocínio está marcada como ativa; a de coding e agentic, não publicada.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para fechar o tabuleiro: nenhum dos dois está no topo de inteligência do catálogo desta data. Xiaomi MiMo-V2-Flash lidera com 34,0, seguido de OpenAI o3 (31,1) e Claude Haiku 4.5 (29,9). Os dois modelos deste comparativo estão no meio do pacote — o que reforça que a disputa aqui é de preço e encaixe, não de soberania técnica.
O que você faz com isso amanhã
Se você está migrando de um modelo fechado para um open weights e a fatura é a variável decisiva, comece pelo Nemotron. Se você precisa de janela de contexto longa e aceita pagar 4× mais na saída, vá de Mistral. E se nenhum dos dois resolve, o catálogo tem 315 modelos listados hoje — é só filtrar por IQ, preço e idioma antes de assinar a próxima fatura.
Mistral Large 3 2512 para quem precisa de benchmark e contexto longo; Nemotron Super 49B para quem precisa gerar muito texto em inglês sem estourar a conta da API.
Perguntas frequentes
Qual a diferença de preço entre Mistral Large 3 2512 e Nemotron Super 49B?
O Mistral cobra US$ 0,50 de entrada e US$ 1,50 de saída por milhão de tokens. O Nemotron cobra US$ 0,40 nos dois lados. Em 100 milhões de tokens de saída por mês, a diferença é de cerca de US$ 110.
O Nemotron Super 49B serve para coding e agentes?
O catálogo não publica notas de coding nem de agentic para o Nemotron nesta data. O modelo é descrito como pós-treinado para fluxos agentic e RAG, mas sem benchmark público para sustentar a comparação.
Qual dos dois tem janela de contexto maior?
O Mistral Large 3 2512 tem 262.144 tokens de contexto, o dobro dos 131.072 do Nemotron Super 49B. Para PDFs longos e bases de código extensas, o Mistral leva vantagem clara.