Nemotron Nano é 60% mais barato e lê vídeo; Mistral pensa quase 2x melhor
A diferença entre os dois modelos abertos não é só preço nem só tamanho: é multimodalidade. Veja quando cada um vence.
Mistral publicou o Large 3 2512 no começo de dezembro como "o modelo mais capaz da Mistral até hoje". Sai por US$ 1,50 por milhão de tokens de saída. A NVIDIA tinha soltado o Nemotron Nano 12B 2 VL pouco mais de um mês antes, vendido como "modelo de raciocínio multimodal para vídeo e documentos" — sai por US$ 0,60. Parece que a NVIDIA cobra menos da metade. Parece.
O que a conta não mostra: a régua de inteligência
Em janeiro de 2026, os dois ficam bem abaixo do topo do catálogo. Xiaomi MiMo-V2-Flash lidera com 34 pontos no índice de inteligência; em seguida vêm OpenAI o3 (31,1) e Anthropic Claude Haiku 4.5 (29,9). Nenhum dos dois que estamos comparando encosta nesse bloco.
Mistral Large 3 2512 marca 15,9. Nemotron Nano 12B 2 VL marca 8,8. Quase dois para um. Em coding, Mistral pontua 20,07 — o Nemotron não tem nota publicada nessa dimensão. Se o seu workload é texto puro ou código, a diferença aparece antes do segundo prompt.
| Critério | Mistral Large 3 2512 | Nemotron Nano 12B 2 VL |
|---|---|---|
| Índice de inteligência | 15.9 | 8.8 |
| Entrada US$/M | 0.5 | 0.2 |
| Saída US$/M | 1.5 | 0.6 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 77 | 43 |
| Índice de código | 20.1 | — |
| Índice agêntico | 5.5 | — |
Multimodalidade: a razão pela qual a NVIDIA cobra menos
Mistral aceita texto, imagem e arquivo. Não processa vídeo. Nemotron aceita texto, imagem e vídeo. Se você precisa alimentar o modelo com clipes, gravações de reunião, screencasts ou qualquer saída de câmera, o Nemotron é o único dos dois que resolve — não há concorrente nesta comparação.
É o que justifica o preço agressivo: a NVIDIA está brigando em outra frente. Não está tentando ganhar do Mistral em coding ou em janelas longas. Está abrindo o mercado de vídeo multimodal com pesos abertos. O custo menor é meio, não fim.
A conta, porém, não é só multimodalidade. Em tokens de saída, Mistral cobra US$ 1,50 por milhão; Nemotron, US$ 0,60. No preço blended que o catálogo publica, Mistral fica em US$ 0,75 e Nemotron em US$ 0,30. Em workload de texto puro, Nemotron custa 60% menos — para entregar inteligência quase duas vezes menor. A equação fica feia.
Tamanho, contexto, velocidade
Mistral Large 3 2512 é MoE esparso com 675 bilhões de parâmetros totais, mas só 41 bilhões ativos por token. Sai sob Apache 2.0, da francesa Mistral. Roda a 77,45 tokens por segundo. Janela de contexto: 262.144 tokens (256k). Não tem raciocínio nativo ligado por padrão.
Nemotron Nano 12B 2 VL é denso, 13,2 bilhões, ativo inteiro. Sai dos EUA, da NVIDIA. Arquitetura híbrida Transformer-Mamba — a proposta é combinar a acurácia do Transformer com a eficiência do Mamba em sequências longas. Roda a 42,84 tokens por segundo. Janela de 131.072 tokens (128k). Raciocínio ligado por padrão.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Em resumo: Mistral é quase duas vezes mais rápido, tem o dobro de contexto e é aberto sob Apache 2.0. Nemotron é menor, mais barato, multimodal de verdade em vídeo, e pensa antes de responder.
Onde cada um vence — e onde cada um perde
Mistral Large 3 2512 vence quando: você está gerando ou refatorando código, escrevendo texto longo, resumindo documentos grandes, ou precisa de uma janela de 256k. É o seu modelo de produção quando vídeo não entra no pipeline. Também vence em self-hosting porque Apache 2.0 dispensa acordo comercial.
Mistral perde quando: o input é vídeo. Aí nem precisa comparar.
Nemotron Nano 12B 2 VL vence quando: o pipeline recebe vídeo de câmera, clipes, reuniões, screencasts. É o único da dupla que entra nesse jogo. Também vence quando o orçamento é apertado em workload de texto curto e o raciocínio nativo ativado ajuda — sem precisar de chamada separada. E vence em self-hosting leve: 13,2B densos rodam em hardware menor que 41B ativos de MoE.
Nemotron perde quando: a tarefa exige raciocínio de texto forte, código sério ou janela longa. A nota de IQ 8,8 não mente: é um modelo pequeno de propósito específico, não um flagship.
O anúncio da NVIDIA não mente — raciocínio multimodal de verdade, com vídeo, por US$ 0,60. Mas a conta da Mistral também não mente — quase duas vezes mais inteligente, quase duas vezes mais rápido, o dobro de contexto, e aberto em Apache 2.0. Em janeiro de 2026, o que você paga é exatamente pelo eixo em que cada um joga.
Use Nemotron quando o input tem vídeo; use Mistral Large 3 2512 quando a tarefa é texto, código ou documento longo.
Perguntas frequentes
Mistral Large 3 2512 ou Nemotron Nano 12B 2 VL: qual escolher?
A escolha é pelo eixo de uso, não pela régua de preço. Se o pipeline precisa ler vídeo, o Nemotron é o único dos dois que processa — não há comparação. Se for texto, código ou documentos longos, o Mistral entrega quase o dobro de inteligência, janela de 256k e US$ 1,50 por milhão de tokens de saída.
Qual dos dois modelos aceita vídeo?
Só o NVIDIA Nemotron Nano 12B 2 VL. A Mistral Large 3 2512 processa texto, imagem e arquivos, mas não vídeo. Quem precisa alimentar o modelo com clipes ou gravações não tem alternativa nesta comparação.
Quanto custa cada um por Million de tokens em janeiro de 2026?
Mistral Large 3 2512 cobra US$ 0,50 por milhão de tokens de entrada e US$ 1,50 por milhão de saída. Nemotron Nano 12B 2 VL cobra US$ 0,20 de entrada e US$ 0,60 de saída. No preço blended publicado pelo catálogo, a diferença fica em US$ 0,75 contra US$ 0,30 por milhão.