Nemotron 3 Nano Omni chega grátis e multimodal — inteligência paga o preço
Lançamento da NVIDIA aceita texto, imagem, áudio e vídeo por US$ 0 de entrada e saída, mas o índice de inteligência fica em 15, bem abaixo dos 45 do topo do mercado
A NVIDIA colocou no catálogo, hoje, um modelo que custa US$ 0 para entrar e US$ 0 para sair: o Nemotron 3 Nano Omni (free). Em tempos de fatura de API, isso sempre merece um clique. A pergunta de sempre, porém, é a mesma: grátis de que forma?
A conta de entrada e saída é zero — mas o que vem de brinde?
Para chamar de "free" de verdade, três coisas precisam estar zeradas: o preço de entrada, o de saída e a leitura em cache. No Nemotron 3 Nano Omni, o catálogo marca in_per_m = 0 e out_per_m = 0. O cache_per_m veio nulo — quando o catálogo não publica o valor, a leitura honesta é: não há informação disponível, então não dá para cravar. Dos três, dois estão oficialmente em zero.
Traduzindo: se você mandar um vídeo de 10 minutos ou um PDF com imagens, o custo de processamento não passa pela fatura — passa pela fila. E a fila anda rápido: a velocidade publicada é de 326,83 tokens por segundo, número alto mesmo para um modelo pequeno.
Multimodal completo, pesos abertos, 256k de contexto
Esse é o pacote que não se costuma ver junto num modelo free. O Nemotron 3 Nano Omni aceita texto, imagem, áudio e vídeo, e devolve só texto. A janela de contexto é de 256 mil tokens. Os pesos são abertos — você pode baixar e rodar local se tiver GPU sobrando.
Por baixo do capô, são 30 bilhões de parâmetros totais com apenas 3 bilhões ativos por inferência. É a pegada MoE (mistura de especialistas): o modelo "tem" 30B, mas só pensa com 3B a cada passo. Daí a velocidade. A NVIDIA o descreve, no próprio catálogo, como um sub-agente de percepção e contexto dentro de sistemas agentes empresariais — ou seja, não é o cérebro da operação, é o olho e o ouvido.
O preço que se paga é em inteligência
Pagar US$ 0 não significa receber US$ 0 de capacidade. O índice de inteligência do Nemotron 3 Nano Omni hoje é 15,007. Em coding, 13,754. Para efeito de régua: o topo do mercado está em 47,738 (Gemini 3.1 Pro Preview), 45,512 (GPT-5.3-Codex) e 45,268 (DeepSeek V4 Pro 0423). Estamos falando de um quarto a um terço da régua.
Vale a comparação com a alternativa mais barata acima de IQ 45 do catálogo: o DeepSeek V4 Pro 0423, que cobra US$ 1,74 por milhão de tokens de saída. Ou seja, se você precisa da régua dos 45 de inteligência, a fatura mais barata do mercado hoje é de US$ 1,74 por milhão de saída — e o Nemotron gratuito fica muito atrás nesse quesito.
Então o Nemotron 3 Nano Omni não compete com o topo. Compete com a conta.
Onde isso encaixa no tabuleiro de hoje
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Nemotron 3 Nano Omni (free) (o novo) | 15.0 | 0 | 0 | 256k |
| Gemini 3.1 Pro Preview | 47.7 | 2 | 12 | 1.05M |
| GPT-5.3-Codex | 45.5 | 1.75 | 14 | 400k |
| DeepSeek V4 Pro 0423 | 45.3 | 1.0423 | 2.0845 | 1.05M |
Em 28 de abril de 2026, o catálogo soma mais de 431 modelos listados (piso — modelos removidos depois não aparecem), 60 criadores e 56 lançamentos só nos últimos 30 dias. O topo de inteligência tem Google, OpenAI e DeepSeek na régua dos 45. A NVIDIA entra hoje não nessa faixa — entra na faixa do "free multimodal de alta velocidade", onde a régua de capacidade é outra conversa.
O que muda (e o que não muda) para quem paga a API
Se você paga a conta, vale separar.
Vale a pena olhar — qualquer fluxo multimodal onde a inteligência bruta não é o gargalo: transcrição de reunião com imagens e áudio juntos, triagem de chamados com anexo de vídeo, pré-classificação de documentos, agente de percepção alimentando outro modelo maior. Como sub-agente dentro de um sistema maior, encaixa bem. O fato de os pesos serem abertos também abre portas para rodar local, sem fatura nenhuma.
Não muda nada — se você precisa do topo de raciocínio, coding agentic de ponta ou respostas que dependam de uma régua de inteligência acima dos 45, o Nemotron 3 Nano Omni não entra nessa briga. O Gemini 3.1 Pro Preview, o GPT-5.3-Codex e o DeepSeek V4 Pro continuam sendo as referências — e continuam custando alguma coisa.
A implicação prática é direta: hoje existe, no catálogo, uma opção multimodal, de pesos abertos e grátis, com velocidade alta e inteligência modesta. Não substitui o cérebro da operação — mas dá para testar pipelines multimodais sem colocar nada na fatura.
Trate o Nemotron 3 Nano Omni como um sub-agente multimodal gratuito de alta velocidade dentro de um pipeline maior — para raciocínio de ponta, a conta continua sendo outra.
Perguntas frequentes
O Nemotron 3 Nano Omni substitui o Gemini 3.1 Pro ou o GPT-5.3?
Não. O índice de inteligência dele é 15,007; o do Gemini 3.1 Pro Preview está em 47,738 e o do GPT-5.3-Codex em 45,512. Para tarefas que pedem raciocínio de ponta, o topo do mercado continua sendo outra conversa — e outra fatura.
Dá para rodar o Nemotron 3 Nano Omni localmente?
Os pesos são abertos. O modelo declara 30B totais com 3B ativos por inferência (arquitetura MoE), o que reduz a exigência de VRAM em relação a um 30B denso. A vantagem de ser open weights é exatamente rodar sem fatura, quando o hardware permitir.
Por que a NVIDIA lançou um modelo com inteligência tão baixa?
A descrição oficial do catálogo o posiciona como sub-agente de percepção e contexto dentro de sistemas agentes empresariais — olho e ouvido da operação, não cérebro. A inteligência modesta é compatível com esse papel de pré-processamento multimodal, não de resposta final.