FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Nemotron 3 Nano Omni chega grátis e multimodal — inteligência paga o preço

Lançamento da NVIDIA aceita texto, imagem, áudio e vídeo por US$ 0 de entrada e saída, mas o índice de inteligência fica em 15, bem abaixo dos 45 do topo do mercado

Redação FalaVIP IA 3 min de leitura
US$ 0preço de entrada e saída por milhão de tokens
15,007índice de inteligência (frente aos 47,7 do Gemini 3.1 Pro Preview)
326,83 t/svelocidade publicada pelo catálogo

A NVIDIA colocou no catálogo, hoje, um modelo que custa US$ 0 para entrar e US$ 0 para sair: o Nemotron 3 Nano Omni (free). Em tempos de fatura de API, isso sempre merece um clique. A pergunta de sempre, porém, é a mesma: grátis de que forma?

A conta de entrada e saída é zero — mas o que vem de brinde?

Preço de saída (US$ por milhão de tokens)
Gemini 3.1 Pro Preview12GPT-5.3-Codex14DeepSeek V4 Pro 04232,0845US$/M
Fonte: OpenRouter

Para chamar de "free" de verdade, três coisas precisam estar zeradas: o preço de entrada, o de saída e a leitura em cache. No Nemotron 3 Nano Omni, o catálogo marca in_per_m = 0 e out_per_m = 0. O cache_per_m veio nulo — quando o catálogo não publica o valor, a leitura honesta é: não há informação disponível, então não dá para cravar. Dos três, dois estão oficialmente em zero.

Traduzindo: se você mandar um vídeo de 10 minutos ou um PDF com imagens, o custo de processamento não passa pela fatura — passa pela fila. E a fila anda rápido: a velocidade publicada é de 326,83 tokens por segundo, número alto mesmo para um modelo pequeno.

Multimodal completo, pesos abertos, 256k de contexto

Esse é o pacote que não se costuma ver junto num modelo free. O Nemotron 3 Nano Omni aceita texto, imagem, áudio e vídeo, e devolve só texto. A janela de contexto é de 256 mil tokens. Os pesos são abertos — você pode baixar e rodar local se tiver GPU sobrando.

Por baixo do capô, são 30 bilhões de parâmetros totais com apenas 3 bilhões ativos por inferência. É a pegada MoE (mistura de especialistas): o modelo "tem" 30B, mas só pensa com 3B a cada passo. Daí a velocidade. A NVIDIA o descreve, no próprio catálogo, como um sub-agente de percepção e contexto dentro de sistemas agentes empresariais — ou seja, não é o cérebro da operação, é o olho e o ouvido.

O preço que se paga é em inteligência

Índice de inteligência (Artificial Analysis)
Nemotron 3 Nano Omni (free)15Gemini 3.1 Pro Preview47,7GPT-5.3-Codex45,5DeepSeek V4 Pro 042345,3índice
Fonte: Artificial Analysis

Pagar US$ 0 não significa receber US$ 0 de capacidade. O índice de inteligência do Nemotron 3 Nano Omni hoje é 15,007. Em coding, 13,754. Para efeito de régua: o topo do mercado está em 47,738 (Gemini 3.1 Pro Preview), 45,512 (GPT-5.3-Codex) e 45,268 (DeepSeek V4 Pro 0423). Estamos falando de um quarto a um terço da régua.

Inteligência × preço de saída
Gemini 3.1 Pro PreviewGPT-5.3-CodexDeepSeek V4 Pro 0423US$ por milhão (saída, escala log)índice de inteligência

Vale a comparação com a alternativa mais barata acima de IQ 45 do catálogo: o DeepSeek V4 Pro 0423, que cobra US$ 1,74 por milhão de tokens de saída. Ou seja, se você precisa da régua dos 45 de inteligência, a fatura mais barata do mercado hoje é de US$ 1,74 por milhão de saída — e o Nemotron gratuito fica muito atrás nesse quesito.

Então o Nemotron 3 Nano Omni não compete com o topo. Compete com a conta.

Onde isso encaixa no tabuleiro de hoje

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Nemotron 3 Nano Omni (free) (o novo)15.000256k
Gemini 3.1 Pro Preview47.72121.05M
GPT-5.3-Codex45.51.7514400k
DeepSeek V4 Pro 042345.31.04232.08451.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Em 28 de abril de 2026, o catálogo soma mais de 431 modelos listados (piso — modelos removidos depois não aparecem), 60 criadores e 56 lançamentos só nos últimos 30 dias. O topo de inteligência tem Google, OpenAI e DeepSeek na régua dos 45. A NVIDIA entra hoje não nessa faixa — entra na faixa do "free multimodal de alta velocidade", onde a régua de capacidade é outra conversa.

O que muda (e o que não muda) para quem paga a API

Se você paga a conta, vale separar.

Vale a pena olhar — qualquer fluxo multimodal onde a inteligência bruta não é o gargalo: transcrição de reunião com imagens e áudio juntos, triagem de chamados com anexo de vídeo, pré-classificação de documentos, agente de percepção alimentando outro modelo maior. Como sub-agente dentro de um sistema maior, encaixa bem. O fato de os pesos serem abertos também abre portas para rodar local, sem fatura nenhuma.

Não muda nada — se você precisa do topo de raciocínio, coding agentic de ponta ou respostas que dependam de uma régua de inteligência acima dos 45, o Nemotron 3 Nano Omni não entra nessa briga. O Gemini 3.1 Pro Preview, o GPT-5.3-Codex e o DeepSeek V4 Pro continuam sendo as referências — e continuam custando alguma coisa.

A implicação prática é direta: hoje existe, no catálogo, uma opção multimodal, de pesos abertos e grátis, com velocidade alta e inteligência modesta. Não substitui o cérebro da operação — mas dá para testar pipelines multimodais sem colocar nada na fatura.

Em uma frase

Trate o Nemotron 3 Nano Omni como um sub-agente multimodal gratuito de alta velocidade dentro de um pipeline maior — para raciocínio de ponta, a conta continua sendo outra.

Perguntas frequentes

O Nemotron 3 Nano Omni substitui o Gemini 3.1 Pro ou o GPT-5.3?

Não. O índice de inteligência dele é 15,007; o do Gemini 3.1 Pro Preview está em 47,738 e o do GPT-5.3-Codex em 45,512. Para tarefas que pedem raciocínio de ponta, o topo do mercado continua sendo outra conversa — e outra fatura.

Dá para rodar o Nemotron 3 Nano Omni localmente?

Os pesos são abertos. O modelo declara 30B totais com 3B ativos por inferência (arquitetura MoE), o que reduz a exigência de VRAM em relação a um 30B denso. A vantagem de ser open weights é exatamente rodar sem fatura, quando o hardware permitir.

Por que a NVIDIA lançou um modelo com inteligência tão baixa?

A descrição oficial do catálogo o posiciona como sub-agente de percepção e contexto dentro de sistemas agentes empresariais — olho e ouvido da operação, não cérebro. A inteligência modesta é compatível com esse papel de pré-processamento multimodal, não de resposta final.

Leia também