FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

gpt-oss-20b custa 13 cents; Nemotron Nano 2 VL custa 60. E aí?

Dois modelos abertos da mesma geração, preços muito diferentes, e uma escolha que não se resume a centavos por milhão de tokens.

Redação FalaVIP IA 3 min de leitura
US$ 0,13preço de saída por milhão de tokens do gpt-oss-20b
US$ 0,60preço de saída por milhão de tokens do Nemotron Nano 2 VL
15,2 × 8,8índice de inteligência (gpt-oss-20b vs Nemotron Nano 2 VL)

Pareceu bom demais quando você viu 0,13 dólares por milhão de tokens de saída. Aí você abre a ficha do concorrente do lado e o número é 0,60 — quase cinco vezes mais. Antes de decidir pelo mais barato, vale olhar o que está dentro desse pacote.

O que cada um é, de verdade

O gpt-oss-20b é um modelo aberto da OpenAI, lançado em 5 de agosto de 2025, sob Apache 2.0. Tem 21 bilhões de parâmetros totais, mas só 3,6 bilhões ativos por passada — é Mixture-of-Experts, então cada token acorda só uma fração da rede. É texto puro, raciocina, e o índice de inteligência Artificial Analysis marca 15,2. Velocidade: 112,6 tokens por segundo.

O Nemotron Nano 12B 2 VL é da NVIDIA, chegou em 28 de outubro de 2025, também aberto. São 13,2 bilhões de parâmetros, todos ativos (não é MoE), e a diferença que muda tudo: ele é multimodal — aceita texto, imagem e vídeo, e devolve texto. O índice de inteligência fica em 8,8, e a velocidade cai para 42,84 tokens por segundo, menos da metade do rival.

Índice de inteligência (Artificial Analysis)
gpt-oss-20b15,2Nemotron Nano 12B 2 VL8,8índice
Fonte: Artificial Analysis

A conta que ninguém gosta de fazer

Preço de entrada do gpt-oss-20b: US$ 0,03 por milhão de tokens. Do Nemotron Nano 2 VL: US$ 0,20. Na saída, a diferença fica gritante: 0,13 contra 0,60 dólares por milhão. Para um job de 10 milhões de tokens de saída, são US$ 1,30 contra US$ 6,00.

Preço de saída (US$ por milhão de tokens)
gpt-oss-20b0,13Nemotron Nano 12B 2 VL0,6US$/M
Fonte: OpenRouter

O blended do gpt-oss-20b fica em US$ 0,0925 por milhão — é um dos menores do catálogo. O do Nemotron Nano 2 VL está em US$ 0,30, mais que o triplo. Mas o blended mistura entrada e saída numa proporção fixa; se o seu caso é leitura de vídeo, a conta real vai depender de quanto você gasta processando imagem.

Onde cada um ganha

O gpt-oss-20b ganha em três frentes que importam para o desenvolvedor que paga API: preço, velocidade e nota de inteligência. É texto puro, então entra em qualquer pipeline clássico — classificação, extração, agentes, geração. O raciocínio é nativo, e o índice 15,2 coloca ele acima de qualquer modelo pequeno do catálogo de hoje, empatando com o irmão maior gpt-oss-120b na faixa dos 24 pontos quando você considera só a régua de raciocínio.

O Nemotron Nano 2 VL ganha onde o outro nem entra: multimodal. Se o seu fluxo recebe imagem ou vídeo — análise de documento escaneado, sumarização de frames, OCR de página inteira — o gpt-oss-20b não resolve, porque é text-only. O Nemotron lê o vídeo, devolve texto, e ainda raciocina sobre o que viu. A nota de inteligência menor (8,8) é o custo de aceitar três modalidades em 13 bilhões de parâmetros.

gpt-oss-20b × Nemotron Nano 12B 2 VL
Critériogpt-oss-20bNemotron Nano 12B 2 VL
Índice de inteligência15.28.8
Entrada US$/M0.030.2
Saída US$/M0.130.6
Contexto131k131k
Pesos abertossimsim
Velocidade (tok/s)11343
Índice de código20.7
Índice agêntico3.1

O que isso muda no seu bolso

Se o seu caso é só texto e o gargalo é custo, a escolha é simples: gpt-oss-20b, sem pensar duas vezes. É cinco vezes mais barato na saída, três vezes mais rápido, e com nota de inteligência 73% maior.

Se o seu caso envolve vídeo ou imagem e você estava pensando em cascatear para um modelo de visão separado, teste o Nemotron Nano 2 VL antes. Pode ser que um modelo só, multimodal, com raciocínio, substitua dois na pipeline — e o US$ 0,60 por milhão de saída começa a fazer sentido.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 269 modelos disponíveis no catálogo nesta data.

E um detalhe que costuma escapar: ambos são open weights. Você pode baixar, hospedar e pagar só a infraestrutura — aí a comparação de preço de API vira comparação de VRAM. O gpt-oss-20b roda em GPU única de 24 GB; o Nemotron Nano 2 VL, pelos 13,2 bilhões densos, também cabe em hardware parecido. Quem tem GPU parada no escritório tem um caminho que não passa pela fatura da API.

Veredito

gpt-oss-20b ganha em qualquer tarefa puramente textual — preço, velocidade e inteligência andam juntos do mesmo lado. Nemotron Nano 12B 2 VL ganha quando entra vídeo ou imagem na pipeline — é o único dos dois que abre esse arquivo. A escolha não é sobre centavos: é sobre qual formato de dado você precisa processar.

Em uma frase

Texto puro e baixo custo: gpt-oss-20b. Vídeo ou imagem no fluxo: Nemotron Nano 2 VL, sem pensar em cascata.

Perguntas frequentes

Qual a diferença de preço entre gpt-oss-20b e Nemotron Nano 12B 2 VL?

O gpt-oss-20b cobra US$ 0,03 por milhão de tokens de entrada e US$ 0,13 por milhão de saída. O Nemotron Nano 12B 2 VL cobra US$ 0,20 de entrada e US$ 0,60 de saída — quase cinco vezes mais caro na saída.

O Nemotron Nano 12B 2 VL aceita vídeo?

Sim. É um modelo multimodal que recebe texto, imagem e vídeo e devolve texto. O gpt-oss-20b é text-only, então qualquer fluxo com vídeo precisa de outro modelo.

Os dois modelos são open weights?

Sim. O gpt-oss-20b é distribuído sob Apache 2.0 e o Nemotron Nano 12B 2 VL também tem pesos abertos, o que permite hospedar localmente em vez de pagar API.

Leia também