gpt-oss-20b custa 13 cents; Nemotron Nano 2 VL custa 60. E aí?
Dois modelos abertos da mesma geração, preços muito diferentes, e uma escolha que não se resume a centavos por milhão de tokens.
Pareceu bom demais quando você viu 0,13 dólares por milhão de tokens de saída. Aí você abre a ficha do concorrente do lado e o número é 0,60 — quase cinco vezes mais. Antes de decidir pelo mais barato, vale olhar o que está dentro desse pacote.
O que cada um é, de verdade
O gpt-oss-20b é um modelo aberto da OpenAI, lançado em 5 de agosto de 2025, sob Apache 2.0. Tem 21 bilhões de parâmetros totais, mas só 3,6 bilhões ativos por passada — é Mixture-of-Experts, então cada token acorda só uma fração da rede. É texto puro, raciocina, e o índice de inteligência Artificial Analysis marca 15,2. Velocidade: 112,6 tokens por segundo.
O Nemotron Nano 12B 2 VL é da NVIDIA, chegou em 28 de outubro de 2025, também aberto. São 13,2 bilhões de parâmetros, todos ativos (não é MoE), e a diferença que muda tudo: ele é multimodal — aceita texto, imagem e vídeo, e devolve texto. O índice de inteligência fica em 8,8, e a velocidade cai para 42,84 tokens por segundo, menos da metade do rival.
A conta que ninguém gosta de fazer
Preço de entrada do gpt-oss-20b: US$ 0,03 por milhão de tokens. Do Nemotron Nano 2 VL: US$ 0,20. Na saída, a diferença fica gritante: 0,13 contra 0,60 dólares por milhão. Para um job de 10 milhões de tokens de saída, são US$ 1,30 contra US$ 6,00.
O blended do gpt-oss-20b fica em US$ 0,0925 por milhão — é um dos menores do catálogo. O do Nemotron Nano 2 VL está em US$ 0,30, mais que o triplo. Mas o blended mistura entrada e saída numa proporção fixa; se o seu caso é leitura de vídeo, a conta real vai depender de quanto você gasta processando imagem.
Onde cada um ganha
O gpt-oss-20b ganha em três frentes que importam para o desenvolvedor que paga API: preço, velocidade e nota de inteligência. É texto puro, então entra em qualquer pipeline clássico — classificação, extração, agentes, geração. O raciocínio é nativo, e o índice 15,2 coloca ele acima de qualquer modelo pequeno do catálogo de hoje, empatando com o irmão maior gpt-oss-120b na faixa dos 24 pontos quando você considera só a régua de raciocínio.
O Nemotron Nano 2 VL ganha onde o outro nem entra: multimodal. Se o seu fluxo recebe imagem ou vídeo — análise de documento escaneado, sumarização de frames, OCR de página inteira — o gpt-oss-20b não resolve, porque é text-only. O Nemotron lê o vídeo, devolve texto, e ainda raciocina sobre o que viu. A nota de inteligência menor (8,8) é o custo de aceitar três modalidades em 13 bilhões de parâmetros.
| Critério | gpt-oss-20b | Nemotron Nano 12B 2 VL |
|---|---|---|
| Índice de inteligência | 15.2 | 8.8 |
| Entrada US$/M | 0.03 | 0.2 |
| Saída US$/M | 0.13 | 0.6 |
| Contexto | 131k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 113 | 43 |
| Índice de código | 20.7 | — |
| Índice agêntico | 3.1 | — |
O que isso muda no seu bolso
Se o seu caso é só texto e o gargalo é custo, a escolha é simples: gpt-oss-20b, sem pensar duas vezes. É cinco vezes mais barato na saída, três vezes mais rápido, e com nota de inteligência 73% maior.
Se o seu caso envolve vídeo ou imagem e você estava pensando em cascatear para um modelo de visão separado, teste o Nemotron Nano 2 VL antes. Pode ser que um modelo só, multimodal, com raciocínio, substitua dois na pipeline — e o US$ 0,60 por milhão de saída começa a fazer sentido.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
E um detalhe que costuma escapar: ambos são open weights. Você pode baixar, hospedar e pagar só a infraestrutura — aí a comparação de preço de API vira comparação de VRAM. O gpt-oss-20b roda em GPU única de 24 GB; o Nemotron Nano 2 VL, pelos 13,2 bilhões densos, também cabe em hardware parecido. Quem tem GPU parada no escritório tem um caminho que não passa pela fatura da API.
Veredito
gpt-oss-20b ganha em qualquer tarefa puramente textual — preço, velocidade e inteligência andam juntos do mesmo lado. Nemotron Nano 12B 2 VL ganha quando entra vídeo ou imagem na pipeline — é o único dos dois que abre esse arquivo. A escolha não é sobre centavos: é sobre qual formato de dado você precisa processar.
Texto puro e baixo custo: gpt-oss-20b. Vídeo ou imagem no fluxo: Nemotron Nano 2 VL, sem pensar em cascata.
Perguntas frequentes
Qual a diferença de preço entre gpt-oss-20b e Nemotron Nano 12B 2 VL?
O gpt-oss-20b cobra US$ 0,03 por milhão de tokens de entrada e US$ 0,13 por milhão de saída. O Nemotron Nano 12B 2 VL cobra US$ 0,20 de entrada e US$ 0,60 de saída — quase cinco vezes mais caro na saída.
O Nemotron Nano 12B 2 VL aceita vídeo?
Sim. É um modelo multimodal que recebe texto, imagem e vídeo e devolve texto. O gpt-oss-20b é text-only, então qualquer fluxo com vídeo precisa de outro modelo.
Os dois modelos são open weights?
Sim. O gpt-oss-20b é distribuído sob Apache 2.0 e o Nemotron Nano 12B 2 VL também tem pesos abertos, o que permite hospedar localmente em vez de pagar API.