FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Codex cobra quase 6× mais que Nemotron 3 Ultra por token de saída

Mesmo com IQ maior, o modelo da OpenAI perde da NVIDIA em preço e em janela de contexto para a maioria dos projetos.

Redação FalaVIP IA 3 min de leitura
US$ 14preço de saída por milhão de tokens do GPT-5.3-Codex
US$ 2,40preço de saída por milhão de tokens do Nemotron 3 Ultra
45,5 × 38,3índice de inteligência Artificial Analysis (Codex × Nemotron)

Você já deve ter visto o argumento clássico: "o modelo mais inteligente ganha". Em junho de 2026, essa frase precisa ser testada contra a conta da API. Coloquei lado a lado dois modelos americanos com raciocínio ativo, mesma família de preço "enterprise", mas filosofias opostas: o GPT-5.3-Codex, da OpenAI, e o Nemotron 3 Ultra, da NVIDIA, lançado há exatamente uma semana.

A diferença que aparece na fatura

O GPT-5.3-Codex cobra US$ 1,75 por milhão de tokens de entrada e US$ 14 por milhão de tokens de saída. O Nemotron 3 Ultra cobra US$ 0,60 e US$ 2,40, respectivamente. Em cache, a diferença segue o mesmo padrão: US$ 0,175 contra US$ 0,12. Traduzindo: para cada mil tokens que o modelo cospe na tela, você paga R$ 70 com Codex e R$ 12 com Nemotron, na cotação de hoje. É quase seis vezes mais.

Preço de saída (US$ por milhão de tokens)
GPT-5.3-Codex14Nemotron 3 Ultra2,4US$/M
Fonte: OpenRouter

E aqui entra o detalhe que o release da OpenAI não grita: o Nemotron também é um modelo de raciocínio, com 55 bilhões de parâmetros ativos em uma rede MoE de 550 bilhões, híbrida Transformer-Mamba. Não é um modelo pequeno disfarçado de grande.

Inteligência medida, sem promessa de marketing

O índice de inteligência da Artificial Analysis coloca o GPT-5.3-Codex em 45,5 e o Nemotron 3 Ultra em 38,3. É uma diferença real, mas precisa ser lida no contexto do catálogo: o Codex está no top 4 global, junto com Claude Fable 5, Gemini 3.1 Pro e Gemini 3.5 Flash. O Nemotron está abaixo da linha dos 45, onde aparecem os modelos de fronteira.

Índice de inteligência (Artificial Analysis)
GPT-5.3-Codex45,5Nemotron 3 Ultra38,3índice
Fonte: Artificial Analysis

Onde o Nemotron compensa é em benchmarks específicos de código: 49,3 no Coding Index, contra o índice geral de 38,3. Isso sugere que, para tarefas de engenharia de software bem definidas, o modelo da NVIDIA entrega mais do que o número geral deixa transparecer.

Contexto, modalidade e o detalhe que decide o projeto

A janela do Codex é de 400 mil tokens. A do Nemotron é de 262 mil. Para a maioria dos projetos — agentes lendo um repositório, sumarizando um PDF grande, mantendo histórico de conversa longo — 262 mil tokens já é folgado. Os 400 mil do Codex só fazem diferença quando você literalmente precisa enfiar uma codebase inteira em uma única janela.

A modalidade é onde a balança pesa mais: o GPT-5.3-Codex aceita texto, imagem e arquivo como entrada e devolve texto. O Nemotron 3 Ultra é estritamente texto→texto. Se o seu fluxo depende de mandar print de erro, diagrama ou PDF, o Nemotron está fora do jogo.

GPT-5.3-Codex × Nemotron 3 Ultra
CritérioGPT-5.3-CodexNemotron 3 Ultra
Índice de inteligência45.538.3
Entrada US$/M1.750.6
Saída US$/M142.4
Contexto400k262k
Pesos abertosnãosim
Velocidade (tok/s)118116
Índice de código49.3
Índice agêntico27.5

Onde cada um ganha — sem "depende"

Codex ganha quando você precisa de multimodalidade nativa, quer a maior janela de contexto disponível entre os dois e topa pagar o premium pela diferença de 7 pontos no índice geral. Times pequenos que rodam baixo volume e precisam de visão enxergam o custo extra como aceitável.

Nemotron 3 Ultra ganha quando o trabalho é predominantemente texto, o orçamento mensal de API é o gargalo real e você quer manter o modelo dentro da própria infraestrutura — os pesos são abertos, ao contrário do Codex. Para empresas que já rodam cluster NVIDIA e podem hospedar o modelo, o argumento de preço da API é só o começo da economia.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
MiniMax M345.41.2
Entre os 465 modelos disponíveis no catálogo nesta data.

O que você faz com isso amanhã

Se você está decidindo entre os dois hoje, a pergunta certa não é "qual é mais inteligente?", é "quanto do meu tráfego é texto puro e cabe em 262 mil tokens?". Se a resposta for "quase tudo", Nemotron. Se for "não, preciso mandar imagem e PDF", Codex. E se a resposta for "depende do dia" — aí vale rodar os dois em paralelo por uma semana e medir custo por tarefa concluída, não por token gasto.

Em uma frase

Codex vale o premium só se você precisa de multimodalidade e da janela de 400k tokens; para o resto, o Nemotron 3 Ultra entrega raciocínio de fronteira por um sexto do preço e com pesos abertos.

Perguntas frequentes

GPT-5.3-Codex ou Nemotron 3 Ultra: qual é mais barato?

O Nemotron 3 Ultra é mais barato em todas as modalidades: US$ 0,60 por milhão de tokens de entrada contra US$ 1,75 do Codex, e US$ 2,40 por milhão de saída contra US$ 14. No total, sai por cerca de um sexto do preço do Codex.

O Nemotron 3 Ultra serve para código?

Serve, e tem benchmark específico de Coding Index de 49,3, acima do índice geral de inteligência de 38,3. É um modelo de raciocínio com 55B de parâmetros ativos em arquitetura MoE híbrida Transformer-Mamba, otimizado para tarefas agentic.

Posso rodar o Nemotron 3 Ultra localmente?

Sim. O Nemotron 3 Ultra tem pesos abertos (open weights), diferentemente do GPT-5.3-Codex. Rodar localmente exige hardware compatível com um MoE de 550B parâmetros totais, o que na prática significa cluster com GPUs NVIDIA de alto VRAM.

Leia também