Codex cobra quase 6× mais que Nemotron 3 Ultra por token de saída
Mesmo com IQ maior, o modelo da OpenAI perde da NVIDIA em preço e em janela de contexto para a maioria dos projetos.
Você já deve ter visto o argumento clássico: "o modelo mais inteligente ganha". Em junho de 2026, essa frase precisa ser testada contra a conta da API. Coloquei lado a lado dois modelos americanos com raciocínio ativo, mesma família de preço "enterprise", mas filosofias opostas: o GPT-5.3-Codex, da OpenAI, e o Nemotron 3 Ultra, da NVIDIA, lançado há exatamente uma semana.
A diferença que aparece na fatura
O GPT-5.3-Codex cobra US$ 1,75 por milhão de tokens de entrada e US$ 14 por milhão de tokens de saída. O Nemotron 3 Ultra cobra US$ 0,60 e US$ 2,40, respectivamente. Em cache, a diferença segue o mesmo padrão: US$ 0,175 contra US$ 0,12. Traduzindo: para cada mil tokens que o modelo cospe na tela, você paga R$ 70 com Codex e R$ 12 com Nemotron, na cotação de hoje. É quase seis vezes mais.
E aqui entra o detalhe que o release da OpenAI não grita: o Nemotron também é um modelo de raciocínio, com 55 bilhões de parâmetros ativos em uma rede MoE de 550 bilhões, híbrida Transformer-Mamba. Não é um modelo pequeno disfarçado de grande.
Inteligência medida, sem promessa de marketing
O índice de inteligência da Artificial Analysis coloca o GPT-5.3-Codex em 45,5 e o Nemotron 3 Ultra em 38,3. É uma diferença real, mas precisa ser lida no contexto do catálogo: o Codex está no top 4 global, junto com Claude Fable 5, Gemini 3.1 Pro e Gemini 3.5 Flash. O Nemotron está abaixo da linha dos 45, onde aparecem os modelos de fronteira.
Onde o Nemotron compensa é em benchmarks específicos de código: 49,3 no Coding Index, contra o índice geral de 38,3. Isso sugere que, para tarefas de engenharia de software bem definidas, o modelo da NVIDIA entrega mais do que o número geral deixa transparecer.
Contexto, modalidade e o detalhe que decide o projeto
A janela do Codex é de 400 mil tokens. A do Nemotron é de 262 mil. Para a maioria dos projetos — agentes lendo um repositório, sumarizando um PDF grande, mantendo histórico de conversa longo — 262 mil tokens já é folgado. Os 400 mil do Codex só fazem diferença quando você literalmente precisa enfiar uma codebase inteira em uma única janela.
A modalidade é onde a balança pesa mais: o GPT-5.3-Codex aceita texto, imagem e arquivo como entrada e devolve texto. O Nemotron 3 Ultra é estritamente texto→texto. Se o seu fluxo depende de mandar print de erro, diagrama ou PDF, o Nemotron está fora do jogo.
| Critério | GPT-5.3-Codex | Nemotron 3 Ultra |
|---|---|---|
| Índice de inteligência | 45.5 | 38.3 |
| Entrada US$/M | 1.75 | 0.6 |
| Saída US$/M | 14 | 2.4 |
| Contexto | 400k | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 118 | 116 |
| Índice de código | — | 49.3 |
| Índice agêntico | — | 27.5 |
Onde cada um ganha — sem "depende"
Codex ganha quando você precisa de multimodalidade nativa, quer a maior janela de contexto disponível entre os dois e topa pagar o premium pela diferença de 7 pontos no índice geral. Times pequenos que rodam baixo volume e precisam de visão enxergam o custo extra como aceitável.
Nemotron 3 Ultra ganha quando o trabalho é predominantemente texto, o orçamento mensal de API é o gargalo real e você quer manter o modelo dentro da própria infraestrutura — os pesos são abertos, ao contrário do Codex. Para empresas que já rodam cluster NVIDIA e podem hospedar o modelo, o argumento de preço da API é só o começo da economia.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiniMax M3 | 45.4 | 1.2 |
O que você faz com isso amanhã
Se você está decidindo entre os dois hoje, a pergunta certa não é "qual é mais inteligente?", é "quanto do meu tráfego é texto puro e cabe em 262 mil tokens?". Se a resposta for "quase tudo", Nemotron. Se for "não, preciso mandar imagem e PDF", Codex. E se a resposta for "depende do dia" — aí vale rodar os dois em paralelo por uma semana e medir custo por tarefa concluída, não por token gasto.
Codex vale o premium só se você precisa de multimodalidade e da janela de 400k tokens; para o resto, o Nemotron 3 Ultra entrega raciocínio de fronteira por um sexto do preço e com pesos abertos.
Perguntas frequentes
GPT-5.3-Codex ou Nemotron 3 Ultra: qual é mais barato?
O Nemotron 3 Ultra é mais barato em todas as modalidades: US$ 0,60 por milhão de tokens de entrada contra US$ 1,75 do Codex, e US$ 2,40 por milhão de saída contra US$ 14. No total, sai por cerca de um sexto do preço do Codex.
O Nemotron 3 Ultra serve para código?
Serve, e tem benchmark específico de Coding Index de 49,3, acima do índice geral de inteligência de 38,3. É um modelo de raciocínio com 55B de parâmetros ativos em arquitetura MoE híbrida Transformer-Mamba, otimizado para tarefas agentic.
Posso rodar o Nemotron 3 Ultra localmente?
Sim. O Nemotron 3 Ultra tem pesos abertos (open weights), diferentemente do GPT-5.3-Codex. Rodar localmente exige hardware compatível com um MoE de 550B parâmetros totais, o que na prática significa cluster com GPUs NVIDIA de alto VRAM.