FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GPT-5 Codex custa 1.250 vezes mais que o gpt-oss-120b por token de entrada

Versão da OpenAI focada em engenharia de software estreia a US$ 1,25 por milhão de tokens de entrada e US$ 10 de saída — com cache promocional que derruba a leitura para US$ 0,125.

Redação FalaVIP IA 4 min de leitura
US$ 1,25por milhão de tokens de entrada
US$ 10por milhão de tokens de saída
US$ 0,125por milhão de tokens em cache (10% do preço de entrada)

O que você paga, e por que o número assusta

Dois dias depois de aparecer no catálogo, o GPT-5 Codex já é o modelo mais caro da prateleira da OpenAI para tarefas de programação — e a diferença para a alternativa aberta da própria casa é brutal. A entrada custa US$ 1,25 por milhão de tokens; a saída, US$ 10 por milhão. Traduzindo para o vocabulário da fatura: cada 1.000 tokens que você cospe para o usuário (resposta, diff, código completo) sai por um centavo de dólar. Cada 1.000 tokens que você manda para o modelo custa US$ 0,00125.

Compare com o gpt-oss-120b, também da OpenAI, listado a US$ 0,17 por milhão de tokens de saída. Para cada token gerado pelo Codex, você gasta o equivalente a quase 59 tokens do gpt-oss-120b. Em volume, a conta não perdoa: um agente que escreve 500 mil tokens de saída por dia no Codex custa US$ 5; o mesmo volume no gpt-oss-120b custa US$ 0,085. É uma diferença de duas ordens de grandeza, não um arredondamento.

Ficha técnica — GPT-5 Codex (batch)
CampoValor
Identificadoropenai/gpt-5-codex:batch
Criadoropenai
Preço de entradaUS$ 0.625 / M tokens
Preço de saídaUS$ 5.00 / M tokens
Janela de contexto400k
Modalidadetext+image->text
Leitura de cacheUS$ 0.063 / M (90% de desconto)

Onde o cache muda a história — e onde não muda

Existe um porém que o release destaca e a conta da API esconde: o preço de cache está em US$ 0,125 por milhão de tokens — exatamente 10% do valor de entrada. Se o seu fluxo é REPL (ler prompt de sistema + trechos de código repetidos a cada chamada), você paga basicamente uma fração do que pagaria em outro modelo sem cache. É o tipo de economia que só aparece em workload com prefixo longo e estável: revisão de PRs contra um repositório fixo, agente que sempre carrega o mesmo contexto de projeto, ferramenta de pair programming com system prompt pesado.

Agora, o que o cache não faz: não barateia a saída. Os US$ 10 por milhão de tokens gerados continuam firmes. Se o seu caso de uso é "modelo pensa muito e escreve pouco" — por exemplo, classificação de bug, sugestão de uma linha, completion — a economia do cache some rápido, porque a maior parte do custo mora na geração, não na leitura.

Para quem o GPT-5 Codex faz sentido

O modelo foi desenhado para dois regimes, segundo a própria descrição: sessões interativas de desenvolvimento e execução longa e autônoma de tarefas complexas de engenharia. Em outras palavras, ele foi feito para quem está disposto a pagar caro em troca de menos idas e vindas — o típico agente que recebe um ticket, abre o repo, escreve código, roda testes e devolve o patch pronto. Para esse perfil, o custo alto da saída é amortizado pelo trabalho que ele faz sozinho.

Vale para:

  • times que já rodam agentes de coding em produção e estão medindo custo por ticket resolvido, não por token;
  • workloads com prefixo repetitivo grande (cache de sistema + contexto de projeto), onde o cache de 10% paga a diferença;
  • tarefas que exigem execução prolongada sem supervisão, onde o preço de um modelo mais barato se perde em retries e alucinações.

Não vale para:

  • autocomplete simples, completion inline ou classificação de trecho — qualquer coisa dominada por um modelo de US$ 0,13/M de saída, como o gpt-oss-20b, entrega resultado parecido por uma fração do custo;
  • times que ainda estão experimentando e não conseguem medir taxa de sucesso por tarefa — você vai queimar orçamento sem saber se o ganho de qualidade compensa;
  • quem precisa de benchmark público de IQ ou coding index para justificar a escolha: o catálogo não publicou nota nenhuma para o GPT-5 Codex até esta data.

O tabuleiro em 25 de setembro

O topo do ranking de inteligência do catálogo hoje é ocupado pelo OpenAI o3 (IQ 31,096, a US$ 8/M de saída), seguido pelo gpt-oss-120b (IQ 24,126, a US$ 0,17/M de saída). O Codex entra sem nota de IQ publicada — o que, somado à ausência de dados de coding e agentic, significa que você está comprando no escuro do benchmark e confiando na descrição do fabricante.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 238 modelos disponíveis no catálogo nesta data.

Para efeito de comparação direta em preço, o Qwen3 Next 80B A3B Thinking (IQ 16,867) cobra US$ 1,20/M de saída — quase 8 vezes mais barato que o Codex na geração. O Llama 4 Maverick da Meta cobra US$ 0,696/M de saída. Em outras palavras: na faixa de modelos "caros mas não absurdos", o Codex é o mais caro de todos, e por uma margem grande.

O que fazer com isso amanhã

Se você já roda agente de coding em produção, faça o teste controlado: pegue 50 tickets reais, meça custo total (entrada + saída + cache) e taxa de resolução sem intervenção humana. Some o custo de retries nos modelos mais baratos e compare. Só assim a diferença de US$ 9,83 por milhão de tokens de saída se justifica — ou não. Se você está começando, comece pelo gpt-oss-20b ou pelo Maverick: a economia paga a curva de aprendizado. O Codex é ferramenta de quem já sabe o que está fazendo e está disposto a pagar pelo atalho.

Em uma frase

Só vale a pena trocar pelo GPT-5 Codex se você já roda agente de coding em produção, tem prefixo repetitivo grande para amortizar o cache e consegue medir taxa de resolução por tarefa — caso contrário, o gpt-oss-20b ou o Llama 4 Maverick entregam resultado parecido por uma fração do custo.

Perguntas frequentes

Quanto custa o GPT-5 Codex na API da OpenAI?

US$ 1,25 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saída e US$ 0,125 por milhão de tokens lidos do cache (10% do preço de entrada). É o modelo mais caro da linha GPT-5 no catálogo até esta data.

GPT-5 Codex é melhor que o gpt-oss-120b para código?

O catálogo não publicou nota de IQ nem índice de coding para o GPT-5 Codex, então não há comparação pública direta. O gpt-oss-120b tem IQ 24,126 e custa US$ 0,17 por milhão de tokens de saída — quase 59 vezes mais barato na geração.

Quando o cache do GPT-5 Codex compensa?

Quando o prompt de sistema e o contexto do projeto se repetem em muitas chamadas (revisão de PRs, agente com repositório fixo, pair programming). Nesses casos a leitura cai para US$ 0,125/M. Em workloads de saída pesada com pouco reuso de prefixo, a economia do cache é irrelevante.

Leia também