GPT-5 Codex custa 1.250 vezes mais que o gpt-oss-120b por token de entrada
Versão da OpenAI focada em engenharia de software estreia a US$ 1,25 por milhão de tokens de entrada e US$ 10 de saída — com cache promocional que derruba a leitura para US$ 0,125.
O que você paga, e por que o número assusta
Dois dias depois de aparecer no catálogo, o GPT-5 Codex já é o modelo mais caro da prateleira da OpenAI para tarefas de programação — e a diferença para a alternativa aberta da própria casa é brutal. A entrada custa US$ 1,25 por milhão de tokens; a saída, US$ 10 por milhão. Traduzindo para o vocabulário da fatura: cada 1.000 tokens que você cospe para o usuário (resposta, diff, código completo) sai por um centavo de dólar. Cada 1.000 tokens que você manda para o modelo custa US$ 0,00125.
Compare com o gpt-oss-120b, também da OpenAI, listado a US$ 0,17 por milhão de tokens de saída. Para cada token gerado pelo Codex, você gasta o equivalente a quase 59 tokens do gpt-oss-120b. Em volume, a conta não perdoa: um agente que escreve 500 mil tokens de saída por dia no Codex custa US$ 5; o mesmo volume no gpt-oss-120b custa US$ 0,085. É uma diferença de duas ordens de grandeza, não um arredondamento.
| Campo | Valor |
|---|---|
| Identificador | openai/gpt-5-codex:batch |
| Criador | openai |
| Preço de entrada | US$ 0.625 / M tokens |
| Preço de saída | US$ 5.00 / M tokens |
| Janela de contexto | 400k |
| Modalidade | text+image->text |
| Leitura de cache | US$ 0.063 / M (90% de desconto) |
Onde o cache muda a história — e onde não muda
Existe um porém que o release destaca e a conta da API esconde: o preço de cache está em US$ 0,125 por milhão de tokens — exatamente 10% do valor de entrada. Se o seu fluxo é REPL (ler prompt de sistema + trechos de código repetidos a cada chamada), você paga basicamente uma fração do que pagaria em outro modelo sem cache. É o tipo de economia que só aparece em workload com prefixo longo e estável: revisão de PRs contra um repositório fixo, agente que sempre carrega o mesmo contexto de projeto, ferramenta de pair programming com system prompt pesado.
Agora, o que o cache não faz: não barateia a saída. Os US$ 10 por milhão de tokens gerados continuam firmes. Se o seu caso de uso é "modelo pensa muito e escreve pouco" — por exemplo, classificação de bug, sugestão de uma linha, completion — a economia do cache some rápido, porque a maior parte do custo mora na geração, não na leitura.
Para quem o GPT-5 Codex faz sentido
O modelo foi desenhado para dois regimes, segundo a própria descrição: sessões interativas de desenvolvimento e execução longa e autônoma de tarefas complexas de engenharia. Em outras palavras, ele foi feito para quem está disposto a pagar caro em troca de menos idas e vindas — o típico agente que recebe um ticket, abre o repo, escreve código, roda testes e devolve o patch pronto. Para esse perfil, o custo alto da saída é amortizado pelo trabalho que ele faz sozinho.
Vale para:
- times que já rodam agentes de coding em produção e estão medindo custo por ticket resolvido, não por token;
- workloads com prefixo repetitivo grande (cache de sistema + contexto de projeto), onde o cache de 10% paga a diferença;
- tarefas que exigem execução prolongada sem supervisão, onde o preço de um modelo mais barato se perde em retries e alucinações.
Não vale para:
- autocomplete simples, completion inline ou classificação de trecho — qualquer coisa dominada por um modelo de US$ 0,13/M de saída, como o gpt-oss-20b, entrega resultado parecido por uma fração do custo;
- times que ainda estão experimentando e não conseguem medir taxa de sucesso por tarefa — você vai queimar orçamento sem saber se o ganho de qualidade compensa;
- quem precisa de benchmark público de IQ ou coding index para justificar a escolha: o catálogo não publicou nota nenhuma para o GPT-5 Codex até esta data.
O tabuleiro em 25 de setembro
O topo do ranking de inteligência do catálogo hoje é ocupado pelo OpenAI o3 (IQ 31,096, a US$ 8/M de saída), seguido pelo gpt-oss-120b (IQ 24,126, a US$ 0,17/M de saída). O Codex entra sem nota de IQ publicada — o que, somado à ausência de dados de coding e agentic, significa que você está comprando no escuro do benchmark e confiando na descrição do fabricante.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para efeito de comparação direta em preço, o Qwen3 Next 80B A3B Thinking (IQ 16,867) cobra US$ 1,20/M de saída — quase 8 vezes mais barato que o Codex na geração. O Llama 4 Maverick da Meta cobra US$ 0,696/M de saída. Em outras palavras: na faixa de modelos "caros mas não absurdos", o Codex é o mais caro de todos, e por uma margem grande.
O que fazer com isso amanhã
Se você já roda agente de coding em produção, faça o teste controlado: pegue 50 tickets reais, meça custo total (entrada + saída + cache) e taxa de resolução sem intervenção humana. Some o custo de retries nos modelos mais baratos e compare. Só assim a diferença de US$ 9,83 por milhão de tokens de saída se justifica — ou não. Se você está começando, comece pelo gpt-oss-20b ou pelo Maverick: a economia paga a curva de aprendizado. O Codex é ferramenta de quem já sabe o que está fazendo e está disposto a pagar pelo atalho.
Só vale a pena trocar pelo GPT-5 Codex se você já roda agente de coding em produção, tem prefixo repetitivo grande para amortizar o cache e consegue medir taxa de resolução por tarefa — caso contrário, o gpt-oss-20b ou o Llama 4 Maverick entregam resultado parecido por uma fração do custo.
Perguntas frequentes
Quanto custa o GPT-5 Codex na API da OpenAI?
US$ 1,25 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saída e US$ 0,125 por milhão de tokens lidos do cache (10% do preço de entrada). É o modelo mais caro da linha GPT-5 no catálogo até esta data.
GPT-5 Codex é melhor que o gpt-oss-120b para código?
O catálogo não publicou nota de IQ nem índice de coding para o GPT-5 Codex, então não há comparação pública direta. O gpt-oss-120b tem IQ 24,126 e custa US$ 0,17 por milhão de tokens de saída — quase 59 vezes mais barato na geração.
Quando o cache do GPT-5 Codex compensa?
Quando o prompt de sistema e o contexto do projeto se repetem em muitas chamadas (revisão de PRs, agente com repositório fixo, pair programming). Nesses casos a leitura cai para US$ 0,125/M. Em workloads de saída pesada com pouco reuso de prefixo, a economia do cache é irrelevante.