GPT-5.1-Codex cobra US$ 10 por milhão de saída: vale para quem?
Versão focada em código da OpenAI estreia com janela de 400 mil tokens e preço oito vezes maior que o do o3, que lidera o ranking de inteligência.
Oito vezes mais caro que o líder
Dois dias após o lançamento, o GPT-5.1-Codex já aparece nos catálogos com um preço de saída que faz qualquer CTO de startup engolir seco: US$ 10 por milhão de tokens. Compare com o que está no topo do ranking de inteligência hoje — o OpenAI o3, do mesmo fabricante, cobra US$ 8 pela mesma saída. Parece perto, mas o detalhe está no outro lado da fatura: a entrada do Codex custa US$ 1,25 por milhão, contra os US$ 8 cobrados pelo o3. Em outras palavras, o Codex ficou mais barato na entrada e mais caro na saída — uma combinação que só compensa se o seu fluxo gera muito texto curto e consome pouco prompt, o que é raro em coding agents.
| Campo | Valor |
|---|---|
| Identificador | openai/gpt-5.1-codex |
| Criador | openai |
| Preço de entrada | US$ 1.25 / M tokens |
| Preço de saída | US$ 10.00 / M tokens |
| Janela de contexto | 400k |
| Modalidade | text+image->text |
| Leitura de cache | US$ 0.130 / M (90% de desconto) |
A janela de 400 mil tokens é o verdadeiro chamariz
O preço assusta, mas a especificação técnica tenta justificar. São 400 mil tokens de contexto, número que coloca o modelo entre os mais folgados do mercado e que muda o cálculo em tarefas de engenharia de software de longa duração: refatoração de repositórios inteiros, revisão de PRs grandes, agentes que precisam ler vários arquivos antes de sugerir uma mudança. A descrição oficial fala em "sessões interativas e execução independente de tarefas complexas de engenharia", e é exatamente nesse segundo caso — execução autônoma, sem humano no loop — que a janela grande paga.
Onde ele se encaixa no tabuleiro
O catálogo de hoje tem 276 modelos listados, vindos de 42 criadores diferentes. No topo da régua de inteligência estão o o3 da OpenAI (IQ 31,096, US$ 8 de saída), o Claude Haiku 4.5 da Anthropic (IQ 29,892, US$ 5 de saída) e o gpt-oss-120b, também da OpenAI, com IQ 24,126 e US$ 0,17 de saída. O GPT-5.1-Codex não tem nota de IQ publicada no catálogo — e vale registrar isso: quando o campo vem vazio, o catálogo não publicou, não é falha sua de leitura.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
A leitura honesta é esta: o Codex não está brigando pelo topo de inteligência geral. Está brigando por um nicho específico — coding agent de longa duração — onde a janela de contexto e a otimização para fluxos de engenharia pesam mais do que a nota em benchmark genérico. É a mesma lógica que a OpenAI já usou com a linha Codex antes: produto vertical, preço premium.
Para quem vale
Se você roda um agente de programação que precisa engolir um repositório inteiro, planejar mudanças em vários arquivos e devolver diffs longos, a janela de 400 mil tokens e a otimização para "execução independente" podem justificar o US$ 10 de saída. Pense em times que estão automatizando migrações, gerando testes E2E, ou rodando code review automatizado em monorepos.
Se o seu caso é autocompletar no editor, gerar uma função a partir de um prompt de três linhas, ou fazer pair programming em sessões curtas, o Claude Haiku 4.5 entrega IQ próximo do topo (29,892 contra 31,096 do o3) por metade do preço de saída. Para volume alto com qualidade aceitável, o gpt-oss-120b da própria OpenAI sai por US$ 0,17 — quase sessenta vezes mais barato que o Codex, ainda que com IQ bem mais baixo.
O que ninguém te conta no release
O release fala em "otimizado para fluxos de engenharia de software". O que ele não diz é que essa otimização tem um custo: você paga US$ 0,13 por milhão de tokens em cache, valor que parece baixo mas que só faz sentido se você reusar o mesmo contexto repetidamente — caso contrário, é mais um item na fatura. E sem nota de IQ, coding ou agentic publicada, a única forma de saber se ele realmente é melhor que o o3 em código é testar com seu próprio workload. A régua genérica não responde por você.
A implicação prática é direta: não migre seu stack de coding agent para o GPT-5.1-Codex no escuro. Meça tokens de entrada e saída do seu fluxo atual, calcule o custo por tarefa concluída, e rode o Codex em paralelo por uma semana antes de trocar o modelo padrão. Se a taxa de tarefas completas sem intervenção humana subir o suficiente para compensar o salto de preço, vale. Se não, o Haiku 4.5 continua sendo o melhor custo-benefício do topo da régua.
Só migre para o GPT-5.1-Codex se o seu fluxo de coding agent gera tarefas longas e autônomas; para o resto, o Haiku 4.5 entrega IQ parecido pela metade do preço.
Perguntas frequentes
Quanto custa o GPT-5.1-Codex na API?
US$ 1,25 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com cache a US$ 0,13 por milhão. É o modelo mais caro da linha GPT-5.1 focado em código até o momento deste texto.
O GPT-5.1-Codex é melhor que o Claude Haiku 4.5?
Depende do que você mede. O catálogo não publicou nota de IQ, coding ou agentic para o Codex, então não há comparação direta publicada. O Haiku 4.5 tem IQ 29,892 e custa metade na saída (US$ 5 contra US$ 10).
Vale usar o GPT-5.1-Codex para autocompletar código no editor?
Em geral, não. Para tarefas curtas e interativas, o Haiku 4.5 ou o gpt-oss-120b custam menos e entregam qualidade próxima. O ponto do Codex é a janela de 400 mil tokens e a execução autônoma de tarefas longas.