GPT-5.1-Codex-Max a US$ 10 por milhão: vale pagar caro por código?
Modelo agentic da OpenAI chega caro e sem benchmark público; o tabuleiro de dezembro mostra quem entrega mais inteligência por menos.
Oito dólares por dia de agente
Você roda um agente de programação por uma hora, ele cospe 800 mil tokens de resposta, e a fatura chega em US$ 8 só naquele turno. Some os turnos do dia, some a semana, e o "modelo novo da OpenAI" vira uma linha de custo que precisa justificar a própria existência. É exatamente essa conta que o GPT-5.1-Codex-Max, lançado em 4 de dezembro, obriga você a fazer.
A proposta da OpenAI é clara no nome: um modelo "codex-max", herdeiro da linha de código, agora turbinado para tarefas agentic de longa duração e contexto alto. O catálogo registra 400 mil tokens de contexto — o suficiente para engolir um repositório inteiro de uma vez. Modalidade texto+imagem entrando, só texto saindo. Preço: US$ 1,25 por milhão de entrada e US$ 10 por milhão de saída. Tem cache de prompt a US$ 0,125 — dez vezes mais barato que a entrada cheia, o que importa em fluxos que repetem o mesmo bloco de código.
| Campo | Valor |
|---|---|
| Identificador | openai/gpt-5.1-codex-max |
| Criador | openai |
| Preço de entrada | US$ 1.25 / M tokens |
| Preço de saída | US$ 10.00 / M tokens |
| Janela de contexto | 400k |
| Modalidade | text+image->text |
| Leitura de cache | US$ 0.125 / M (90% de desconto) |
O detalhe que ninguém comenta
O lançamento veio sem benchmark público de inteligência no catálogo. O campo iq está vazio. Isso não quer dizer que o modelo é ruim — quer dizer que, até onde o catálogo consegue medir hoje, não há número comparável para você colocar lado a lado com o resto. Para um CTO que escolhe modelo olhando planilha, isso é um sinal amarelo: você está pagando preço de topo sem ter o número que justifica o topo.
Compare com o que está no topo do índice nesta data: o Xiaomi MiMo-V2-Flash lidera com IQ 34,024 a US$ 0,30 por milhão de saída. O OpenAI o3 aparece em segundo com IQ 31,096 a US$ 8. O Claude Haiku 4.5, da Anthropic, marca IQ 29,892 a US$ 5. Em outras palavras, o Codex-Max entra no mercado mais caro que o o3 — e sem o índice para mostrar que entrega mais inteligência.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem isso vale a pena
Você ganha com o Codex-Max em um cenário específico: tarefa agentic longa, contexto gigante, repetição de prompt. O cache a US$ 0,125 muda a equação quando o mesmo trecho de código ou especificação é reenviado várias vezes dentro de uma sessão. Em pipelines que mantêm o agente iterando por horas sobre o mesmo projeto, a economia do cache pode compensar parte do preço de saída.
Também faz sentido se você já está dentro do ecossistema OpenAI e precisa de continuidade com ferramentas agentic — Responses API, function calling, integração com o que sua stack já usa. Trocar de fornecedor tem custo; ficar dentro tem custo também, mas é conhecido.
Para quem não muda nada
Se o seu uso é geração de código curta, pair programming rápido ou completar funções unitárias, o Codex-Max é canhão para matar mosca. O Mistral Devstral 2 2512, lançado neste mês, aparece no índice com IQ 19,242 a US$ 2 por milhão de saída — uma fração do custo, e feito exatamente para tarefa de desenvolvimento. Para a maioria dos times que usam LLM como autocomplete avançado, o Devstral ou o próprio gpt-oss-120b da OpenAI (IQ 24,126 a US$ 0,17) cobrem o trabalho.
Se você está montando um agente do zero e o orçamento importa, o MiMo-V2-Flash da Xiaomi entrega o maior IQ do catálogo pelo menor preço de saída entre os modelos listados. Vale testar antes de assinar a fatura cheia da OpenAI.
O tabuleiro em dezembro
O catálogo tem hoje mais de 309 modelos ativos, vindos de 47 criadores diferentes. Nos últimos 30 dias, 33 modelos entraram — o mercado não para de girar. O Codex-Max é mais um lançamento caro em um mês que já trouxe alternativas baratas e bem posicionadas. A pergunta que fica não é "este modelo é bom?", e sim "este modelo é bom o suficiente para custar o que custa, no caso específico que você tem?".
Só vale pagar US$ 10 por milhão de saída se você roda agente longo com prompt repetido em cache; para o resto, Devstral, gpt-oss ou MiMo entregam mais por muito menos.
Perguntas frequentes
Quanto custa o GPT-5.1-Codex-Max na API?
US$ 1,25 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com cache de prompt a US$ 0,125 por milhão — dez vezes mais barato que a entrada cheia, útil em fluxos agentic que repetem o mesmo bloco de código.
O GPT-5.1-Codex-Max tem benchmark de inteligência?
Não no catálogo desta data. O índice de IQ está vazio, então não dá para comparar diretamente com o3, Claude Haiku 4.5 ou MiMo-V2-Flash pelo mesmo critério.
Qual modelo de código é mais barato que o Codex-Max?
O Mistral Devstral 2 2512 cobra US$ 2 por milhão de saída e o gpt-oss-120b da própria OpenAI sai por US$ 0,17 — ambos com índice de IQ público e feitos para tarefa de desenvolvimento.