FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GPT-5.1 batch custou US$ 4,40 por milhão de saída — vale o que sobra da fila?

A OpenAI oferece o modelo top em modo assíncrono a um quinto do preço cheio, mas só se você aceitar esperar e não medir inteligência.

Redação FalaVIP IA 3 min de leitura
US$ 4,40por milhão de tokens de saída no modo batch
US$ 0,55por milhão de tokens de entrada no modo batch
4 diasde mercado desde o lançamento em 13/11/2025

O que está em jogo

Você viu o preço do GPT-5.1 normal e quase passou direto pela variante :batch. Faz sentido: o nome parece um detalhe técnico de infraestrutura, não uma decisão de produto. Mas a conta é outra. Em modo batch, a OpenAI cobra US$ 0,625 por milhão de tokens de entrada e US$ 5 por milhão de tokens de saída — pouco mais de um quinto do que cobra fora da fila. Em reais, dá algo como R$ 0,30 por mil tokens entrando e R$ 2,40 por mil tokens saindo, considerando câmbio próximo de R$ 5,50.

O detalhe que ninguém coloca no headline: batch não é desconto, é troca. Você entrega latência — a resposta chega em horas, não em segundos — e recebe o mesmo modelo, com o mesmo contexto de 400 mil tokens, mesma capacidade de ler imagem e arquivo, mesmo modo adaptativo de raciocínio. É a mesma conta de restaurante com fila no balcão em vez de mesa.

Ficha técnica — GPT-5.1 (batch)
CampoValor
Identificadoropenai/gpt-5.1:batch
Criadoropenai
Preço de entradaUS$ 0.625 / M tokens
Preço de saídaUS$ 5.00 / M tokens
Janela de contexto400k
Modalidadetext+image+file->text
Leitura de cacheUS$ 0.063 / M (90% de desconto)

Onde isso muda alguma coisa

Batch serve para três tipos de trabalho e só para três. Primeiro, varreduras em massa: classificar dez mil tickets de suporte, resumir cem mil e-mails antigos, extrair campos de um lote de PDFs. Segundo, jobs noturnos: pipelines que rodam de madrugada e alimentam um dashboard de manhã. Terceiro, geração em série: produzir centenas de variações de copy, descrições de produto, perguntas de quiz. Em todos esses casos, esperar duas ou doze horas não muda nada porque ninguém está olhando para a tela.

Onde batch não serve: chatbot no site, assistente em IDE, qualquer coisa em que o usuário final clique num botão e espere resposta. Aí o gargalo deixa de ser preço e vira UX. E não serve também se você precisa de medição de qualidade em tempo real — tipo um A/B test que precisa rodar hoje para decidir amanhã.

O tabuleiro em 17 de novembro

Olhando para o topo do catálogo hoje, o ranking de inteligência tem OpenAI o3 na frente, com Claude Haiku 4.5 logo atrás. O GPT-5.1 não tem índice de inteligência publicado no catálogo — e isso é informação, não lacuna. Sem nota, você não consegue comparar diretamente nem colocar ele no spreadsheet de "qual modelo usar para qual tarefa". O que você consegue comparar é preço.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 276 modelos disponíveis no catálogo nesta data.

O o3 cobra US$ 8 por milhão de tokens de saída — 60% mais caro que o GPT-5.1 batch. O Haiku 4.5 cobra US$ 5, exatamente o mesmo preço de saída do GPT-5.1 batch, mas com inteligência medida e sem a fila. O gpt-oss-120b, modelo aberto da própria OpenAI, sai por US$ 0,17 por milhão de tokens de saída — quarenta vezes mais barato — embora com índice de inteligência bem abaixo do topo.

A pergunta deixa de ser "GPT-5.1 é bom?" e vira "para qual trabalho o GPT-5.1 batch é o melhor negócio, considerando que você não tem benchmark para comparar?"

Para quem vale, para quem não vale

Vale para você se: opera um pipeline assíncrono em escala, paga a conta da API no fim do mês e já estára fazendo fila em outro provedor. Trocar para GPT-5.1 batch nesse cenário é corte de custo puro, sem mudança de arquitetura.

Não vale para você se: precisa de resposta síncrona, está decidindo entre modelos para um produto novo, ou quer comparar qualidade antes de comprometer volume. Nesses casos, o Haiku 4.5 entrega a mesma faixa de preço de saída com nota de inteligência no catálogo e sem fila.

Também não vale se você roda volume pequeno. A economia de US$ 3 por milhão de tokens some quando você consome cem mil tokens por mês. A fila só compensa quando o trabalho é grande o suficiente para que a espera não doa.

O que fazer com isso amanhã

Se você já tem um job batch rodando em outro modelo, teste o GPT-5.1 batch na mesma carga por uma semana e compare duas coisas: qualidade do output e tempo total de fila. Se a qualidade ficar dentro do aceitável e a fila não estourar o SLA interno, migre. Se qualidade for crítica, peça nota de benchmark antes — ou fique com o Haiku 4.5, que tem índice publicado e preço parecido.

E se você está começando um projeto novo, não comece por aqui. Comece pelo modelo síncrono mais barato que atenda a qualidade, meça, e só depois decida se a fila compensa.

Em uma frase

Use GPT-5.1 batch para varreduras em massa e jobs noturnos onde esperar não dói; para tudo síncrono ou com SLA curto, o Haiku 4.5 entrega preço parecido com benchmark publicado.

Perguntas frequentes

Quanto custa o GPT-5.1 no modo batch?

US$ 0,625 por milhão de tokens de entrada e US$ 5 por milhão de tokens de saída, com cache de leitura a US$ 0,0625 por milhão. É pouco mais de um quinto do preço do GPT-5.1 síncrono, mas a resposta pode levar horas.

GPT-5.1 batch serve para chatbot?

Não. O modo batch é assíncrono: a resposta chega em horas, não em segundos. Para qualquer fluxo com usuário esperando na tela, use o modelo síncrono ou o Claude Haiku 4.5, que custa o mesmo na saída e tem índice de inteligência publicado.

GPT-5.1 batch é melhor que o o3?

O catálogo não publicou índice de inteligência para o GPT-5.1, então não há comparação direta de qualidade. Em preço, o GPT-5.1 batch sai por US$ 5 por milhão de saída contra US$ 8 do o3 — 37,5% mais barato, mas com a fila como custo escondido.

Leia também