Gemini 3.1 Pro em modo batch custa metade — e ninguém está olhando
A versão assíncrona do topo do catálogo da Google sai por US$ 6 por milhão de tokens de saída, mas exige esperar horas.
Você viu o lançamento do Gemini 3.1 Pro Preview, viu o preço de US$ 12 por milhão de tokens de saída e provavelmente pensou: "caro, mas é o topo do catálogo". Justo. Só que tem um detalhe que está passando batido: dois dias depois do lançamento, a Google colocou no ar a variante :batch do mesmo modelo, com a mesma janela de contexto de 1 milhão de tokens, as mesmas modalidades (texto, imagem, arquivo, áudio e vídeo como entrada; texto como saída), e cobra US$ 6 por milhão de tokens de saída. A entrada fica em US$ 1 por milhão. É literalmente metade do preço — pela mesma inteligência.
O que muda (e o que não muda) no batch
O :batch é o mesmo modelo rodando em modo assíncrono. Você envia o trabalho, ele entra numa fila, processa em até 24 horas e te devolve o resultado. Não é um modelo menor, não é uma versão destilada, não é "lite". É o Gemini 3.1 Pro Preview com a mesma engenharia de software, a mesma confiabilidade agentic e o mesmo uso eficiente de tokens descritos pela Google — só que sem a promessa de resposta em segundos.
Na prática, isso significa que se você está montando um pipeline de geração de dados sintéticos, reescrevendo uma base de código inteira, ou processando um lote de documentos longos para extração estruturada, o batch é o caminho. A pergunta que você precisa fazer antes de migrar é simples: dá para esperar?
Onde ele se encaixa no tabuleiro
Hoje, o catálogo tem 340 modelos listados, vindos de 52 criadores. O topo da tabela de inteligência é o próprio Gemini 3.1 Pro Preview (versão síncrona), com IQ 47,738 e preço de US$ 12 por milhão de tokens de saída. É o único modelo acima de IQ 45 no catálogo — ou seja, é o único "barato acima de IQ 45" também, porque não tem concorrente nessa faixa.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
Logo abaixo, com folga, vem o Claude Sonnet 4.6 (Anthropic), com IQ 35,108 e US$ 15 por milhão de tokens de saída. Depois Qwen3.5 397B A17B (IQ 34,262, US$ 2,34), MiMo-V2-Flash da Xiaomi (IQ 34,024, US$ 0,30) e o3 da OpenAI (IQ 31,096, US$ 8). Repare: o Gemini 3.1 Pro Preview está sozinho numa faixa de preço-performance que ninguém mais ocupa. O batch, a US$ 6, começa a se aproximar do território do o3 — mas com salto de inteligência muito maior.
Para quem vale trocar
Se você já está usando Gemini 3.1 Pro Preview síncrono para tarefas que não precisam de resposta imediata, migrar para :batch é dinheiro na conta. Pense em casos como: classificação em massa de tickets, sumarização de milhares de PDFs, geração de testes unitários para um repositório inteiro, varredura de logs para extração de padrões. Tudo isso cabe no batch.
Se você está construindo um produto com chat em tempo real, um agente que precisa responder em menos de 5 segundos, ou um assistente interativo, batch não serve — você precisa da versão síncrona, e o preço de US$ 12 continua sendo o do topo do catálogo.
| Campo | Valor |
|---|---|
| Identificador | google/gemini-3.1-pro-preview:batch |
| Criador | |
| Preço de entrada | US$ 1.00 / M tokens |
| Preço de saída | US$ 6.00 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text+image+file+audio+video->text |
O que ninguém te conta sobre o modo batch
Três pontos que o release não destaca:
- A fila é compartilhada. Em horário de pico, o SLA de 24 horas pode esticar. Não tem contrato de latência.
- Não tem cache de prompt publicado. O campo de preço de cache está vazio no catálogo — ou seja, se você está otimizando custo reusando contexto, não tem como saber o desconto.
- O índice de inteligência não foi medido para a variante batch. O IQ 47,738 é da versão síncrona. Como o batch é o mesmo modelo com a mesma arquitetura, a expectativa é que performem igual — mas não tem benchmark público confirmando.
O que fazer com isso agora
Se você paga a conta da API e tem trabalho assíncrono no pipeline, vale rodar um teste A/B hoje: mesmo prompt, mesma entrada, uma chamada síncrona e uma batch. Compare qualidade da resposta e veja se a economia de 50% no token de saída compensa a espera. Para quem está decidindo entre Gemini 3.1 Pro e Claude Sonnet 4.6, o argumento de preço acaba de mudar: o Gemini batch fica em US$ 6 contra US$ 15 do Claude, com IQ quase 36% maior. É a maior diferença de custo-benefício no topo do mercado hoje.
Se o seu caso de uso aceita esperar até 24h, migrar do Gemini 3.1 Pro Preview síncrono para a variante batch corta pela metade a conta sem perder inteligência.
Perguntas frequentes
Gemini 3.1 Pro Preview batch é o mesmo modelo?
Sim. É o Gemini 3.1 Pro Preview rodando em modo assíncrono, com a mesma janela de 1M de tokens e as mesmas modalidades. A única diferença é a latência: até 24h em vez de resposta imediata.
Quanto custa o Gemini 3.1 Pro Preview batch?
US$ 1 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída — metade do preço da versão síncrona, que cobra US$ 12 por milhão na saída.
Quando NÃO usar o modo batch?
Em qualquer produto que exija resposta em tempo real: chat interativo, agentes com SLA de segundos, assistentes conversacionais. Nesses casos, a versão síncrona continua sendo a única opção.