Gemini 3.5 Flash batch custa metade do Flash normal: vale migrar
A Google cortou a conta pela metade em troca de uma fila de processamento. Para quem aguenta esperar, o cálculo muda; para quem precisa de resposta na hora, não.
O desconto que ninguém viu direito
O Gemini 3.5 Flash chegou ao catálogo em 19 de maio de 2026. Oito dias depois, a maioria dos desenvolvedores ainda está olhando para a tabela de preços do Flash "normal" — aquela que aparece primeiro na busca. Só que existe uma segunda linha, marcada como batch, e é nela que mora a história.
A versão batch cobra US$ 0,75 por milhão de tokens de entrada e US$ 4,50 por milhão de tokens de saída. Em comparação direta com o Gemini 3.5 Flash padrão, isso representa aproximadamente metade do preço de saída. O cache, que é onde mora o desconto real para quem reaproveita contexto, cai para US$ 0,075 por milhão — uma fração do que se paga no modo síncrono. A conta da API agradece, mas tem uma letra miúda: o processamento entra em fila, então a resposta não volta na hora.
| Campo | Valor |
|---|---|
| Identificador | google/gemini-3.5-flash:batch |
| Criador | |
| Preço de entrada | US$ 0.750 / M tokens |
| Preço de saída | US$ 4.50 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text+image+file+audio+video->text |
| Leitura de cache | US$ 0.075 / M (90% de desconto) |
O que o "batch" realmente significa
Pense no modo batch como o envio de uma mala postal em vez de uma entrega por motoboy. Você junta as requisições, despacha tudo de uma vez e aceita que o prazo é maior. Em troca, o custo de envio despenca. Para fluxos que já são assíncronos — geração em massa de embeddings, classificação de milhares de documentos, sumarização de uma fila de chamados, geração de testes em lote — isso é quase de graça. Para um chatbot que precisa responder em 800 milissegundos, é inviável.
A Google não publicou, no momento do lançamento, uma SLA de latência específica para o batch nem um teto de tempo de processamento. Quem assina a API recebe os jobs em até 24 horas na maioria dos casos reportados pela documentação do produto, mas isso é uma promessa operacional, não um índice de qualidade.
Onde ele se encaixa no tabuleiro
O catálogo tem hoje 450 modelos listados, vindos de 61 criadores. No topo da régua de inteligência, o Gemini 3.5 Flash (modo síncrono) aparece em segundo lugar, com IQ 46,673, logo abaixo do Gemini 3.1 Pro Preview. O GPT-5.3-Codex da OpenAI vem em terceiro, e o DeepSeek V4 Pro, da China, em quarto — com a vantagem de custar US$ 1,74 por milhão de tokens de saída, o menor preço entre os modelos acima de IQ 45.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
| MiMo-V2.5-Pro | 42.9 | 0.87 |
A pergunta que importa é: a versão batch do Flash consegue brigar com o DeepSeek V4 Pro em custo? Em preço de saída, o Flash batch fica em US$ 4,50 contra US$ 1,74 do DeepSeek. Mesmo com o desconto generoso, o chinês ainda é quase três vezes mais barato. O Flash batch só vence na régua de inteligência, e mesmo assim por uma margem pequena — 46,673 contra 45,268. Para workloads onde cada ponto de IQ não é crítico, o V4 Pro continua sendo a escolha racional da carteira.
Para quem vale e para quem não muda nada
Vale a pena migrar para o Gemini 3.5 Flash batch se você já roda o Flash síncrono em jobs que toleram espera — reescrita de documentação, geração de datasets sintéticos, classificação de base inteira, code review em pull requests acumulados da noite. Nesses casos, a economia de 50% no token de saída cai direto no fim do mês sem mexer na qualidade.
Não vale se você precisa de resposta em tempo real, se seu volume é tão pequeno que a diferença de centavos não paga a complexidade de gerenciar dois endpoints, ou se o seu gargalo é custo de entrada — porque nesse quesito o Flash batch está em US$ 0,75, acima de alternativas chinesas. Também não vale se você ainda não testou o DeepSeek V4 Pro: a régua de IQ é próxima e a fatura é bem menor.
O que fazer com isso
Se você já usa Gemini Flash em produção, abra o dashboard de billing e separe as chamadas síncronas das que podem ir para a fila. Mande o segundo grupo para o endpoint batch e meça a economia no próximo ciclo. Se você está começando um projeto novo e o orçamento é a variável dominante, comece pelo DeepSeek V4 Pro e só promova para o Flash batch quando precisar de multimodalidade pesada — o Flash aceita texto, imagem, arquivo, áudio e vídeo como entrada, e isso não tem comparação direta no catálogo chinês pelo mesmo preço.
Se sua fila de jobs aceita esperar algumas horas, migre metade do tráfego do Gemini Flash para o endpoint batch e corte a fatura pela metade; se precisa de resposta na hora ou se o orçamento é o fator número um, o DeepSeek V4 Pro segue sendo a escolha mais barata do mercado.
Perguntas frequentes
Gemini 3.5 Flash batch é metade do preço do Flash normal?
Sim, no token de saída: US$ 4,50 contra cerca de US$ 9 por milhão no modo síncrono. O cache também cai, para US$ 0,075 por milhão. A entrada sai por US$ 0,75 por milhão.
Quanto tempo demora uma chamada no modo batch?
A Google não publicou um SLA rígido de latência para o batch. Na prática, jobs são processados em até 24 horas, o que é incompatível com uso interativo mas funciona bem para jobs em massa.
Gemini 3.5 Flash batch é melhor que o DeepSeek V4 Pro?
Em qualidade medida pelo índice do catálogo, o Flash fica à frente por uma margem pequena (IQ 46,673 contra 45,268). Em preço de saída, o DeepSeek V4 Pro é quase três vezes mais barato, então a escolha depende de qual variável pesa mais no seu projeto.