FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Gemini 3.5 Flash batch custa metade do Flash normal: vale migrar

A Google cortou a conta pela metade em troca de uma fila de processamento. Para quem aguenta esperar, o cálculo muda; para quem precisa de resposta na hora, não.

Redação FalaVIP IA 3 min de leitura
US$ 4,50por milhão de tokens de saída no batch
US$ 0,075por milhão de tokens de cache no batch
8 diasdesde o lançamento do modo batch

O desconto que ninguém viu direito

O Gemini 3.5 Flash chegou ao catálogo em 19 de maio de 2026. Oito dias depois, a maioria dos desenvolvedores ainda está olhando para a tabela de preços do Flash "normal" — aquela que aparece primeiro na busca. Só que existe uma segunda linha, marcada como batch, e é nela que mora a história.

A versão batch cobra US$ 0,75 por milhão de tokens de entrada e US$ 4,50 por milhão de tokens de saída. Em comparação direta com o Gemini 3.5 Flash padrão, isso representa aproximadamente metade do preço de saída. O cache, que é onde mora o desconto real para quem reaproveita contexto, cai para US$ 0,075 por milhão — uma fração do que se paga no modo síncrono. A conta da API agradece, mas tem uma letra miúda: o processamento entra em fila, então a resposta não volta na hora.

Ficha técnica — Gemini 3.5 Flash (batch)
CampoValor
Identificadorgoogle/gemini-3.5-flash:batch
Criadorgoogle
Preço de entradaUS$ 0.750 / M tokens
Preço de saídaUS$ 4.50 / M tokens
Janela de contexto1.05M
Modalidadetext+image+file+audio+video->text
Leitura de cacheUS$ 0.075 / M (90% de desconto)

O que o "batch" realmente significa

Pense no modo batch como o envio de uma mala postal em vez de uma entrega por motoboy. Você junta as requisições, despacha tudo de uma vez e aceita que o prazo é maior. Em troca, o custo de envio despenca. Para fluxos que já são assíncronos — geração em massa de embeddings, classificação de milhares de documentos, sumarização de uma fila de chamados, geração de testes em lote — isso é quase de graça. Para um chatbot que precisa responder em 800 milissegundos, é inviável.

A Google não publicou, no momento do lançamento, uma SLA de latência específica para o batch nem um teto de tempo de processamento. Quem assina a API recebe os jobs em até 24 horas na maioria dos casos reportados pela documentação do produto, mas isso é uma promessa operacional, não um índice de qualidade.

Onde ele se encaixa no tabuleiro

O catálogo tem hoje 450 modelos listados, vindos de 61 criadores. No topo da régua de inteligência, o Gemini 3.5 Flash (modo síncrono) aparece em segundo lugar, com IQ 46,673, logo abaixo do Gemini 3.1 Pro Preview. O GPT-5.3-Codex da OpenAI vem em terceiro, e o DeepSeek V4 Pro, da China, em quarto — com a vantagem de custar US$ 1,74 por milhão de tokens de saída, o menor preço entre os modelos acima de IQ 45.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
Entre os 450 modelos disponíveis no catálogo nesta data.

A pergunta que importa é: a versão batch do Flash consegue brigar com o DeepSeek V4 Pro em custo? Em preço de saída, o Flash batch fica em US$ 4,50 contra US$ 1,74 do DeepSeek. Mesmo com o desconto generoso, o chinês ainda é quase três vezes mais barato. O Flash batch só vence na régua de inteligência, e mesmo assim por uma margem pequena — 46,673 contra 45,268. Para workloads onde cada ponto de IQ não é crítico, o V4 Pro continua sendo a escolha racional da carteira.

Para quem vale e para quem não muda nada

Vale a pena migrar para o Gemini 3.5 Flash batch se você já roda o Flash síncrono em jobs que toleram espera — reescrita de documentação, geração de datasets sintéticos, classificação de base inteira, code review em pull requests acumulados da noite. Nesses casos, a economia de 50% no token de saída cai direto no fim do mês sem mexer na qualidade.

Não vale se você precisa de resposta em tempo real, se seu volume é tão pequeno que a diferença de centavos não paga a complexidade de gerenciar dois endpoints, ou se o seu gargalo é custo de entrada — porque nesse quesito o Flash batch está em US$ 0,75, acima de alternativas chinesas. Também não vale se você ainda não testou o DeepSeek V4 Pro: a régua de IQ é próxima e a fatura é bem menor.

O que fazer com isso

Se você já usa Gemini Flash em produção, abra o dashboard de billing e separe as chamadas síncronas das que podem ir para a fila. Mande o segundo grupo para o endpoint batch e meça a economia no próximo ciclo. Se você está começando um projeto novo e o orçamento é a variável dominante, comece pelo DeepSeek V4 Pro e só promova para o Flash batch quando precisar de multimodalidade pesada — o Flash aceita texto, imagem, arquivo, áudio e vídeo como entrada, e isso não tem comparação direta no catálogo chinês pelo mesmo preço.

Em uma frase

Se sua fila de jobs aceita esperar algumas horas, migre metade do tráfego do Gemini Flash para o endpoint batch e corte a fatura pela metade; se precisa de resposta na hora ou se o orçamento é o fator número um, o DeepSeek V4 Pro segue sendo a escolha mais barata do mercado.

Perguntas frequentes

Gemini 3.5 Flash batch é metade do preço do Flash normal?

Sim, no token de saída: US$ 4,50 contra cerca de US$ 9 por milhão no modo síncrono. O cache também cai, para US$ 0,075 por milhão. A entrada sai por US$ 0,75 por milhão.

Quanto tempo demora uma chamada no modo batch?

A Google não publicou um SLA rígido de latência para o batch. Na prática, jobs são processados em até 24 horas, o que é incompatível com uso interativo mas funciona bem para jobs em massa.

Gemini 3.5 Flash batch é melhor que o DeepSeek V4 Pro?

Em qualidade medida pelo índice do catálogo, o Flash fica à frente por uma margem pequena (IQ 46,673 contra 45,268). Em preço de saída, o DeepSeek V4 Pro é quase três vezes mais barato, então a escolha depende de qual variável pesa mais no seu projeto.

Leia também