Gemini 3.5 Flash em modo batch custa metade do Flash comum — vale migrar?
A Google lançou uma variante assíncrona do Flash com corte agressivo de preço; o ganho real está no tipo certo de carga, não em qualquer chamada.
O número que importa não é o IQ
Você olha o preço do Gemini 3.5 Flash e vê 4,50 dólares por milhão de tokens de saída. Parece barato. Mas esse é o preço da variante :batch — uma fila assíncrona que entrega em horas, não em segundos. Comparado com o Flash tradicional, que cobra 9 dólares pelo mesmo milhão, é metade. O detalhe está no asterisco: você troca latência por desconto, e isso muda completamente para quem o serviço serve.
O que a Google entregou de fato
Lançado em 19 de maio, o Gemini 3.5 Flash (batch) é a versão assíncrona do modelo de eficiência da casa. Mesma janela de contexto de 1.048.576 tokens, mesma multimodalidade — texto, imagem, arquivo, áudio e vídeo entrando; só texto saindo. O preço de entrada cai de 1 dólar para 0,75 por milhão de tokens, e o cache, que é onde você paga caro quando faz RAG pesado, despenca para 0,075 por milhão. É um décimo do que se paga normalmente em cache.
| Campo | Valor |
|---|---|
| Identificador | google/gemini-3.5-flash:batch |
| Criador | |
| Preço de entrada | US$ 0.750 / M tokens |
| Preço de saída | US$ 4.50 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text+image+file+audio+video->text |
| Leitura de cache | US$ 0.075 / M (90% de desconto) |
Onde isso entra no tabuleiro
Olhando o topo do catálogo hoje, o Flash batch senta numa faixa curiosa. O Gemini 3.1 Pro Preview lidera em inteligência com IQ 47,7 e custa 12 dólares por milhão de saída. O Flash tradicional vem logo abaixo, com IQ 46,7 e 9 dólares. O DeepSeek V4 Pro aparece como o mais barato acima de IQ 45, custando 1,74 dólar por milhão de saída — uma ordem de grandeza abaixo de qualquer modelo do Google nessa faixa.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
| MiMo-V2.5-Pro | 42.9 | 0.87 |
A pergunta que fica é: por que pagar 4,50 dólares no Flash batch quando o DeepSeek V4 Pro entrega IQ parecido por 1,74? A resposta está no que o Flash batch traz que o concorrente chinês não traz — multimodalidade completa de entrada, incluindo áudio e vídeo, e a infraestrutura de fila assíncrona que a Google já opera em escala.
Para quem vale a pena
Se você tem uma carga de processamento em massa que pode esperar horas — reindexação de base de conhecimento, geração de dataset sintético, classificação de milhares de arquivos de áudio ou vídeo, jobs noturnos de ETL com LLM — o Flash batch é um candidato sério. O desconto de 50% no preço de saída e de 90% no cache se acumula rápido quando você roda milhões de tokens por dia.
Se você precisa de resposta em tempo real — chatbot, agente interativo, ferramenta com usuário esperando na outra ponta — o batch não serve. Você precisa do Flash tradicional, ou de outro modelo síncrono.
Se o seu gargalo é custo puro e multimodalidade não importa, o DeepSeek V4 Pro continua sendo a referência de preço acima de IQ 45. A diferença de quase três vezes no token de saída não se justifica só pela marca.
O que ninguém te conta sobre o batch
Trabalhar com API batch exige que você submeta jobs em lote e aguarde o processamento — geralmente em minutos ou horas, dependendo da fila. Não existe webhook mágico que transforme isso em tempo real. O modelo é o mesmo Flash, com o mesmo teto de inteligência medido em IQ 46,7; o que muda é o canal de entrega e o preço associado a ele.
Outro ponto que costuma passar batido: o cache a 0,075 por milhão é o grande chamariz. Se você já tem um sistema que relê o mesmo contexto a cada chamada — prompt de sistema longo, documentos de referência — migrar para batch com cache habilitado pode reduzir o custo efetivo por chamada a uma fração do que você paga hoje.
O que fazer com isso
Se você roda jobs assíncronos com volume alto e multimodalidade, teste o Flash batch com um workload real antes de comprometer orçamento. Meça latência de ponta a ponta — não apenas a chamada à API, mas o ciclo completo de submit, fila e retorno. Se a janela de horas cabe no seu fluxo, a economia de 50% no output e 90% no cache é dinheiro que volta todo mês.
Se você não tem carga assíncrona, ignore. O Flash comum continua valendo para o que sempre valeu, e o DeepSeek V4 Pro segue sendo o teto de custo-benefício na faixa de IQ 45+.
Migre para o Flash batch apenas cargas assíncronas com multimodalidade; para tudo que precisa de resposta em segundos, o Flash tradicional ou o DeepSeek V4 Pro continuam sendo as opções certas.
Perguntas frequentes
Gemini 3.5 Flash batch é mais barato que o Flash comum?
Sim. O preço de saída cai de 9 para 4,50 dólares por milhão de tokens, e o cache de 0,75 para 0,075 por milhão — um décimo do valor normal. A contrapartida é que a entrega é assíncrona, em horas, não em tempo real.
Quando NÃO vale a pena usar o Flash batch?
Quando você precisa de resposta em segundos — chatbots, agentes interativos, qualquer coisa com usuário esperando na outra ponta. Nesses casos, o Flash tradicional síncrono ou um modelo de outra casa é mais adequado.
Flash batch ou DeepSeek V4 Pro?
Depende do que você precisa. O DeepSeek V4 Pro custa 1,74 dólar por milhão de saída e tem IQ parecido, mas não oferece a mesma multimodalidade completa de entrada — especialmente áudio e vídeo — nem a infraestrutura de fila assíncrona que a Google já opera.