FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Gemini 3.5 Flash em modo batch custa metade do Flash comum — vale migrar?

A Google lançou uma variante assíncrona do Flash com corte agressivo de preço; o ganho real está no tipo certo de carga, não em qualquer chamada.

Redação FalaVIP IA 3 min de leitura
US$ 4,50por milhão de tokens de saída no Flash batch
US$ 9,00por milhão de tokens de saída no Flash comum
0,075preço de cache por milhão de tokens no batch

O número que importa não é o IQ

Você olha o preço do Gemini 3.5 Flash e vê 4,50 dólares por milhão de tokens de saída. Parece barato. Mas esse é o preço da variante :batch — uma fila assíncrona que entrega em horas, não em segundos. Comparado com o Flash tradicional, que cobra 9 dólares pelo mesmo milhão, é metade. O detalhe está no asterisco: você troca latência por desconto, e isso muda completamente para quem o serviço serve.

O que a Google entregou de fato

Lançado em 19 de maio, o Gemini 3.5 Flash (batch) é a versão assíncrona do modelo de eficiência da casa. Mesma janela de contexto de 1.048.576 tokens, mesma multimodalidade — texto, imagem, arquivo, áudio e vídeo entrando; só texto saindo. O preço de entrada cai de 1 dólar para 0,75 por milhão de tokens, e o cache, que é onde você paga caro quando faz RAG pesado, despenca para 0,075 por milhão. É um décimo do que se paga normalmente em cache.

Ficha técnica — Gemini 3.5 Flash (batch)
CampoValor
Identificadorgoogle/gemini-3.5-flash:batch
Criadorgoogle
Preço de entradaUS$ 0.750 / M tokens
Preço de saídaUS$ 4.50 / M tokens
Janela de contexto1.05M
Modalidadetext+image+file+audio+video->text
Leitura de cacheUS$ 0.075 / M (90% de desconto)

Onde isso entra no tabuleiro

Olhando o topo do catálogo hoje, o Flash batch senta numa faixa curiosa. O Gemini 3.1 Pro Preview lidera em inteligência com IQ 47,7 e custa 12 dólares por milhão de saída. O Flash tradicional vem logo abaixo, com IQ 46,7 e 9 dólares. O DeepSeek V4 Pro aparece como o mais barato acima de IQ 45, custando 1,74 dólar por milhão de saída — uma ordem de grandeza abaixo de qualquer modelo do Google nessa faixa.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
Entre os 450 modelos disponíveis no catálogo nesta data.

A pergunta que fica é: por que pagar 4,50 dólares no Flash batch quando o DeepSeek V4 Pro entrega IQ parecido por 1,74? A resposta está no que o Flash batch traz que o concorrente chinês não traz — multimodalidade completa de entrada, incluindo áudio e vídeo, e a infraestrutura de fila assíncrona que a Google já opera em escala.

Para quem vale a pena

Se você tem uma carga de processamento em massa que pode esperar horas — reindexação de base de conhecimento, geração de dataset sintético, classificação de milhares de arquivos de áudio ou vídeo, jobs noturnos de ETL com LLM — o Flash batch é um candidato sério. O desconto de 50% no preço de saída e de 90% no cache se acumula rápido quando você roda milhões de tokens por dia.

Se você precisa de resposta em tempo real — chatbot, agente interativo, ferramenta com usuário esperando na outra ponta — o batch não serve. Você precisa do Flash tradicional, ou de outro modelo síncrono.

Se o seu gargalo é custo puro e multimodalidade não importa, o DeepSeek V4 Pro continua sendo a referência de preço acima de IQ 45. A diferença de quase três vezes no token de saída não se justifica só pela marca.

O que ninguém te conta sobre o batch

Trabalhar com API batch exige que você submeta jobs em lote e aguarde o processamento — geralmente em minutos ou horas, dependendo da fila. Não existe webhook mágico que transforme isso em tempo real. O modelo é o mesmo Flash, com o mesmo teto de inteligência medido em IQ 46,7; o que muda é o canal de entrega e o preço associado a ele.

Outro ponto que costuma passar batido: o cache a 0,075 por milhão é o grande chamariz. Se você já tem um sistema que relê o mesmo contexto a cada chamada — prompt de sistema longo, documentos de referência — migrar para batch com cache habilitado pode reduzir o custo efetivo por chamada a uma fração do que você paga hoje.

O que fazer com isso

Se você roda jobs assíncronos com volume alto e multimodalidade, teste o Flash batch com um workload real antes de comprometer orçamento. Meça latência de ponta a ponta — não apenas a chamada à API, mas o ciclo completo de submit, fila e retorno. Se a janela de horas cabe no seu fluxo, a economia de 50% no output e 90% no cache é dinheiro que volta todo mês.

Se você não tem carga assíncrona, ignore. O Flash comum continua valendo para o que sempre valeu, e o DeepSeek V4 Pro segue sendo o teto de custo-benefício na faixa de IQ 45+.

Em uma frase

Migre para o Flash batch apenas cargas assíncronas com multimodalidade; para tudo que precisa de resposta em segundos, o Flash tradicional ou o DeepSeek V4 Pro continuam sendo as opções certas.

Perguntas frequentes

Gemini 3.5 Flash batch é mais barato que o Flash comum?

Sim. O preço de saída cai de 9 para 4,50 dólares por milhão de tokens, e o cache de 0,75 para 0,075 por milhão — um décimo do valor normal. A contrapartida é que a entrega é assíncrona, em horas, não em tempo real.

Quando NÃO vale a pena usar o Flash batch?

Quando você precisa de resposta em segundos — chatbots, agentes interativos, qualquer coisa com usuário esperando na outra ponta. Nesses casos, o Flash tradicional síncrono ou um modelo de outra casa é mais adequado.

Flash batch ou DeepSeek V4 Pro?

Depende do que você precisa. O DeepSeek V4 Pro custa 1,74 dólar por milhão de saída e tem IQ parecido, mas não oferece a mesma multimodalidade completa de entrada — especialmente áudio e vídeo — nem a infraestrutura de fila assíncrona que a Google já opera.

Leia também