FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Gemini 3.1 Flash Lite em modo batch custa quase nada — e expõe uma escolha

A versão batch do modelo mais barato do Google entra em produção com janela de 1M de tokens e preço de centavos. Vale trocar o que você roda hoje?

Redação FalaVIP IA 3 min de leitura
US$ 0,75por milhão de tokens de saída
US$ 0,0125por milhão de tokens de cache
US$ 0,125por milhão de tokens de entrada

Sessenta e nove centavos de dólar. É o que custa, em 23 de maio de 2026, gerar um milhão de tokens de saída do Gemini 3.1 Flash Lite rodando em modo batch. A conta cabe no caixa de qualquer projeto pessoal — e é exatamente esse o ponto que faz a versão batch merecer uma análise, não um aviso de lançamento.

O que muda quando você liga o "batch"

O Gemini 3.1 Flash Lite já existe como modelo geral do Google há mais tempo. O que entra agora em catálogo, em 7 de maio, é a variante :batch: a mesma arquitetura, o mesmo contexto de 1.048.576 tokens, a mesma pilha multimodal (texto, imagem, vídeo, áudio e PDF na entrada, texto na saída). O que muda é o regime de execução. Você empacota as requisições, entrega para a API processar em janela de até 24 horas e, em troca, paga outra tarifa. O catálogo não publicou preço diferenciado para a variante batch neste modelo — o que está tabelado é o preço-base de US$ 0,125 por milhão de entrada e US$ 0,75 por milhão de saída —, então o cálculo real de desconto depende de cotação direta no provedor. Dito isso, a conta que importa já está na régua.

Ficha técnica — Gemini 3.1 Flash Lite
CampoValor
Identificadorgoogle/gemini-3.1-flash-lite
Criadorgoogle
Preço de entradaUS$ 0.250 / M tokens
Preço de saídaUS$ 1.50 / M tokens
Janela de contexto1.05M
Modalidadetext+image+file+audio+video->text
Leitura de cacheUS$ 0.025 / M (90% de desconto)

O preço só faz sentido comparado

Coloque o Flash Lite em batch do lado do que está no topo do mercado hoje. O Gemini 3.1 Pro Preview cobra US$ 12 por milhão de saída — são 16 vezes mais caro. O GPT-5.3-Codex, da OpenAI, está em US$ 14. O Gemini 3.5 Flash, do mesmo Google, cobra US$ 9. O DeepSeek V4 Pro, que disputa o segmento de custo baixo, está em US$ 1,74. Só que o Flash Lite batch custa menos da metade do DeepSeek mais barato acima da faixa de IQ 45.

Traduzindo o que o marketing do Google não diz em letras garrafais: a conta por milhão de saída aqui é a mesma de uma pizza média em São Paulo. Em volume, isso muda a aritmética de qualquer produto que depende de classificação, extração, resumo ou rotulação em cima de documentos.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
Entre os 447 modelos disponíveis no catálogo nesta data.

Para quem esse modelo vale a troca

Se a sua carga é assíncrona e tolerantemente lenta — pipelines noturnos, varredura de base de documentos, geração massiva de embeddings, sumarização de chamadas de suporte, pré-rotulagem para fine-tuning —, o Flash Lite em batch é candidato sério. A janela de 1M de tokens come PDFs inteiros sem você ter que fragmentar; a entrada multimodal aceita áudio e vídeo, o que destrava casos que antes pediam modelo dedicado de visão. E o preço de cache de US$ 0,0125 por milhão de tokens é o tipo de número que faz prompts longos com system prompt repetido virarem commodity.

Para quem não muda nada

Se você precisa de resposta em tempo real (chat ao vivo, agente interativo, chamada de função com latência sensível), batch não é a ferramenta — você quer a versão síncrona do Flash Lite, ou outro modelo com latência explícita. E se o que você quer é capacidade de raciocínio, o catálogo atual não publicou índice de IQ, coding ou agentic para essa variante; sem número, não há argumento técnico para dizer que ela compete com Pro, Codex ou DeepSeek V4 Pro na qualidade do output. Use para volume, não para a tarefa em que o erro caro.

O tabuleiro em maio de 2026

O Google publicou 41 modelos nos últimos 30 dias e hoje lista 447 no total, vindos de 61 criadores. O topo do ranking de inteligência é do Gemini 3.1 Pro Preview, com IQ 47,738, seguido pelo Gemini 3.5 Flash e pelo GPT-5.3-Codex. O Flash Lite batch não entra nessa conversa — ele não foi desenhado para isso. A pergunta certa não é "ele é o melhor modelo?", e sim "ele é o modelo certo para a parte da minha fatura que não precisa ser a melhor?" A resposta, para a maioria dos jobs de fundo, é sim.

Em uma frase

Mova para o Flash Lite batch o que é assíncrono, multimodal e tolerante a latência; mantenha Pro, Codex ou DeepSeek V4 Pro no que exige raciocínio ou resposta em tempo real.

Perguntas frequentes

Quanto custa o Gemini 3.1 Flash Lite em modo batch?

O catálogo lista US$ 0,125 por milhão de tokens de entrada e US$ 0,75 por milhão de saída para o Gemini 3.1 Flash Lite (batch). A tarifa diferenciada da janela batch em si não está publicada — confirme o desconto direto no provedor antes de fechar o cálculo.

Gemini 3.1 Flash Lite batch serve para uso em tempo real?

Não. A variante `:batch` foi desenhada para processamento em até 24 horas, sem garantia de latência. Para chat ao vivo ou agentes interativos, use a versão síncrona do Flash Lite ou um modelo com latência explícita.

Qual a diferença entre Gemini 3.1 Flash Lite batch e DeepSeek V4 Pro?

O Flash Lite batch é multimodal (texto, imagem, vídeo, áudio, PDF) e tem contexto de 1M de tokens, com preço tabelado muito abaixo. O DeepSeek V4 Pro entra no índice de IQ 45,268 e custa US$ 1,74 por milhão de saída — mais caro, mas com nota de inteligência publicada e proposta de raciocínio; o Flash Lite batch ainda não tem IQ, coding nem agentic registrados no catálogo.

Leia também