FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Gemini 3.1 Flash Lite cobra 8x menos que o Pro — e ainda não tem nota de QI

Há 17 dias no catálogo, a versão Lite da família 3.1 traz 1 milhão de contexto e multimodalidade por US$ 1,50 por milhão de tokens de saída. O verdadeiro destaque está no preço do cache.

Redação FalaVIP IA 3 min de leitura
US$ 1,50por milhão de tokens de saída
US$ 0,025por milhão de tokens lidos do cache
1.048.576tokens de contexto

Paga 8x menos que o Pro, e ainda não tem nota

Paga oito vezes menos que o Pro Preview, é multimodal, tem 1 milhão de contexto. E ainda não tem nota de inteligência publicada. Esse é o Gemini 3.1 Flash Lite, lançado há 17 dias e que, se você só olhou o preço de saída — US$ 1,50 por milhão de tokens — perdeu o número que de fato muda a sua fatura no fim do mês.

Antes de chegar lá, o básico.

Ficha técnica — Gemini 3.1 Flash Lite (batch
CampoValor
Identificadorgoogle/gemini-3.1-flash-lite:batch
Criadorgoogle
Preço de entradaUS$ 0.125 / M tokens
Preço de saídaUS$ 0.750 / M tokens
Janela de contexto1.05M
Modalidadetext+image+file+audio+video->text
Leitura de cacheUS$ 0.013 / M (90% de desconto)

A ficha mostra o que a Google publicou e, principalmente, o que ela ainda não publicou. Não há nota de inteligência, não há nota de código, não há nota de raciocínio, nem score agentic. O catálogo guarda o modelo há 17 dias e o índice de capacidade cognitiva ainda não foi medido — ou ainda não foi liberado. Para um lançamento da Google em maio de 2026, é um silêncio incomum.

O que a Google está te vendendo (e o que ela não te conta)

A descrição oficial repete três expressões que você precisa ler com cuidado: "high-efficiency", "low-latency", "high-volume". Traduzindo do marketing: este não é o modelo para a tarefa difícil. É o modelo para a mesma tarefa feita um milhão de vezes. O contexto de 1.048.576 tokens — um milhão — numa versão "Lite" também não é detalhe: é a deixa explícita para workloads que dependem de muito material reaproveitado a cada chamada.

E é aqui que entra o número que muda a conta.

US$ 0,025 por milhão no cache: a economia real

O cache do Flash Lite custa US$ 0,025 por milhão de tokens lidos. O input normal custa US$ 0,25 — dez vezes mais. Na prática, se você consegue manter o contexto do seu sistema dentro do cache, o custo de cada nova chamada fica praticamente concentrado no output.

Imagine um agente que precisa reler 200 mil tokens de prompt a cada turno. No input direto, são US$ 0,05 por chamada. Lendo do cache, US$ 0,005. Em cem mil chamadas, a diferença é de US$ 4.500. Em um milhão de chamadas, US$ 45.000. É o tipo de economia que decide se um produto de IA existe como negócio ou só como POC.

O cache serve para prompts grandes e repetidos: definição de persona, contexto de RAG, instruções de tool-use, system prompts longos, transcrições reaproveitadas. Não serve para conversa descartável, nem para prompt curto — aí o cache não tem como te ajudar.

Onde ele se encaixa no tabuleiro

O Flash Lite não concorre com o topo da casa Google. Concorre com o seu próprio custo de oportunidade.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
Entre os 447 modelos disponíveis no catálogo nesta data.

No panorama de hoje, o Flash Lite aparece como a opção multimodal mais barata entre os modelos Gemini listados, e ligeiramente mais barato na saída que o DeepSeek V4 Pro 0423 (US$ 1,74 por milhão) — embora o DeepSeek traga nota de inteligência 45,268 e o Flash Lite, por enquanto, não traga nenhuma. Contra o Gemini 3.5 Flash, a diferença é grande: US$ 9,00 contra US$ 1,50 por milhão de saída. Contra o Pro Preview, são oito vezes mais barato.

Vale situar: 34 modelos entraram no catálogo nos últimos 30 dias, e o catálogo passa de 447. Entre os modelos com 1 milhão de contexto, multimodalidade completa (texto, imagem, vídeo, áudio, PDF) e saída abaixo de US$ 2 por milhão, a lista encolhe depressa.

Para quem vale, para quem não muda, e o que fazer amanhã

Vale para você se: você roda sistema com prompt grande e repetido — RAG com contexto longo, agente conversacional com persona fixa, ferramenta de análise de documento multimodal; você precisa de multimodalidade barata num único endpoint; o gargalo do seu produto é custo por chamada, não qualidade absoluta de resposta.

Não muda nada se: suas chamadas são curtas e únicas e o cache não tem como te ajudar; você precisa de raciocínio forte, coding consistente ou agentic de qualidade — sem nota publicada, o risco de regressão é alto e o Pro Preview existe por um motivo; você já roda DeepSeek V4 Pro com nota 45,268 e não tem motivo específico para ficar no ecossistema Gemini.

Se a sua fatura é dominada por chamadas repetitivas com contexto grande, monte um teste de duas semanas com o Flash Lite cacheado. Meça custo por conversa completa, não só por token. E antes de migrar de vez, pergunte à Google: qual a política de expiração do cache e qual a latência de p99. Preço baixo sem SLA de cache é só marketing.

Em uma frase

Se o seu gargalo é custo por chamada repetitiva com contexto grande, teste o Flash Lite cacheado por duas semanas e meça a fatura por conversa — se você precisa de raciocínio forte, ignore e siga no Pro Preview.

Perguntas frequentes

Quanto custa o Gemini 3.1 Flash Lite por milhão de tokens?

Input a US$ 0,25, saída a US$ 1,50 e leitura de cache a US$ 0,025 por milhão. É um dos modelos da família 3.1 com menor preço de saída, mas não é gratuito — exige conta faturada na API do Google.

O cache de US$ 0,025 por milhão compensa mesmo?

Compensa quando o mesmo contexto grande é reutilizado em muitas chamadas. O cache custa dez vezes menos que o input normal; em workloads com prompt repetido, a diferença de frações de centavo por chamada vira milhares de dólares por mês.

Gemini 3.1 Flash Lite serve para programação ou raciocínio?

Não há nota pública de coding, agentic ou raciocínio no catálogo. Para essas tarefas, o Gemini 3.1 Pro Preview (IQ 47,738) ou o GPT-5.3-Codex (45,512) continuam sendo apostas mais seguras até surgirem benchmarks independentes do Flash Lite.

Leia também