Gemini 3.1 Flash Lite cobra 8x menos que o Pro — e ainda não tem nota de QI
Há 17 dias no catálogo, a versão Lite da família 3.1 traz 1 milhão de contexto e multimodalidade por US$ 1,50 por milhão de tokens de saída. O verdadeiro destaque está no preço do cache.
Paga 8x menos que o Pro, e ainda não tem nota
Paga oito vezes menos que o Pro Preview, é multimodal, tem 1 milhão de contexto. E ainda não tem nota de inteligência publicada. Esse é o Gemini 3.1 Flash Lite, lançado há 17 dias e que, se você só olhou o preço de saída — US$ 1,50 por milhão de tokens — perdeu o número que de fato muda a sua fatura no fim do mês.
Antes de chegar lá, o básico.
| Campo | Valor |
|---|---|
| Identificador | google/gemini-3.1-flash-lite:batch |
| Criador | |
| Preço de entrada | US$ 0.125 / M tokens |
| Preço de saída | US$ 0.750 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text+image+file+audio+video->text |
| Leitura de cache | US$ 0.013 / M (90% de desconto) |
A ficha mostra o que a Google publicou e, principalmente, o que ela ainda não publicou. Não há nota de inteligência, não há nota de código, não há nota de raciocínio, nem score agentic. O catálogo guarda o modelo há 17 dias e o índice de capacidade cognitiva ainda não foi medido — ou ainda não foi liberado. Para um lançamento da Google em maio de 2026, é um silêncio incomum.
O que a Google está te vendendo (e o que ela não te conta)
A descrição oficial repete três expressões que você precisa ler com cuidado: "high-efficiency", "low-latency", "high-volume". Traduzindo do marketing: este não é o modelo para a tarefa difícil. É o modelo para a mesma tarefa feita um milhão de vezes. O contexto de 1.048.576 tokens — um milhão — numa versão "Lite" também não é detalhe: é a deixa explícita para workloads que dependem de muito material reaproveitado a cada chamada.
E é aqui que entra o número que muda a conta.
US$ 0,025 por milhão no cache: a economia real
O cache do Flash Lite custa US$ 0,025 por milhão de tokens lidos. O input normal custa US$ 0,25 — dez vezes mais. Na prática, se você consegue manter o contexto do seu sistema dentro do cache, o custo de cada nova chamada fica praticamente concentrado no output.
Imagine um agente que precisa reler 200 mil tokens de prompt a cada turno. No input direto, são US$ 0,05 por chamada. Lendo do cache, US$ 0,005. Em cem mil chamadas, a diferença é de US$ 4.500. Em um milhão de chamadas, US$ 45.000. É o tipo de economia que decide se um produto de IA existe como negócio ou só como POC.
O cache serve para prompts grandes e repetidos: definição de persona, contexto de RAG, instruções de tool-use, system prompts longos, transcrições reaproveitadas. Não serve para conversa descartável, nem para prompt curto — aí o cache não tem como te ajudar.
Onde ele se encaixa no tabuleiro
O Flash Lite não concorre com o topo da casa Google. Concorre com o seu próprio custo de oportunidade.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
| MiMo-V2.5-Pro | 42.9 | 0.87 |
No panorama de hoje, o Flash Lite aparece como a opção multimodal mais barata entre os modelos Gemini listados, e ligeiramente mais barato na saída que o DeepSeek V4 Pro 0423 (US$ 1,74 por milhão) — embora o DeepSeek traga nota de inteligência 45,268 e o Flash Lite, por enquanto, não traga nenhuma. Contra o Gemini 3.5 Flash, a diferença é grande: US$ 9,00 contra US$ 1,50 por milhão de saída. Contra o Pro Preview, são oito vezes mais barato.
Vale situar: 34 modelos entraram no catálogo nos últimos 30 dias, e o catálogo passa de 447. Entre os modelos com 1 milhão de contexto, multimodalidade completa (texto, imagem, vídeo, áudio, PDF) e saída abaixo de US$ 2 por milhão, a lista encolhe depressa.
Para quem vale, para quem não muda, e o que fazer amanhã
Vale para você se: você roda sistema com prompt grande e repetido — RAG com contexto longo, agente conversacional com persona fixa, ferramenta de análise de documento multimodal; você precisa de multimodalidade barata num único endpoint; o gargalo do seu produto é custo por chamada, não qualidade absoluta de resposta.
Não muda nada se: suas chamadas são curtas e únicas e o cache não tem como te ajudar; você precisa de raciocínio forte, coding consistente ou agentic de qualidade — sem nota publicada, o risco de regressão é alto e o Pro Preview existe por um motivo; você já roda DeepSeek V4 Pro com nota 45,268 e não tem motivo específico para ficar no ecossistema Gemini.
Se a sua fatura é dominada por chamadas repetitivas com contexto grande, monte um teste de duas semanas com o Flash Lite cacheado. Meça custo por conversa completa, não só por token. E antes de migrar de vez, pergunte à Google: qual a política de expiração do cache e qual a latência de p99. Preço baixo sem SLA de cache é só marketing.
Se o seu gargalo é custo por chamada repetitiva com contexto grande, teste o Flash Lite cacheado por duas semanas e meça a fatura por conversa — se você precisa de raciocínio forte, ignore e siga no Pro Preview.
Perguntas frequentes
Quanto custa o Gemini 3.1 Flash Lite por milhão de tokens?
Input a US$ 0,25, saída a US$ 1,50 e leitura de cache a US$ 0,025 por milhão. É um dos modelos da família 3.1 com menor preço de saída, mas não é gratuito — exige conta faturada na API do Google.
O cache de US$ 0,025 por milhão compensa mesmo?
Compensa quando o mesmo contexto grande é reutilizado em muitas chamadas. O cache custa dez vezes menos que o input normal; em workloads com prompt repetido, a diferença de frações de centavo por chamada vira milhares de dólares por mês.
Gemini 3.1 Flash Lite serve para programação ou raciocínio?
Não há nota pública de coding, agentic ou raciocínio no catálogo. Para essas tarefas, o Gemini 3.1 Pro Preview (IQ 47,738) ou o GPT-5.3-Codex (45,512) continuam sendo apostas mais seguras até surgirem benchmarks independentes do Flash Lite.