FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Gemini 2.5 Flash Lite Preview cobra US$ 0,40 por milhão de saída: vale trocar?

Modelo leve da Google chega seis dias atrás com preço agressivo, mas sem nota de inteligência publicada e sem benchmark aberto.

Redação FalaVIP IA 3 min de leitura
US$ 0,40por milhão de tokens de saída
US$ 0,10por milhão de tokens de entrada
US$ 0,01por milhão de tokens em cache

O preço é o gancho — e também a dúvida

Seis dias depois do lançamento, o Gemini 2.5 Flash Lite Preview 09-2025 aparece com uma tabela de preço que parece feita para chamar atenção: US$ 0,10 por milhão de tokens de entrada, US$ 0,40 por milhão de saída e US$ 0,01 por milhão em cache. Em comparação direta, o o3 da OpenAI — que hoje lidera o índice de inteligência do catálogo — cobra US$ 8 por milhão de saída. São 20 vezes mais caro no mesmo item da fatura.

Mas comparar só pelo preço é o erro clássico. A pergunta que interessa é outra: o que você entrega de raciocínio por cada centavo? E aí o catálogo não ajuda, porque o Gemini 2.5 Flash Lite Preview não tem nota de inteligência publicada — iq_source é "atual", mas o índice desse modelo veio como null nos dados. Quem está comprando hoje está comprando no escuro do IQ, confiando apenas na descrição do criador.

Ficha técnica — Gemini 2.5 Flash Lite Previe
CampoValor
Identificadorgoogle/gemini-2.5-flash-lite-preview-09-2025
Criadorgoogle
Preço de entradaUS$ 0.100 / M tokens
Preço de saídaUS$ 0.400 / M tokens
Janela de contexto1.05M
Modalidadetext+image+file+audio+video->text
Leitura de cacheUS$ 0.010 / M (90% de desconto)

O que o Flash Lite Preview diz ser — e o que isso significa na prática

A descrição oficial trata o modelo como "leve, de baixa latência e otimizado para custo" dentro da família Gemini 2.5. Em outras palavras: ele não foi feito para ganhar disputa de benchmark, foi feito para processar muito token por pouco dinheiro. Isso combina com o preço agressivo e com o contexto de 1.048.576 tokens — um milhão de tokens de janela, suficiente para jogar livros inteiros, vídeos longos ou bases de código inteiras em uma única chamada.

A multimodalidade é ampla: aceita texto, imagem, arquivo, áudio e vídeo, e devolve só texto. Para quem monta pipeline de ingestão — transformar áudio de reunião em resumo, transcrever vídeo, extrair informação de PDF — esse tipo de modelo costuma ser o padrão da casa.

Onde ele se encaixa no tabuleiro

Olhando o topo do catálogo hoje, o cenário é este: o3 da OpenAI com IQ 31,096 e US$ 8/M de saída; gpt-oss-120b com IQ 24,126 e US$ 0,17/M de saída; Qwen3 Next 80B A3B Thinking com IQ 16,867 e US$ 1,20/M de saída; gpt-oss-20b com IQ 15,225 e US$ 0,13/M de saída; Llama 4 Maverick com IQ 14,477 e US$ 0,696/M de saída.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 244 modelos disponíveis no catálogo nesta data.

O Flash Lite Preview entra nesse meio sem nota de IQ, cobrando US$ 0,40/M de saída. Em termos de preço, ele fica mais caro que os dois modelos abertos da OpenAI (gpt-oss-120b e gpt-oss-20b), que são os verdadeiros concorrentes de prateleira na faixa dos centavos. Em termos de capacidade declarada, a diferença está no contexto massivo e na multimodalidade nativa — os gpt-oss são só texto.

Para quem vale — e para quem não muda nada

Vale a pena testar se você: precisa processar áudio, vídeo ou imagem em volume; quer uma janela de contexto de um milhão de tokens sem fragmentar o documento; está montando pipeline de classificação, extração ou resumo onde cada chamada precisa ser barata.

Não muda nada se você: precisa da melhor qualidade de raciocínio possível e o orçamento não é o gargalo — nesse caso, o3 segue sendo a referência medida; já tem um gpt-oss rodando bem no seu caso de uso e está satisfeito com o custo; depende de benchmark público para justificar a escolha para o time ou para o cliente.

O que falta para decidir

Três coisas que o catálogo ainda não entrega e que fariam diferença: a nota de IQ do Flash Lite Preview para colocá-lo na régua do mercado; um benchmark de coding e agentic para saber se ele aguenta tarefas de múltiplos passos; e a confirmação de que esse preço se mantém quando o modelo sair de "preview" — o sufixo no nome sugere que é tabela promocional.

Até lá, a recomendação prática é simples: rode um lote pequeno do seu caso de uso real — não de benchmark genérico — e compare o custo total com o gpt-oss-20b, que é o concorrente natural na mesma faixa de preço. Se a qualidade for próxima e a multimodalidade fizer diferença, o Flash Lite ganha. Se não, o modelo aberto da OpenAI continua sendo a aposta de menor risco.

Em uma frase

Trate o Flash Lite Preview como um experimento de custo em pipeline multimodal de alto volume, e só troque de modelo depois de medir no seu próprio caso — não no release da Google.

Perguntas frequentes

Quanto custa o Gemini 2.5 Flash Lite Preview na API?

US$ 0,10 por milhão de tokens de entrada, US$ 0,40 por milhão de tokens de saída e US$ 0,01 por milhão de tokens em cache. É uma das tabelas mais agressivas do catálogo para um modelo com contexto de um milhão de tokens e multimodalidade nativa.

O Gemini 2.5 Flash Lite Preview tem benchmark de inteligência?

Não no catálogo atual. O índice de IQ veio como nulo nos dados disponíveis, então não dá para colocá-lo na régua do o3 ou dos modelos abertos da OpenAI só por número. A comparação precisa ser feita no seu próprio caso de uso.

Quando faz sentido trocar pelo Flash Lite Preview?

Quando o gargalo é custo por chamada em tarefas multimodais de alto volume — transcrição, resumo, extração — e o contexto de um milhão de tokens agrega valor. Não faz sentido quando você precisa do melhor raciocínio disponível ou já roda um gpt-oss-20b com resultado satisfatório.

Leia também