FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Gemini 3 Flash Preview cobra US$ 3 o milhão e ainda não tem nota de QI

Lançado há 11 dias, o modelo multimodal da Google entra no meio do bolo entre Claude Haiku 4.5 e a Xiaomi MiMo — sem índice de inteligência publicado até agora.

Redação FalaVIP IA 3 min de leitura
US$ 3por milhão de tokens de saída
US$ 0,05por milhão de tokens em cache (10× mais barato que a entrada)
1.048.576tokens de contexto (1M)

Você viu o anúncio. "Raciocínio quase Pro", "alta velocidade", "agentic workflows". Onze dias depois do lançamento, a pergunta que importa é outra: a conta fecha contra quem, e onde esse modelo te deixa na mão?

Ficha técnica — Gemini 3 Flash Preview
CampoValor
Identificadorgoogle/gemini-3-flash-preview
Criadorgoogle
Preço de entradaUS$ 0.500 / M tokens
Preço de saídaUS$ 3.00 / M tokens
Janela de contexto1.05M
Modalidadetext+image+file+audio+video->text
Leitura de cacheUS$ 0.050 / M (90% de desconto)

O que a Google está vendendo, em números reais

O Gemini 3 Flash Preview chegou em 17 de dezembro com três trunfos numéricos que você precisa ter na cabeça antes de abrir o dashboard da API:

  • 1.048.576 tokens de contexto. É o teto da categoria — cabe um livro inteiro, uma base de código grande, horas de transcrição de áudio num único prompt.
  • US$ 0,50 por milhão de tokens de entrada e US$ 3 por milhão de saída. Faixa intermediária do mercado: mais caro que os modelos chineses, mais barato que os americanos premium.
  • US$ 0,05 por milhão em cache. Um décimo do preço de entrada. Se o seu pipeline repete system prompt, tools ou documento longo a cada chamada, isso muda a fatura no fim do mês.

A modalidade é o pacote completo: texto, imagem, arquivo, áudio e vídeo entram; só texto sai. Canivete suíço multimodal.

Onde ele se encaixa no tabuleiro de hoje

Olha o topo do catálogo nesta data:

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 313 modelos disponíveis no catálogo nesta data.

O Gemini 3 Flash Preview entra entre a Mistral Devstral 2 (US$ 2 saída, QI 19,24) e a Claude Haiku 4.5 (US$ 5 saída, QI 29,89). Acima dele, em preço e supostamente em capacidade, fica a o3 (US$ 8 saída). Abaixo, a MiMo-V2-Flash da Xiaomi cobra US$ 0,30 — dez vezes mais barato — com QI 34,02, a melhor nota do catálogo nesta data.

O problema: o Gemini 3 Flash Preview ainda não tem nota de QI publicada. A descrição da Google fala em "raciocínio quase Pro", mas até essa data nenhum índice independente cravou o número. Você está comprando no escuro — o que é razoável em Preview, mas é o tipo de coisa que o financeiro precisa saber antes de aprovar a migração.

Para quem esse modelo faz sentido

Três perfis batem o olho:

  1. Engenharia de agentes com contexto longo. 1M de tokens é espaço de sobra para jogar tools, histórico e documento dentro do mesmo prompt. O preço de cache a US$ 0,05 favorece loops onde o system prompt se repete a cada turno.
  2. Pipelines multimodais que recebem áudio e vídeo. Poucos modelos nessa faixa de preço aceitam vídeo como entrada. Se a sua aplicação transcreve, resume ou extrai informação de mídia, o Flash é candidato natural.
  3. Prototipagem rápida de arquitetura. A nomenclatura "Flash" da Google historicamente sinaliza latência baixa. Para experimentar fluxos agentic antes de migrar para o Pro, é um ponto de partida honesto.

Quando NÃO vale a pena

  • Quando você precisa de benchmark publicado para defender a escolha. Se a decisão depende de número em leaderboard, espere. Não dá para justificar internamente "comprei porque o release disse quase Pro".
  • Quando o orçamento é apertado e o QI medido manda. A MiMo-V2-Flash da Xiaomi sai por US$ 0,30 o milhão de saída com QI 34,02 — o melhor do ranking. Se a tarefa cabe na capacidade medida da MiMo, é uma diferença de 10× na fatura sem perder qualidade.
  • Quando o raciocínio profundo é crítico. A o3 (US$ 8 saída) é outra categoria. Não é comparação justa, mas se o seu caso é pesquisa jurídica, análise multi-hop ou prova matemática, o Flash Preview não substitui um modelo de raciocínio pesado.
  • Quando você precisa de pesos abertos. O Gemini 3 Flash é fechado. O gpt-oss-120b da OpenAI (US$ 0,17 saída, QI 24,12) roda on-prem — para dados sensíveis ou regulados, é outra conversa.

O que fazer na segunda-feira

Se você já roda agentes com Claude Haiku 4.5, faça um teste A/B com Gemini 3 Flash Preview e meça três coisas: latência percebida, qualidade da resposta e — principalmente — o efeito do cache a US$ 0,05 no custo por chamada. Se a tarefa envolve vídeo ou documentos longos, o Flash provavelmente ganha. Se é raciocínio puro com orçamento curto, a MiMo entrega mais por menos.

E atualize a planilha de fornecedores: até sair nota de QI independente, trate o "raciocínio quase Pro" do release como marketing — não como SLA.

Em uma frase

Rode Gemini 3 Flash Preview em paralelo ao Claude Haiku 4.5 nos fluxos com vídeo e contexto longo, mas não migre tarefas críticas até sair benchmark independente — até lá, o "quase Pro" é promessa de release, não garantia.

Perguntas frequentes

Gemini 3 Flash Preview é gratuito?

Não, é um modelo pago. Custa US$ 0,50 por milhão de tokens de entrada, US$ 3 por milhão de saída e US$ 0,05 por milhão em cache. É a faixa intermediária do mercado, mais barata que Claude Haiku 4.5 e mais cara que a Xiaomi MiMo.

Vale a pena trocar o Claude Haiku 4.5 pelo Gemini 3 Flash Preview?

Depende do caso. O Gemini tem 1M de contexto, aceita vídeo como entrada e cobra menos por cache; o Haiku 4.5 tem QI medido em 29,89 e custa US$ 5/M de saída. Para agente multimodal com vídeo, teste o Gemini. Para raciocínio com benchmark publicado, fique no Haiku por enquanto.

Quando sai a nota de QI do Gemini 3 Flash Preview?

Até 28 de dezembro de 2025, o índice ainda não trazia medição publicada para esse modelo. Trate o "raciocínio quase Pro" do anúncio como marketing, não como garantia — e revise a posição quando a nota aparecer.

Leia também