Gemini 3 Flash Preview cobra US$ 3 o milhão e ainda não tem nota de QI
Lançado há 11 dias, o modelo multimodal da Google entra no meio do bolo entre Claude Haiku 4.5 e a Xiaomi MiMo — sem índice de inteligência publicado até agora.
Você viu o anúncio. "Raciocínio quase Pro", "alta velocidade", "agentic workflows". Onze dias depois do lançamento, a pergunta que importa é outra: a conta fecha contra quem, e onde esse modelo te deixa na mão?
| Campo | Valor |
|---|---|
| Identificador | google/gemini-3-flash-preview |
| Criador | |
| Preço de entrada | US$ 0.500 / M tokens |
| Preço de saída | US$ 3.00 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text+image+file+audio+video->text |
| Leitura de cache | US$ 0.050 / M (90% de desconto) |
O que a Google está vendendo, em números reais
O Gemini 3 Flash Preview chegou em 17 de dezembro com três trunfos numéricos que você precisa ter na cabeça antes de abrir o dashboard da API:
- 1.048.576 tokens de contexto. É o teto da categoria — cabe um livro inteiro, uma base de código grande, horas de transcrição de áudio num único prompt.
- US$ 0,50 por milhão de tokens de entrada e US$ 3 por milhão de saída. Faixa intermediária do mercado: mais caro que os modelos chineses, mais barato que os americanos premium.
- US$ 0,05 por milhão em cache. Um décimo do preço de entrada. Se o seu pipeline repete system prompt, tools ou documento longo a cada chamada, isso muda a fatura no fim do mês.
A modalidade é o pacote completo: texto, imagem, arquivo, áudio e vídeo entram; só texto sai. Canivete suíço multimodal.
Onde ele se encaixa no tabuleiro de hoje
Olha o topo do catálogo nesta data:
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O Gemini 3 Flash Preview entra entre a Mistral Devstral 2 (US$ 2 saída, QI 19,24) e a Claude Haiku 4.5 (US$ 5 saída, QI 29,89). Acima dele, em preço e supostamente em capacidade, fica a o3 (US$ 8 saída). Abaixo, a MiMo-V2-Flash da Xiaomi cobra US$ 0,30 — dez vezes mais barato — com QI 34,02, a melhor nota do catálogo nesta data.
O problema: o Gemini 3 Flash Preview ainda não tem nota de QI publicada. A descrição da Google fala em "raciocínio quase Pro", mas até essa data nenhum índice independente cravou o número. Você está comprando no escuro — o que é razoável em Preview, mas é o tipo de coisa que o financeiro precisa saber antes de aprovar a migração.
Para quem esse modelo faz sentido
Três perfis batem o olho:
- Engenharia de agentes com contexto longo. 1M de tokens é espaço de sobra para jogar tools, histórico e documento dentro do mesmo prompt. O preço de cache a US$ 0,05 favorece loops onde o system prompt se repete a cada turno.
- Pipelines multimodais que recebem áudio e vídeo. Poucos modelos nessa faixa de preço aceitam vídeo como entrada. Se a sua aplicação transcreve, resume ou extrai informação de mídia, o Flash é candidato natural.
- Prototipagem rápida de arquitetura. A nomenclatura "Flash" da Google historicamente sinaliza latência baixa. Para experimentar fluxos agentic antes de migrar para o Pro, é um ponto de partida honesto.
Quando NÃO vale a pena
- Quando você precisa de benchmark publicado para defender a escolha. Se a decisão depende de número em leaderboard, espere. Não dá para justificar internamente "comprei porque o release disse quase Pro".
- Quando o orçamento é apertado e o QI medido manda. A MiMo-V2-Flash da Xiaomi sai por US$ 0,30 o milhão de saída com QI 34,02 — o melhor do ranking. Se a tarefa cabe na capacidade medida da MiMo, é uma diferença de 10× na fatura sem perder qualidade.
- Quando o raciocínio profundo é crítico. A o3 (US$ 8 saída) é outra categoria. Não é comparação justa, mas se o seu caso é pesquisa jurídica, análise multi-hop ou prova matemática, o Flash Preview não substitui um modelo de raciocínio pesado.
- Quando você precisa de pesos abertos. O Gemini 3 Flash é fechado. O gpt-oss-120b da OpenAI (US$ 0,17 saída, QI 24,12) roda on-prem — para dados sensíveis ou regulados, é outra conversa.
O que fazer na segunda-feira
Se você já roda agentes com Claude Haiku 4.5, faça um teste A/B com Gemini 3 Flash Preview e meça três coisas: latência percebida, qualidade da resposta e — principalmente — o efeito do cache a US$ 0,05 no custo por chamada. Se a tarefa envolve vídeo ou documentos longos, o Flash provavelmente ganha. Se é raciocínio puro com orçamento curto, a MiMo entrega mais por menos.
E atualize a planilha de fornecedores: até sair nota de QI independente, trate o "raciocínio quase Pro" do release como marketing — não como SLA.
Rode Gemini 3 Flash Preview em paralelo ao Claude Haiku 4.5 nos fluxos com vídeo e contexto longo, mas não migre tarefas críticas até sair benchmark independente — até lá, o "quase Pro" é promessa de release, não garantia.
Perguntas frequentes
Gemini 3 Flash Preview é gratuito?
Não, é um modelo pago. Custa US$ 0,50 por milhão de tokens de entrada, US$ 3 por milhão de saída e US$ 0,05 por milhão em cache. É a faixa intermediária do mercado, mais barata que Claude Haiku 4.5 e mais cara que a Xiaomi MiMo.
Vale a pena trocar o Claude Haiku 4.5 pelo Gemini 3 Flash Preview?
Depende do caso. O Gemini tem 1M de contexto, aceita vídeo como entrada e cobra menos por cache; o Haiku 4.5 tem QI medido em 29,89 e custa US$ 5/M de saída. Para agente multimodal com vídeo, teste o Gemini. Para raciocínio com benchmark publicado, fique no Haiku por enquanto.
Quando sai a nota de QI do Gemini 3 Flash Preview?
Até 28 de dezembro de 2025, o índice ainda não trazia medição publicada para esse modelo. Trate o "raciocínio quase Pro" do anúncio como marketing, não como garantia — e revise a posição quando a nota aparecer.