Gemini 3 Flash Preview custa US$ 3 por milhão de saída e mira o o3
Google lança versão preview do Flash com raciocínio próximo ao Pro, contexto de 1M e preço 60% menor que o o3 da OpenAI.
O Flash ficou caro ou ficou barato? Depende de com quem você compara
A conta da API tem uma lógica cruel: o que importa não é o preço absoluto, é o preço relativo ao modelo que você trocou. O Gemini 3 Flash Preview chega hoje cobrando US$ 3 por milhão de tokens de saída no modo padrão e US$ 1,50 no modo batch — metade do preço, literalmente. O detalhe está em qual régua você usa.
Contra o o3 da OpenAI, que sai por US$ 8 por milhão de tokens, o Flash Preview é 62% mais barato na saída. Contra o Claude Haiku 4.5, da Anthropic, a diferença cai para 40% mais barato. E contra o MiMo-V2-Flash, da Xiaomi, que lidera o índice de inteligência atual com 34,024, o Flash Preview sai dez vezes mais caro — US$ 3 contra US$ 0,30 por milhão de tokens. Então a pergunta não é "o Flash é barato", é "barato em relação a quem".
O que o Google está vendendo, de verdade
A descrição oficial chama o Gemini 3 Flash Preview de "modelo de raciocínio de alta velocidade e alto valor, projetado para fluxos agentic, chat multi-turno e assistência de código". Traduzindo: é a versão econômica da linha Gemini 3, com a promessa de raciocínio "quase no nível Pro". O contexto é de 1.048.576 tokens — 1M, mesma ordem dos modelos Pro da casa. Modalidade completa: texto, imagem, arquivo, áudio e vídeo entrando; texto saindo.
| Campo | Valor |
|---|---|
| Identificador | google/gemini-3-flash-preview |
| Criador | |
| Preço de entrada | US$ 0.500 / M tokens |
| Preço de saída | US$ 3.00 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text+image+file+audio+video->text |
| Leitura de cache | US$ 0.050 / M (90% de desconto) |
O preço de cache está em US$ 0,05 por milhão de tokens de entrada — um número que costuma passar batido, mas que para quem faz RAG pesado muda a economia do mês. Não é gratuito, não é o mais barato do mercado, mas está na faixa em que cache começa a compensar arquiteturas com system prompt longo.
Onde ele se encaixa no tabuleiro de dezembro
O catálogo tem 309 modelos listados hoje, vindos de 47 criadores diferentes. Nos últimos 30 dias, 33 modelos foram lançados — o ritmo não está diminuindo. O topo do índice de inteligência atual tem a Xiaomi na frente com o MiMo-V2-Flash (34,024), seguida do o3 da OpenAI (31,096) e do Claude Haiku 4.5 (29,892). O Gemini 3 Flash Preview estreia sem nota de inteligência publicada no catálogo.
Isso é o ponto que precisa ser dito com todas as letras: o índice de inteligência é a medição de hoje, não a da época do lançamento. Sem nota publicada, não dá para afirmar que o Flash Preview "supera" ou "fica atrás" de ninguém no ranking. O que dá para dizer é o seguinte: pelo preço pedido, ele entra na faixa do Claude Haiku 4.5 e do o3 — e custa uma fração do MiMo-V2-Flash.
Para quem vale, para quem não muda nada
Se você está rodando o o3 em produção e a fatura de saída está mordendo, o Flash Preview é a primeira coisa a testar. A redução de 62% no custo de saída, mantendo a promessa de raciocínio de ponta, é o tipo de corte que aparece no fim do mês. Para quem já está no Claude Haiku 4.5, a economia existe (40% mais barato na saída), mas é menor — e aí a decisão vira benchmark de qualidade, não de preço.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Gemini 3 Flash Preview (o novo) | — | 0.5 | 3 | 1.05M |
| MiMo-V2-Flash | 34.0 | 0.1 | 0.3 | 262k |
| o3 | 31.1 | 2 | 8 | 200k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
Se você descobriu o MiMo-V2-Flash da Xiaomi e está pagando US$ 0,30 por milhão de tokens de saída, o Flash Preview não é seu concorrente — é outro produto, dez vezes mais caro. A escolha aí é entre pagar barato por um modelo que lidera o índice atual ou pagar mais caro por uma stack que talvez tenha melhor suporte de ferramentas, latência ou estabilidade de API. Cada caso é um caso.
A linha completa do dia
O Google não soltou só o Flash Preview. Junto veio a variante batch, com preço pela metade: US$ 0,25 por milhão de entrada e US$ 1,50 por milhão de saída, mesmo contexto de 1M tokens. Batch significa processamento assíncrono, com SLA mais longo — útil para jobs noturnos, reindexações, geração em massa. Se você tem workload que tolera esperar, a economia é real.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Gemini 3 Flash Preview (batc | 0.25 | 1.5 | 1.05M |
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O que você faz com isso amanhã de manhã: roda um prompt idêntico nos três modelos — Flash Preview, o3 e Claude Haiku 4.5 — no mesmo workload real, e mede qualidade por três dias. Se a diferença for marginal, a economia de 40% a 62% na saída paga o almoço do trimestre.
Teste o Gemini 3 Flash Preview contra o o3 e o Claude Haiku 4.5 no seu workload real: se a qualidade for próxima, a economia de 40% a 62% na saída aparece já na próxima fatura.
Perguntas frequentes
Quanto custa o Gemini 3 Flash Preview?
US$ 0,50 por milhão de tokens de entrada e US$ 3 por milhão de tokens de saída no modo padrão. No modo batch, cai para US$ 0,25 de entrada e US$ 1,50 de saída. Cache de entrada sai por US$ 0,05 por milhão.
O Gemini 3 Flash Preview é mais barato que o o3?
Sim, na saída. O o3 cobra US$ 8 por milhão de tokens de saída e o Flash Preview cobra US$ 3 — uma redução de 62%. A diferença para o Claude Haiku 4.5 (US$ 5 de saída) é menor, 40% mais barato.
Qual o tamanho de contexto do Gemini 3 Flash Preview?
1.048.576 tokens, equivalente a 1M. É o mesmo patamar dos modelos Pro da linha Gemini e suficiente para a maioria dos workloads de documento longo e código.