FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Gemini 3 Flash batch é 70% mais barato que o Haiku, mas só se você pode esperar

Dez dias depois do lançamento, o endpoint assíncrono do Google cobra US$ 1,50 por milhão de saída e abre 1 milhão de contexto — sem benchmark público de IQ para comparar.

Redação FalaVIP IA 3 min de leitura
US$ 0,25por milhão de tokens de entrada
US$ 1,50por milhão de tokens de saída
70%mais barato que Claude Haiku 4.5 no output

Dez dias depois do lançamento, o Gemini 3 Flash Preview já está no catálogo — em modo batch. E o sufixo ":batch" no ID é o que decide se ele serve para você ou não. O resto do release repete a fórmula da casa: "raciocínio quase Pro a preço de Flash". Traduzindo: você está trocando latência por economia. Nada mais.

O detalhe ":batch" que decide tudo

Endpoint batch nos provedores como o Google significa processamento assíncrono. Você enfileira a requisição, recebe minutos ou horas depois, e em troca paga menos por token. O Gemini 3 Flash Preview batch sai por US$ 0,25 por milhão de tokens de entrada e US$ 1,50 por milhão de tokens de saída. É o tier Flash do Google empurrado para a fila barata.

Ficha técnica — Gemini 3 Flash Preview (batc
CampoValor
Identificadorgoogle/gemini-3-flash-preview:batch
Criadorgoogle
Preço de entradaUS$ 0.250 / M tokens
Preço de saídaUS$ 1.50 / M tokens
Janela de contexto1.05M
Modalidadetext+image+file+audio+video->text

Pense como um Sedex econômico: mesmo produto, prazo maior, frete menor. Quem não pode esperar, não compra.

Comparado a quem está brigando pelo mesmo cliente

A conta só fecha posta na mesa ao lado de quem está disputando o mesmo pedaço.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 313 modelos disponíveis no catálogo nesta data.

Olhando o topo do catálogo pelo índice de inteligência medido hoje:

  • O MiMo-V2-Flash da Xiaomi lidera com IQ 34 e cobra US$ 0,30 por milhão de saída — um quinto do que o Gemini batch pede.
  • O Claude Haiku 4.5 da Anthropic cobra US$ 5 por milhão de saída com IQ 29,9.
  • O o3 da OpenAI cobra US$ 8 por milhão de saída com IQ 31,1.
  • O gpt-oss-120b, com pesos abertos, sai por US$ 0,17 por milhão de saída com IQ 24,1.

Traduzindo: o Gemini batch é 70% mais barato que o Haiku 4.5 no output e 81% mais barato que o o3. Mas é cinco vezes mais caro que o MiMo e quase nove vezes mais caro que o gpt-oss-120b. O argumento do Google não é "mais barato do mundo" — é "mais barato multimodal com 1 milhão de contexto".

O ponto cego: o catálogo ainda não mediu esse modelo

Aqui mora o detalhe que merece leitura cuidadosa. O Gemini 3 Flash Preview batch entrou no diretório sem IQ, sem nota de coding, sem nota agentic, sem velocidade publicada, sem parâmetros, sem país de origem, sem cutoff de conhecimento. O catálogo simplesmente não publicou esses números.

Isso muda como você lê o "raciocínio quase Pro" do release: não é uma afirmação verificável pelas métricas públicas do mercado. É uma promessa. Para um CTO fechando plano de API, promessa sem benchmark anexo, ao lado do Claude Haiku e do o3, pesa diferente.

Para quem vale, para quem não, e o que fazer

Vale a fila se você precisa processar lote: transcrição de vídeo em massa, classificação de documentos longos, análise de PDFs com imagem anexada, geração assíncrona em pipelines com worker separado. O contexto de 1.048.576 tokens (um milhão) é o chamariz real — cabe relatório inteiro, livro ou horas de vídeo em uma chamada, e a fila batch absorve bem esse volume.

Vale especialmente se a alternativa era Haiku 4.5 ou o3 e o orçamento de saída era o gargalo.

Não vale se o caso é chat em tempo real ou qualquer UX síncrona. Batch não é para usuário esperando resposta.

Não vale se você só quer texto curto barato. O MiMo a US$ 0,30 de saída ganha em custo sem precisar de multimodal.

Não vale se você precisa de pesos abertos para rodar on-premise. O gpt-oss-120b segue sendo o caminho nessa faixa.

Se você já tem pipeline assíncrono rodando Haiku 4.5 ou o3, vale testar o Gemini 3 Flash batch com uma fração do tráfego e medir qualidade antes de migrar. Se está começando do zero, o MiMo é o mais barato do topo e o Gemini batch é o mais barato multimodal com contexto largo — são apostas diferentes. E se o release citou "raciocínio quase Pro" sem benchmark anexado, peça o benchmark. É a única forma de saber se a promessa vale a fila.

Em uma frase

Use Gemini 3 Flash batch para jobs assíncronos com 1M de contexto e multimodal; para texto curto barato, escolha MiMo; para pesos abertos on-premise, vá de gpt-oss-120b.

Perguntas frequentes

Gemini 3 Flash batch é mais barato que o Gemini 3 Flash normal?

Sim, o sufixo ":batch" indica o endpoint assíncrono, que cobra menos por token em troca de latência maior — você enfileira a requisição e recebe minutos ou horas depois. Quem precisa de resposta imediata deve usar o endpoint síncrono, que não aparece com preço neste catálogo.

Quando faz sentido usar Gemini 3 Flash batch em vez do MiMo-V2-Flash?

Quando o seu caso exige multimodal (imagem, áudio, vídeo, arquivo) ou contexto de 1 milhão de tokens em uma única chamada. O MiMo é mais barato no output, mas o Gemini batch compra capacidade de entrada multimodal e janela muito maior — qual compensa depende do tipo de documento que entra no pipeline.

O Gemini 3 Flash tem benchmark público de IQ?

Não no catálogo em que este levantamento foi feito. O modelo entrou sem nota de IQ, coding ou agentic publicada, então a promessa de "raciocínio quase Pro" do release não está verificada pelas métricas públicas disponíveis no momento.

Leia também