Gemini 3 Flash batch é 70% mais barato que o Haiku, mas só se você pode esperar
Dez dias depois do lançamento, o endpoint assíncrono do Google cobra US$ 1,50 por milhão de saída e abre 1 milhão de contexto — sem benchmark público de IQ para comparar.
Dez dias depois do lançamento, o Gemini 3 Flash Preview já está no catálogo — em modo batch. E o sufixo ":batch" no ID é o que decide se ele serve para você ou não. O resto do release repete a fórmula da casa: "raciocínio quase Pro a preço de Flash". Traduzindo: você está trocando latência por economia. Nada mais.
O detalhe ":batch" que decide tudo
Endpoint batch nos provedores como o Google significa processamento assíncrono. Você enfileira a requisição, recebe minutos ou horas depois, e em troca paga menos por token. O Gemini 3 Flash Preview batch sai por US$ 0,25 por milhão de tokens de entrada e US$ 1,50 por milhão de tokens de saída. É o tier Flash do Google empurrado para a fila barata.
| Campo | Valor |
|---|---|
| Identificador | google/gemini-3-flash-preview:batch |
| Criador | |
| Preço de entrada | US$ 0.250 / M tokens |
| Preço de saída | US$ 1.50 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text+image+file+audio+video->text |
Pense como um Sedex econômico: mesmo produto, prazo maior, frete menor. Quem não pode esperar, não compra.
Comparado a quem está brigando pelo mesmo cliente
A conta só fecha posta na mesa ao lado de quem está disputando o mesmo pedaço.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Olhando o topo do catálogo pelo índice de inteligência medido hoje:
- O MiMo-V2-Flash da Xiaomi lidera com IQ 34 e cobra US$ 0,30 por milhão de saída — um quinto do que o Gemini batch pede.
- O Claude Haiku 4.5 da Anthropic cobra US$ 5 por milhão de saída com IQ 29,9.
- O o3 da OpenAI cobra US$ 8 por milhão de saída com IQ 31,1.
- O gpt-oss-120b, com pesos abertos, sai por US$ 0,17 por milhão de saída com IQ 24,1.
Traduzindo: o Gemini batch é 70% mais barato que o Haiku 4.5 no output e 81% mais barato que o o3. Mas é cinco vezes mais caro que o MiMo e quase nove vezes mais caro que o gpt-oss-120b. O argumento do Google não é "mais barato do mundo" — é "mais barato multimodal com 1 milhão de contexto".
O ponto cego: o catálogo ainda não mediu esse modelo
Aqui mora o detalhe que merece leitura cuidadosa. O Gemini 3 Flash Preview batch entrou no diretório sem IQ, sem nota de coding, sem nota agentic, sem velocidade publicada, sem parâmetros, sem país de origem, sem cutoff de conhecimento. O catálogo simplesmente não publicou esses números.
Isso muda como você lê o "raciocínio quase Pro" do release: não é uma afirmação verificável pelas métricas públicas do mercado. É uma promessa. Para um CTO fechando plano de API, promessa sem benchmark anexo, ao lado do Claude Haiku e do o3, pesa diferente.
Para quem vale, para quem não, e o que fazer
Vale a fila se você precisa processar lote: transcrição de vídeo em massa, classificação de documentos longos, análise de PDFs com imagem anexada, geração assíncrona em pipelines com worker separado. O contexto de 1.048.576 tokens (um milhão) é o chamariz real — cabe relatório inteiro, livro ou horas de vídeo em uma chamada, e a fila batch absorve bem esse volume.
Vale especialmente se a alternativa era Haiku 4.5 ou o3 e o orçamento de saída era o gargalo.
Não vale se o caso é chat em tempo real ou qualquer UX síncrona. Batch não é para usuário esperando resposta.
Não vale se você só quer texto curto barato. O MiMo a US$ 0,30 de saída ganha em custo sem precisar de multimodal.
Não vale se você precisa de pesos abertos para rodar on-premise. O gpt-oss-120b segue sendo o caminho nessa faixa.
Se você já tem pipeline assíncrono rodando Haiku 4.5 ou o3, vale testar o Gemini 3 Flash batch com uma fração do tráfego e medir qualidade antes de migrar. Se está começando do zero, o MiMo é o mais barato do topo e o Gemini batch é o mais barato multimodal com contexto largo — são apostas diferentes. E se o release citou "raciocínio quase Pro" sem benchmark anexado, peça o benchmark. É a única forma de saber se a promessa vale a fila.
Use Gemini 3 Flash batch para jobs assíncronos com 1M de contexto e multimodal; para texto curto barato, escolha MiMo; para pesos abertos on-premise, vá de gpt-oss-120b.
Perguntas frequentes
Gemini 3 Flash batch é mais barato que o Gemini 3 Flash normal?
Sim, o sufixo ":batch" indica o endpoint assíncrono, que cobra menos por token em troca de latência maior — você enfileira a requisição e recebe minutos ou horas depois. Quem precisa de resposta imediata deve usar o endpoint síncrono, que não aparece com preço neste catálogo.
Quando faz sentido usar Gemini 3 Flash batch em vez do MiMo-V2-Flash?
Quando o seu caso exige multimodal (imagem, áudio, vídeo, arquivo) ou contexto de 1 milhão de tokens em uma única chamada. O MiMo é mais barato no output, mas o Gemini batch compra capacidade de entrada multimodal e janela muito maior — qual compensa depende do tipo de documento que entra no pipeline.
O Gemini 3 Flash tem benchmark público de IQ?
Não no catálogo em que este levantamento foi feito. O modelo entrou sem nota de IQ, coding ou agentic publicada, então a promessa de "raciocínio quase Pro" do release não está verificada pelas métricas públicas disponíveis no momento.