Gemini 3.8 Flash custa US$ 0,75, mas não lidera
O novo modelo do Google combina janela de contexto de 1.048.576 tokens e preço de entrada baixo. Nos índices de inteligência, porém, fica atrás de opções mais caras e de alternativas econômicas.
O Gemini 3.8 Flash chega custando US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída. É uma estreia agressiva para quem paga a conta da API, mas a promessa de alto desempenho precisa ser lida com cuidado: o modelo não lidera os índices de inteligência e não é a opção mais barata do mercado.
Os preços listados no OpenRouter mostram ainda uma tarifa de cache de US$ 0,075 por milhão de tokens. A versão batch custa US$ 0,375 por milhão de tokens de entrada e US$ 1,875 por milhão de tokens de saída. A janela de contexto é de 1.048.576 tokens.
Preço baixo, mas não o menor
Se você usa o modelo em produção para classificação, extração, atendimento ou geração de respostas em grande volume, o preço de entrada chama atenção. O Gemini 3.8 Flash fica abaixo do Qwen3.8 27B, listado no OpenRouter a US$ 0,425 por milhão de tokens de entrada e US$ 2,55 na saída? Não: a comparação correta é que o Qwen3.8 27B custa US$ 0,425 na entrada, portanto é mais barato nesse componente, mas US$ 2,55 na saída, também abaixo do Gemini.
O Qwen3.8 Flash aparece ainda a US$ 0,15 por milhão de tokens de entrada e US$ 0,47 na saída. No índice de melhor custo-benefício do Artificial Analysis, o GLM-5.3-Flash aparece com nota de inteligência 57,5 e preço de US$ 0,238 por milhão de tokens. O Gemini 3.8 Flash, portanto, não chega como líder absoluto de economia.
A vantagem do Google está na combinação de contexto amplo, preço competitivo e disponibilidade de uma rota batch. Para cargas que aceitam processamento em lote, a tarifa reduzida pode mudar a conta. Para chamadas interativas, é preciso olhar separadamente para entrada, saída e cache.
O desempenho explica a escolha
O Artificial Analysis atribui ao Gemini 3.8 Flash nota de inteligência de 58,7. A pontuação de código é 76,29, enquanto a nota agêntica fica em 49,999. O modelo processa 302,1 tokens por segundo, segundo a ficha disponível.
Esses números colocam o Gemini em uma faixa intermediária. O Muse Spark 1.3 tem nota de inteligência de 60,8 e pontuação de código de 76,45, praticamente no mesmo nível em programação, mas custa US$ 1,25 por milhão de tokens de entrada e US$ 4,25 na saída. Sua nota agêntica é 56,052.
No topo do índice, o Claude Fable 5.1 alcança 65,7 de inteligência, com preço de US$ 10 na entrada e US$ 50 na saída no OpenRouter. A diferença de preço é grande o bastante para impedir uma substituição simples: você paga menos no Gemini, mas também não recebe a mesma posição nos testes.
O que mudou — e o que não mudou
Mudou a oferta de um modelo Google com preço de entrada de US$ 0,75, versão batch pela metade desses valores e contexto de 1.048.576 tokens. Também estrearam configurações do Gemini 3.8 Flash no índice do Artificial Analysis: as variantes high, medium e low receberam notas de inteligência de 58,7, 56,6 e 51,7, respectivamente, todas listadas a US$ 1,5 por milhão de tokens no benchmark.
Não mudou o fato de que preço e qualidade dependem do tipo de tarefa. O Gemini não supera o Claude Fable 5.1 em inteligência e não fica abaixo de todas as alternativas de baixo custo. Também não há, nos dados de preços do OpenRouter, confirmação de que os valores estejam congelados até o fim de 2026 ou até 2027. Essa é uma promessa atribuída à pauta, não uma condição comprovada pelas tarifas listadas.
O anúncio surge um dia depois da estreia do Claude Fable 5.1, lançada em 2026-09-01, enquanto o Gemini aparece em 2026-09-02. O canal Onde eu Clico descreveu o movimento como uma resposta rápida da Google à Anthropic, mas as datas não comprovam um intervalo exato de horas.
Para quem vale
Se você precisa de contexto longo, alto volume e custo controlado, o Gemini 3.8 Flash merece um teste de produção com tráfego limitado. A versão batch faz sentido para tarefas assíncronas, como sumarização de documentos, processamento de catálogos e avaliação de grandes conjuntos de textos.
Se a aplicação depende de raciocínio agêntico mais forte, programação no limite ou máxima inteligência por chamada, os números não justificam trocar automaticamente um modelo líder. E, se a prioridade for apenas o menor custo, Qwen3.8 Flash, Qwen3.8 27B e GLM-5.3-Flash entram na comparação antes do Gemini.
A decisão prática é separar os fluxos: teste o Gemini nas chamadas interativas, reserve o batch para filas assíncronas e mantenha um modelo mais capaz para os casos em que uma resposta errada custa mais do que a diferença na fatura.
O Gemini 3.8 Flash é uma opção competitiva para volume e contexto longo, mas você deve validar custo por saída e qualidade antes de tratá-lo como substituto universal.
Perguntas frequentes
Quanto custa o Gemini 3.8 Flash na API?
No OpenRouter, o Gemini 3.8 Flash custa US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída. A tarifa de cache é US$ 0,075 por milhão de tokens.
O Gemini 3.8 Flash é o modelo mais barato?
Não. O Qwen3.8 Flash aparece a US$ 0,15 na entrada e US$ 0,47 na saída, enquanto o GLM-5.3-Flash aparece no Artificial Analysis a US$ 0,238 por milhão de tokens. O Gemini combina preço competitivo com contexto de 1.048.576 tokens, mas não lidera todos os critérios.
O preço do Gemini 3.8 Flash está garantido até 2027?
Os dados do OpenRouter confirmam as tarifas de estreia, mas não confirmam congelamento até 2027. Portanto, essa promessa não deve entrar no planejamento financeiro como garantia sem uma confirmação contratual do fornecedor.
Fontes
- 🔥Google Responds to Anthropic in Under 24 Hours! Gemini 3.8 Flash Surprises! Onde eu Clico · vídeo