Gemma 4 31B batch custa centavos e abre 256K de contexto
Modelo da Google chega em modo assíncrono com preço de fundo de poço — mas sem nota de inteligência publicada, ele vira coringa só para quem sabe o que está comprando.
Você já viu preço de modelo chamar atenção. Mas US$ 0,39 por milhão de tokens de entrada é o tipo de número que faz o desenvolvedor conferir três vezes se o catálogo não trocou a vírgula de lugar. É o que a Google está cobrando pelo Gemma 4 31B Instruct na variante :batch — a fila assíncrona em que a resposta pode levar horas, mas a conta despenca.
O que é a variante batch e por que ela é tão barata
Pense no batch como o frete econômico de um e-commerce: você despacha o pedido hoje e recebe em alguns dias. Para workloads que não precisam de resposta em tempo real — transcrição em massa, enriquecimento de bases, classificação de tickets antigos, geração de dataset sintético — esse modelo vira uma ferramenta de custo, não de latência. A 31B de parâmetros densos, ele roda multimodal (texto, imagem e vídeo como entrada, texto como saída) e abre uma janela de 262.144 tokens. Em outras palavras: cabe um repositório inteiro de documentação técnica em um único prompt.
Onde ele se encaixa no tabuleiro
O topo do catálogo nesta data é ocupado pelo Gemini 3.1 Pro Preview (IQ 47,738, US$ 12 por milhão de saída) e pelo GPT-5.3-Codex (IQ 45,512, US$ 14 por milhão de saída). São modelos de fronteira, com notas de inteligência aferidas e preço por token dez vezes maior que o Gemma 4 31B batch. O ponto-cego aqui é importante: o Gemma 4 31B não tem IQ publicado no catálogo. Isso não significa que ele é ruim — significa que você não tem referência externa para saber em que ponto do espectro ele cai. Quem precisa de benchmark antes de comprar vai ter de testar por conta própria.
| Campo | Valor |
|---|---|
| Identificador | google/gemma-4-31b-it:free |
| Criador | |
| Preço de entrada | US$ 0.000 / M tokens |
| Preço de saída | US$ 0.000 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image+video->text |
Para quem ele vale
Você processa grandes volumes de documentos, precisa de multimodal barato e pode esperar horas pelo resultado. Você está montando um pipeline de ETL semântico, gerando embeddings descritivos, ou rodando OCR em lotes de PDFs antigos. Você quer 256K de contexto para colar um livro inteiro sem fragmentar. Em todos esses casos, US$ 0,39 de entrada e US$ 0,97 de saída transformam o projeto de "caro demais" para "cabe no cartão".
Para quem ele não muda nada
Você precisa de resposta em tempo real — o batch é assíncrono por desenho. Você está construindo um agente que decide o próximo passo com base na resposta anterior; o loop trava esperando o lote voltar. Você precisa de nota de inteligência aferida para justificar a escolha para o time ou para o cliente. E, crucialmente, você está comparando com o Gemini 3.1 Pro Preview ou o GPT-5.3-Codex por capacidade bruta — eles custam mais, mas têm IQ aferido de 47 e 45, respectivamente, e nesse patamar a diferença de preço é a diferença de categoria.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
O detalhe que ninguém comenta
A descrição oficial menciona "configurable thinking/reasoning mode" e "native function calling". É o tipo de recurso que, em outro modelo, viraria manchete. Aqui ele aparece como nota de rodapé, porque o que define o Gemma 4 31B batch é o preço — e o preço só faz sentido porque você topa abrir mão da latência. É um modelo de infraestrutura, não de vitrine. Se você trata IA como commodity de processamento, ele entra na pilha. Se você trata IA como produto final visível ao usuário, ele provavelmente não é o que você quer.
O que fazer com isso hoje
Mapeie seu workload: quanto dele é tolerante a latência de horas? Separe esse volume, rode um lote de teste com o Gemma 4 31B batch e meça qualidade em uma amostra pequena. Se a taxa de erro for aceitável, você tem um caminho para cortar uma casa decimal da fatura mensal sem trocar de fornecedor. Se não for, o dinheiro que você economizou serviu para descobrir isso antes de migrar de verdade.
Se parte do seu volume tolera esperar horas, o Gemma 4 31B batch é a forma mais barata de processar multimodal com 256K de contexto — mas sem IQ aferido, é coringa só para quem testa antes de comprar.
Perguntas frequentes
Quanto custa o Gemma 4 31B no modo batch?
US$ 0,39 por milhão de tokens de entrada e US$ 0,97 por milhão de tokens de saída. É um dos preços mais baixos do catálogo para um modelo multimodal com 256K de contexto, mas só na fila assíncrona — a resposta pode levar horas.
O Gemma 4 31B batch serve para agente em tempo real?
Não. A variante batch é assíncrona por desenho: você envia o job e recebe o resultado depois. Para agentes que dependem de resposta imediata, procure a versão síncrona ou outro modelo.
Qual a diferença entre o Gemma 4 31B e o Gemini 3.1 Pro?
O Gemini 3.1 Pro Preview é modelo de fronteira, com IQ aferido de 47,738 e preço de US$ 12 por milhão de saída. O Gemma 4 31B batch custa cerca de 12 vezes menos na saída, mas não tem IQ publicado no catálogo e roda em fila assíncrona — é outra categoria de uso.