Gemma 4 31B custa 35 vezes menos que Gemini 3.1 Pro Preview
Google libera hoje um modelo aberto multimodal de 30,7B parâmetros com preço de saída de US$ 0,34 por milhão de tokens — e abre uma versão gratuita.
O que está em jogo hoje
A conta da API é o que separa marketing de decisão. A Google soltou nesta quarta-feira (2) o Gemma 4 31B, um modelo de 30,7 bilhões de parâmetros, aberto, multimodal, com 262 mil tokens de contexto — e a primeira coisa que o desenvolvedor precisa olhar não é o release, é o preço: US$ 0,09 por milhão de tokens de entrada e US$ 0,34 por milhão de tokens de saída. Com cache, a entrada cai para US$ 0,05. Para colocar em perspectiva, o Gemini 3.1 Pro Preview da própria Google, que lidera o índice de inteligência hoje, cobra US$ 12 por milhão de tokens de saída. São 35 vezes mais caro no output.
A linha completa do lançamento
A Google não soltou um modelo, soltou três variações da mesma arquitetura. A versão padrão é a google/gemma-4-31b-it, com os preços acima. Existe também a google/gemma-4-31b-it:free, sem cobrança — o que dá para testar antes de colocar em produção. E a google/gemma-4-31b-it:batch, voltada para processamento assíncrono em lote, que na verdade é mais cara (US$ 0,39 de entrada e US$ 0,97 de saída por milhão). É o oposto do que costuma acontecer: o batch costuma ser desconto, aqui é premium. Vale checar se a diferença de latência justifica, porque em volume grande a conta muda.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Gemma 4 31B (batch) | 0.39 | 0.97 | 262k |
| Gemma 4 31B (free) | 0 | 0 | 262k |
Onde o Gemma 4 31B se encaixa
O índice de inteligência do Gemma 4 31B hoje é 29,7. O Gemini 3.1 Pro Preview está em 47,7. A diferença existe e não é pequena — estamos falando de quase 18 pontos de distância. Em coding, o Gemma marca 43,4; em agentic, só 14,4. Ou seja: o modelo serve bem para tarefas de programação assistida, mas não é a escolha para fluxos agentic longos, onde o Sonnet 4.6 da Anthropic (15 no agentic) e o GPT-5.3-Codex da OpenAI ainda dominam. A velocidade reportada é 35 tokens por segundo, número modesto se comparado ao que se vê em modelos menores.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Gemma 4 31B (o novo) | 29.7 | 0.09 | 0.34 | 262k |
| Gemini 3.1 Pro Preview | 47.7 | 2 | 12 | 1.05M |
| GPT-5.3-Codex | 45.5 | 1.75 | 14 | 400k |
| MiMo-V2-Omni | 35.9 | 0.4 | 2 | 262k |
Para quem vale e para quem não muda nada
O Gemma 4 31B faz sentido se você precisa de multimodalidade barata — texto, imagem e vídeo como entrada, texto como saída — em um setup que aceite rodar ou consumir pesos abertos. É um caso forte para empresas que já têm infraestrutura de inferência e querem cortar a fatura da API proprietária. A versão :free é uma porta de entrada sem custo para prototipagem.
Não muda nada para quem já está no topo da cadeia. Se o seu produto depende de raciocínio agentic ou de coding de fronteira, o Gemini 3.1 Pro Preview e o GPT-5.3-Codex continuam sendo as referências. E se o seu gargalo é custo por inteligência pura, o scatter de custo-benefício mostra que o Gemma 4 está longe de ser o melhor negócio do catálogo — ele é barato, mas também é menos capaz.
| Campo | Valor |
|---|---|
| Identificador | google/gemma-4-31b-it |
| Criador | |
| Preço de entrada | US$ 0.090 / M tokens |
| Preço de saída | US$ 0.340 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image+video->text |
| Leitura de cache | US$ 0.050 / M (44% de desconto) |
| Índice de inteligência (AA) | 29.7 |
| Índice de código | 43.4 |
| Índice agêntico | 14.4 |
| Parâmetros | 30.7B (30.7B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 35 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O tabuleiro nesta data
O catálogo de modelos listados hoje passa de 386, com 54 criadores diferentes. Nos últimos 30 dias, 34 modelos foram lançados — e o ritmo não está diminuindo. O topo do índice continua com Google e OpenAI, mas a Xiaomi entrou no top 3 com o MiMo-V2-Omni, e a Qwen segue colocando modelos com boa relação custo-benefício. O Gemma 4 31B não disputa a ponta, mas ocupa um espaço que estava vazio: multimodal aberto, barato, com contexto longo.
O que fazer com isso
Se você roda um produto que consome milhões de tokens por mês em tarefas que não exigem raciocínio pesado, teste a versão :free do Gemma 4 31B hoje. Se o resultado segurar, a migração do Gemini Pro para Gemma 4 corta a conta de saída em 97%. Quem está no tier agentic ou coding de ponta continua onde está — o lançamento de hoje não muda o topo, muda o chão.
Teste a versão free do Gemma 4 31B em fluxos de alto volume e baixa exigência de raciocínio; se passar, a economia sobre o Gemini Pro é de 97% no token de saída.
Perguntas frequentes
Quanto custa o Gemma 4 31B da Google?
US$ 0,09 por milhão de tokens de entrada e US$ 0,34 por milhão de tokens de saída. Com cache, a entrada cai para US$ 0,05. Há versão gratuita e versão batch (mais cara) no mesmo endpoint.
O Gemma 4 31B é melhor que o Gemini 3.1 Pro Preview?
Não. O índice de inteligência do Gemma 4 31B está em 29,7, contra 47,7 do Gemini 3.1 Pro Preview. O Gemma é multimodal e aberto; o Gemini Pro é a referência da própria Google em raciocínio e coding.
O Gemma 4 31B serve para coding e agentic?
Serve razoavelmente para coding assistido (nota 43,4), mas é fraco em agentic (14,4). Para fluxos agentic longos, o Claude Sonnet 4.6 e o GPT-5.3-Codex seguem como opções superiores.