Gemma 4 31B custa US$ 0,34 por milhão de tokens de saída
Modelo aberto do Google estreia com multimodal nativo e preço de entrada, mas fica longe do topo de inteligência.
O que está na etiqueta e o que sobra no bolso
Ontem o Google publicou o Gemma 4 31B Instruct e, na mesma janela, um irmão menor de 26B com apenas 3,8B ativos por token. A conta de API que você paga hoje já mostra os dois: US$ 0,09 para entrar com texto, US$ 0,34 para receber resposta, e US$ 0,05 se você reaproveitar o prompt em cache. Em outras palavras, é a faixa de entrada do catálogo — mais barato que o Gemini 3.1 Pro Preview, que cobra US$ 12 por milhão de saída, e mais barato que o GPT-5.3-Codex, que sai a US$ 14.
A pergunta que importa é outra: o que esses US$ 0,34 compram de inteligência?
Onde o Gemma 4 31B se posiciona
O índice de inteligência do Gemma 4 31B é 29,7. Para situar, o Gemini 3.1 Pro Preview está em 47,7, o GPT-5.3-Codex em 45,5, e o Xiaomi MiMo-V2-Omni em 35,9. O Gemma 4 31B fica abaixo da fronteira dos 30 e bem distante dos dois que ocupam o topo.
Em coding, ele marca 43,4 — pontuação razoável para a faixa. Em agentic, 14,4, número que combina com o que se vê em modelos abertos menores: dá para encadear ferramentas, mas não espere autonomia longa. O índice de onisciência é fortemente negativo (-47,9), o que confirma o que o cutoff nulo já sugere: este é um modelo para a sua verdade, não para a dele.
Preço não é tudo: a conta do custo-benefício
Quando você cruza inteligência e preço, o desenho muda. O Gemma 4 31B entrega 29,7 de IQ por US$ 0,34 de saída. O gpt-oss-120b da OpenAI, aberto, custa US$ 0,17 de saída e marca 24,1 de IQ. O MiMo-V2-Flash da Xiaomi custa US$ 0,30 e marca 34,0 — está à frente em inteligência cobrando menos.
Ou seja, o Gemma 4 31B não é o mais barato nem o mais inteligente da sua faixa. É um meio-termo com dois trunfos que não aparecem no gráfico: 256K de contexto e multimodal nativo (texto, imagem e vídeo entrando; texto saindo). Esses dois pontos pesam em casos específicos — análise de documentos longos com figuras, por exemplo — onde o MiMo-V2-Flash, que é só texto, já não serve.
Para quem vale, e para quem não muda nada
Vale para você se:
- precisa de multimodal barato e não quer hospedar um modelo de imagem à parte;
- roda cargas com prompts grandes e repetidos, porque o cache de US$ 0,05 por milhão é o diferencial real;
- quer pesos abertos (30,7B densos, não MoE) para inspecionar, ajustar ou self-host.
Não muda nada se:
- você já paga o Gemini 3.1 Pro Preview ou o GPT-5.3-Codex e usa o melhor pelo preço que tem — a diferença de IQ é grande demais para o corte de custo compensar;
- seu caso é raciocínio longo ou agente autônomo; o agentic de 14,4 fala por si;
- você precisa de fato novo: o knowledge cutoff não foi publicado, e o índice de onisciência recomenda tratar qualquer resposta factual como hipótese.
| Campo | Valor |
|---|---|
| Identificador | google/gemma-4-31b-it |
| Criador | |
| Preço de entrada | US$ 0.090 / M tokens |
| Preço de saída | US$ 0.340 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image+video->text |
| Leitura de cache | US$ 0.050 / M (44% de desconto) |
| Índice de inteligência (AA) | 29.7 |
| Índice de código | 43.4 |
| Índice agêntico | 14.4 |
| Parâmetros | 30.7B (30.7B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 35 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Gemma 4 31B (o novo) | 29.7 | 0.09 | 0.34 | 262k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| MiMo-V2-Flash | 34.0 | 0.1 | 0.3 | 262k |
| Gemma 4 26B A4B | 26.1 | 0.07 | 0.34 | 262k |
| Qwen3.5-35B-A3B | 24.3 | 0.25 | 1.25 | 262k |
O tabuleiro em 3 de abril de 2026
O catálogo tem mais de 388 modelos ativos, vindos de 54 criadores. Nos últimos 30 dias, 35 modelos foram listados — e o Gemma 4 31B é um deles, junto com o Gemma 4 26B A4B do mesmo dia. Acima da linha de IQ 45, só dois modelos aparecem, e ambos cobram na casa de US$ 12 a US$ 14 por milhão de saída. É um mercado com topo caro e um chão barulhento de modelos abertos disputando centavos.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
A implicação prática é direta: se multimodal nativo e cache agressivo resolvem o seu gargalo, o Gemma 4 31B entra na fila de testes. Se o que você precisa é a melhor resposta possível dentro do orçamento, o MiMo-V2-Flash continua sendo o aberto com melhor IQ por dólar — e os dois fechados no topo continuam sendo outra conversa, de outro orçamento.
Para multimodal barato com 256K de contexto, teste o Gemma 4 31B; para o melhor raciocínio aberto por dólar, o MiMo-V2-Flash ainda entrega mais IQ pelo mesmo preço.
Perguntas frequentes
Quanto custa o Gemma 4 31B na API?
US$ 0,09 por milhão de tokens de entrada, US$ 0,34 por milhão de tokens de saída e US$ 0,05 por milhão para prompts em cache. É a faixa de entrada do catálogo, bem abaixo dos US$ 12 a US$ 14 cobrados pelos modelos no topo de inteligência.
O Gemma 4 31B é melhor que o gpt-oss-120b?
Depende do que você mede. Em inteligência geral o Gemma marca 29,7 contra 24,1 do gpt-oss-120b, mas o da OpenAI custa metade por milhão de saída (US$ 0,17) e roda mais rápido (155 tokens/s contra 35). O Gemma ganha em multimodal e em cache barato.
O Gemma 4 31B serve para agentes autônomos?
Serve para encadear ferramentas curtas, com nota agentic de 14,4. Para fluxos longos e autônomos, os modelos no topo de IQ continuam entregando mais por real gasto.