o3 cobra 23 vezes mais que o Gemma 4 31B por 4,5% de IQ
O Gemma 4 31B não vence só no preço — também abre vídeo, libera os 30,7 bilhões de parâmetros para download e estica a janela de contexto. O o3 só leva a melhor quando o ser humano está esperando o próximo token.
A fatura da API conta uma história que o release da OpenAI não conta. O o3, modelo de raciocínio lançado em abril de 2025, custa hoje US$ 8 por milhão de tokens de saída. O Gemma 4 31B do Google DeepMind, que entrou no catálogo em 2 de abril de 2026, custa US$ 0,34 pela mesma unidade. São quase 24 vezes de diferença para uma diferença de inteligência de 4,5%. Você não leu errado.
O buraco no boleto
A disparidade não está só na saída. Na entrada, o o3 cobra US$ 2 por milhão; o Gemma 4 31B, US$ 0,09 — vinte e duas vezes menos. No cache de leitura, US$ 0,50 contra US$ 0,05 — dez vezes mais barato no modelo do Google. Para uma chamada típica de 5 mil tokens de entrada e 1.500 de saída, o o3 custa cerca de US$ 0,022. O Gemma 4 31B custa US$ 0,0009 pela mesma carga. É a diferença entre pagar um almoço e pagar uma bala de goma. Mas vale pagar 23 vezes mais por 4,5% de IQ?
Inteligência: o que esses 4,5% valem
O índice composto mostra o o3 em 31,1 e o Gemma 4 31B em 29,7. Um ponto e meio de diferença a favor do modelo da OpenAI. Em uso real, é o tipo de gap que aparece quando você soma dez mil chamadas e some numa média — não na sua tela, em uma única requisição. Os dois são modelos de raciocínio com thinking configurável; nenhum dos dois está no topo do ranking desta data.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Esse topo pertence ao Gemini 3.1 Pro Preview, com 47,7, seguido do GPT-5.3-Codex, com 45,5. O o3 e o Gemma 4 31B brigam em outra faixa — a do "suficiente para produção, sem pagar o preço de fronteira". E nessa faixa, o preço muda tudo.
Onde o o3 ainda vence: velocidade
O o3 entrega 108,93 tokens por segundo. O Gemma 4 31B entrega 35,06. Três vezes mais rápido. Em fluxo conversacional com o usuário final esperando a resposta, em agente síncrono, em pipeline onde latência perceptível dita experiência, essa diferença pesa. O Gemma 4 31B ainda roda em velocidade confortável para batch, classificação e tarefas em background — mas no chat onde o humano conta os segundos, o o3 fica à frente.
Onde o Gemma 4 31B esmaga: multimodalidade e pesos abertos
O Gemma 4 31B lê vídeo de fábrica. O o3 não — a modalidade dele é texto, imagem e arquivo, sem vídeo. Para times que precisam analisar clipes, anotar trechos de filmagem ou gerar resumo a partir de vídeo, isso é bloqueador. E o Gemma 4 ainda vem com pesos abertos: 30,7 bilhões de parâmetros densos, rodável em uma única GPU de 80 GB em quantização moderada. O o3 não roda em lugar nenhum fora do servidor da OpenAI.
A janela de contexto também joga a favor: 262 mil tokens contra 200 mil. Em documentos longos, código de base grande ou transcrições inteiras, cada 30% extra muda o que cabe num único prompt. O índice de código do Gemma 4 31B está em 43,4 — o o3 não tem índice publicado nessa categoria, o que por si só já diz algo sobre onde a OpenAI prefere não ser comparada.
Veredicto
| Critério | o3 | Gemma 4 31B |
|---|---|---|
| Índice de inteligência | 31.1 | 29.7 |
| Entrada US$/M | 2 | 0.09 |
| Saída US$/M | 8 | 0.34 |
| Contexto | 200k | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 109 | 35 |
| Índice de código | — | 43.4 |
| Índice agêntico | — | 14.4 |
O Gemma 4 31B ganha em nove de cada dez cenários: geração de texto, código, multimodal com vídeo, classificação em volume, qualquer coisa que vire lote e vire boleto. É 23 vezes mais barato com 4,5% a menos de inteligência. O o3 só vence onde o ser humano está do outro lado da tela esperando token aparecer — em produto conversacional, em agente síncrono, em qualquer lugar onde a latência três vezes menor compense os 23 vezes a mais no custo.
Se você está rodando agente conversacional de produção e a velocidade faz diferença na retenção, o o3 ainda merece estar no menu. Para todo o resto — e "todo o resto" é a maior parte da conta — o Gemma 4 31B acabou de aposentar o o3 como modelo padrão.
Roteie Gemma 4 31B para texto, código, multimodal com vídeo e batch — qualquer workload de produção onde latência não é crítica — e reserve o o3 só para o fluxo conversacional síncrono, onde a velocidade três vezes maior compensa o custo 23 vezes maior.
Perguntas frequentes
O Gemma 4 31B serve para programação em produção?
O índice de código do Gemma 4 31B está em 43,4 no catálogo desta data. O o3 não tem índice publicado nessa categoria, então a comparação direta pelos números oficiais não é possível — mas o Gemma 4 já é a escolha racional para geração de código em lote dado o custo por token.
Posso rodar o Gemma 4 31B localmente em vez de pagar API?
Sim. O Gemma 4 31B tem pesos abertos e 30,7 bilhões de parâmetros densos; em quantização moderada cabe em uma única GPU de 80 GB de VRAM. O o3 é API-only — não tem pesos publicados e só roda nos servidores da OpenAI.
Por que o o3 ainda existe se o Gemma 4 31B é tão mais barato?
Velocidade. O o3 entrega 108,93 tokens por segundo, três vezes mais rápido que os 35,06 do Gemma 4 31B. Em produto conversacional síncrono, onde o usuário percebe a latência, essa diferença pode justificar pagar 23 vezes mais por milhão de tokens de saída.