FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

o3 cobra 23 vezes mais que o Gemma 4 31B por 4,5% de IQ

O Gemma 4 31B não vence só no preço — também abre vídeo, libera os 30,7 bilhões de parâmetros para download e estica a janela de contexto. O o3 só leva a melhor quando o ser humano está esperando o próximo token.

Redação FalaVIP IA 3 min de leitura
US$ 8 / US$ 0,34preço por milhão de tokens de saída (o3 vs Gemma 4 31B)
23,5×diferença de preço na saída
4,5%diferença de IQ entre os dois modelos

A fatura da API conta uma história que o release da OpenAI não conta. O o3, modelo de raciocínio lançado em abril de 2025, custa hoje US$ 8 por milhão de tokens de saída. O Gemma 4 31B do Google DeepMind, que entrou no catálogo em 2 de abril de 2026, custa US$ 0,34 pela mesma unidade. São quase 24 vezes de diferença para uma diferença de inteligência de 4,5%. Você não leu errado.

O buraco no boleto

Preço de saída (US$ por milhão de tokens)
o38Gemma 4 31B0,34US$/M
Fonte: OpenRouter

A disparidade não está só na saída. Na entrada, o o3 cobra US$ 2 por milhão; o Gemma 4 31B, US$ 0,09 — vinte e duas vezes menos. No cache de leitura, US$ 0,50 contra US$ 0,05 — dez vezes mais barato no modelo do Google. Para uma chamada típica de 5 mil tokens de entrada e 1.500 de saída, o o3 custa cerca de US$ 0,022. O Gemma 4 31B custa US$ 0,0009 pela mesma carga. É a diferença entre pagar um almoço e pagar uma bala de goma. Mas vale pagar 23 vezes mais por 4,5% de IQ?

Inteligência: o que esses 4,5% valem

Índice de inteligência (Artificial Analysis)
o331,1Gemma 4 31B29,7índice
Fonte: Artificial Analysis

O índice composto mostra o o3 em 31,1 e o Gemma 4 31B em 29,7. Um ponto e meio de diferença a favor do modelo da OpenAI. Em uso real, é o tipo de gap que aparece quando você soma dez mil chamadas e some numa média — não na sua tela, em uma única requisição. Os dois são modelos de raciocínio com thinking configurável; nenhum dos dois está no topo do ranking desta data.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 390 modelos disponíveis no catálogo nesta data.

Esse topo pertence ao Gemini 3.1 Pro Preview, com 47,7, seguido do GPT-5.3-Codex, com 45,5. O o3 e o Gemma 4 31B brigam em outra faixa — a do "suficiente para produção, sem pagar o preço de fronteira". E nessa faixa, o preço muda tudo.

Onde o o3 ainda vence: velocidade

O o3 entrega 108,93 tokens por segundo. O Gemma 4 31B entrega 35,06. Três vezes mais rápido. Em fluxo conversacional com o usuário final esperando a resposta, em agente síncrono, em pipeline onde latência perceptível dita experiência, essa diferença pesa. O Gemma 4 31B ainda roda em velocidade confortável para batch, classificação e tarefas em background — mas no chat onde o humano conta os segundos, o o3 fica à frente.

Onde o Gemma 4 31B esmaga: multimodalidade e pesos abertos

O Gemma 4 31B lê vídeo de fábrica. O o3 não — a modalidade dele é texto, imagem e arquivo, sem vídeo. Para times que precisam analisar clipes, anotar trechos de filmagem ou gerar resumo a partir de vídeo, isso é bloqueador. E o Gemma 4 ainda vem com pesos abertos: 30,7 bilhões de parâmetros densos, rodável em uma única GPU de 80 GB em quantização moderada. O o3 não roda em lugar nenhum fora do servidor da OpenAI.

A janela de contexto também joga a favor: 262 mil tokens contra 200 mil. Em documentos longos, código de base grande ou transcrições inteiras, cada 30% extra muda o que cabe num único prompt. O índice de código do Gemma 4 31B está em 43,4 — o o3 não tem índice publicado nessa categoria, o que por si só já diz algo sobre onde a OpenAI prefere não ser comparada.

Veredicto

o3 × Gemma 4 31B
Critérioo3Gemma 4 31B
Índice de inteligência31.129.7
Entrada US$/M20.09
Saída US$/M80.34
Contexto200k262k
Pesos abertosnãosim
Velocidade (tok/s)10935
Índice de código43.4
Índice agêntico14.4

O Gemma 4 31B ganha em nove de cada dez cenários: geração de texto, código, multimodal com vídeo, classificação em volume, qualquer coisa que vire lote e vire boleto. É 23 vezes mais barato com 4,5% a menos de inteligência. O o3 só vence onde o ser humano está do outro lado da tela esperando token aparecer — em produto conversacional, em agente síncrono, em qualquer lugar onde a latência três vezes menor compense os 23 vezes a mais no custo.

Se você está rodando agente conversacional de produção e a velocidade faz diferença na retenção, o o3 ainda merece estar no menu. Para todo o resto — e "todo o resto" é a maior parte da conta — o Gemma 4 31B acabou de aposentar o o3 como modelo padrão.

Em uma frase

Roteie Gemma 4 31B para texto, código, multimodal com vídeo e batch — qualquer workload de produção onde latência não é crítica — e reserve o o3 só para o fluxo conversacional síncrono, onde a velocidade três vezes maior compensa o custo 23 vezes maior.

Perguntas frequentes

O Gemma 4 31B serve para programação em produção?

O índice de código do Gemma 4 31B está em 43,4 no catálogo desta data. O o3 não tem índice publicado nessa categoria, então a comparação direta pelos números oficiais não é possível — mas o Gemma 4 já é a escolha racional para geração de código em lote dado o custo por token.

Posso rodar o Gemma 4 31B localmente em vez de pagar API?

Sim. O Gemma 4 31B tem pesos abertos e 30,7 bilhões de parâmetros densos; em quantização moderada cabe em uma única GPU de 80 GB de VRAM. O o3 é API-only — não tem pesos publicados e só roda nos servidores da OpenAI.

Por que o o3 ainda existe se o Gemma 4 31B é tão mais barato?

Velocidade. O o3 entrega 108,93 tokens por segundo, três vezes mais rápido que os 35,06 do Gemma 4 31B. Em produto conversacional síncrono, onde o usuário percebe a latência, essa diferença pode justificar pagar 23 vezes mais por milhão de tokens de saída.

Leia também