Mesmo QI, conta 15 vezes menor no embate Haiku 4.5 e Gemma 4 31B
Os dois modelos entregam inteligência praticamente idêntica, mas cobram preços em universos distintos — e cada um abre portas que o outro não abre.
O QI está empatado. A conta, não.
Dois modelos com QI quase idêntico — 29.892 contra 29.695 — custam valores que não poderiam ser mais diferentes. O Claude Haiku 4.5, da Anthropic, cobra US$ 5 por milhão de tokens de saída. O Gemma 4 31B Instruct, do Google DeepMind, cobra US$ 0,34. São quase 15 vezes menos pelo mesmo token que sai do modelo.
A diferença de 0,2 ponto no índice de inteligência é ruído. Você não vai notar na produção. Então por que pagar 15 vezes mais?
Onde o Haiku 4.5 ainda ganha
A resposta está em três números: velocidade, capacidade agentic e o indicador de omniscience — quanto o modelo inventa quando não sabe. O Haiku roda a 90 tokens por segundo; o Gemma, a 35. Em fluxo que precisa de resposta em tempo real — chatbot, classificação em volume, assistente de atendimento — essa diferença de 2,5 vezes pesa.
No agentic, 16.472 contra 14.379. Não é abismo, mas o Haiku completa cadeias de ferramentas com mais frequência sem travar no meio. E o indicador de omniscience do Haiku é -4,367; o do Gemma, -47,933. O Gemma inventa muito mais quando não sabe a resposta. Para tarefa onde alucinação é inaceitável — jurídico, saúde, compliance — esse número pesa mais que o preço.
Onde o Gemma 4 31B contra-ataca
O Gemma custa US$ 0,09 por milhão de tokens de entrada e US$ 0,34 por milhão de saída. Tem cache de US$ 0,05 — barato para quem repete prompt longo. A janela de contexto é de 262 mil tokens, contra 200 mil do Haiku. Aceita vídeo como entrada; o Haiku, não.
E é open weights. Você baixa os 30,7 bilhões de parâmetros e roda onde quiser, sem mandar dado nenhum para a Anthropic ou para o Google. Para empresa com restrição de compliance ou time de ML que quer ajustar o modelo, isso não é detalhe — é o jogo. O Gemma saiu há duas semanas; o Haiku, em outubro do ano passado.
| Critério | Claude Haiku 4.5 | Gemma 4 31B |
|---|---|---|
| Índice de inteligência | 29.9 | 29.7 |
| Entrada US$/M | 1 | 0.09 |
| Saída US$/M | 5 | 0.34 |
| Contexto | 200k | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 90 | 35 |
| Índice de código | 43.9 | 43.4 |
| Índice agêntico | 16.5 | 14.4 |
Para quem cada um ganha
Haiku 4.5 ganha quando você precisa de baixa latência, baixa alucinação e está construindo agente que chama ferramenta em sequência. Pague os US$ 5 por milhão e colha velocidade e confiança.
Gemma 4 31B ganha quando o volume é alto, o orçamento é curto, a tarefa tolera alguma margem de erro ou você precisa de multimodal com vídeo. Roda em produção com custo que cabe em planilha.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
O que fazer com isso hoje
Se sua fatura de API está sangrando em classificação, resumo ou geração em massa, teste o Gemma 4 31B antes de trocar de fornecedor. Você provavelmente consegue o mesmo resultado por uma fração. Mas se o gargalo é tempo de resposta ou qualidade de raciocínio em agente, o Haiku 4.5 ainda justifica o preço — e o catálogo mostra que, na faixa acima de QI 45, o modelo mais barato é o Gemini 3.1 Pro Preview a US$ 12 por milhão. Ou seja: nem o Haiku nem o Gemma estão no topo, mas nenhum dos dois quer estar ali.
Se volume alto e orçamento curto: teste Gemma 4 31B antes de trocar de fornecedor. Se latência e baixa alucinação pesam mais que custo por token, o Haiku 4.5 ainda justifica os US$ 5 por milhão.
Perguntas frequentes
Qual a diferença de preço entre Claude Haiku 4.5 e Gemma 4 31B?
O Haiku cobra US$ 5 por milhão de tokens de saída, enquanto o Gemma cobra US$ 0,34 — quase 15 vezes menos. Na entrada, a diferença é de 11 vezes: US$ 1 contra US$ 0,09 por milhão.
Gemma 4 31B é open weights mesmo?
Sim. O Google DeepMind publicou os 30,7 bilhões de parâmetros densos. Você baixa, roda localmente e ajusta sem mandar dado nenhum para a API do Google — diferencial que o Haiku 4.5 não oferece.
Quando vale pagar mais caro no Haiku 4.5?
Quando latência baixa e baixa taxa de alucinação pesam mais que o custo por token. Chatbots em tempo real, agentes que encadeiam ferramentas e contextos regulados são o terreno do Haiku; o indicador de omniscience dele (-4,367) é muito melhor que o do Gemma (-47,933).