FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Gemma 4 custa 14× menos que Haiku 4.5 por milhão de tokens

O Gemma 4 é multimodal com vídeo, mais barato e tem pesos abertos. O Haiku 4.5 cobra quase 15× mais, mas entrega quase 50% a mais em agentic — vale para fluxos longos.

Redação FalaVIP IA 3 min de leitura
US$ 0,34por milhão de tokens de saída no Gemma 4 26B A4B
US$ 5,00por milhão de tokens de saída no Claude Haiku 4.5
14,7×diferença de preço de saída entre os dois modelos

Pare um segundo e olha para o preço de saída: US$ 0,34 por milhão de tokens no Gemma 4 26B A4B, contra US$ 5 no Claude Haiku 4.5. São 14,7 vezes de diferença. Você não está olhando para dois modelos do mesmo segmento — está vendo dois pontos muito distantes na curva de custo por inteligência. E essa distância é o que define a escolha. Não é sobre qual é "melhor".

Preço de saída (US$ por milhão de tokens)
Claude Haiku 4.55Gemma 4 26B A4B 0,34US$/M
Fonte: OpenRouter

O que a Google entregou há duas semanas

O Gemma 4 26B A4B foi lançado em 3 de abril de 2026. É um Mixture-of-Experts com 25,2 bilhões de parâmetros totais, mas só 3,8 bilhões ativam por token. É essa arquitetura que derruba o custo: a inferência roda praticamente como a de um modelo pequeno, mas a "capacidade potencial" é de algo bem maior.

O preço reflete isso na lata: US$ 0,07 por milhão de input, US$ 0,34 por milhão de output. O preço blended fica em US$ 0,179 — quase 11 vezes mais barato que o Haiku. E três coisas que o Haiku 4.5 não entrega: pesos abertos, contexto de 262 mil tokens e entrada de vídeo.

Pesos abertos significam rodar local, ajustar, fazer fine-tune e manter dados em casa. O catálogo tem 392 modelos listados hoje; Gemma 4 é um dos pouquíssimos nessa faixa de preço com essa abertura. Em compliance pesado e em workloads com dado sensível, isso vale mais do que parece.

O que o Haiku 4.5 cobra caro para entregar

O Claude Haiku 4.5 chegou em outubro de 2025 — seis meses a mais de maturidade de API. Custa US$ 1/M de input e US$ 5/M de output, com cache de leitura a US$ 0,10/M. É mais caro, mas a inteligência é outra conversa.

Índice de inteligência (Artificial Analysis)
Claude Haiku 4.529,9Gemma 4 26B A4B 26,1índice
Fonte: Artificial Analysis

Haiku marca 29,892 no índice Artificial Analysis. Gemma 4 marca 26,066. Diferença de 14,7%. Em coding, 43,892 contra 39,316. Em agentic — tarefas longas, multi-step, com ferramentas — Haiku chega a 16,472 contra 11,036 do Gemma. Quase 50% de vantagem em agentic.

Claude Haiku 4.5 × Gemma 4 26B A4B
CritérioClaude Haiku 4.5Gemma 4 26B A4B
Índice de inteligência29.926.1
Entrada US$/M10.07
Saída US$/M50.34
Contexto200k262k
Pesos abertosnãosim
Velocidade (tok/s)90
Índice de código43.939.3
Índice agêntico16.511.0

Leitura direta: quanto mais complexa a tarefa, mais o prêmio do Haiku se justifica. Num fluxo de 10 turnos com tool use, essa distância entre 16,4 e 11,0 se acumula a cada rodada.

O detalhe que ninguém te conta sobre Gemma

Duas observações honestas sobre o catálogo desta data, 18 de abril: a velocidade publicada para o Haiku 4.5 é de 90,21, mas para o Gemma 4 26B A4B o catálogo não publicou número de velocidade. Se você precisa de latência na ponta e quer comparar com dado na mesa, Haiku é o único com número. Da mesma forma, o catálogo não publicou preço de cache para o Gemma 4 — se prompt cache é parte crítica do seu fluxo, é mais um motivo para testar o Haiku primeiro.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 392 modelos disponíveis no catálogo nesta data.

E vale situar os dois: o topo do mercado hoje é o Gemini 3.1 Pro Preview com IQ 47,738, seguido do GPT-5.3-Codex com 45,512. Os dois modelos deste comparativo estão bem abaixo — mas a maioria dos produtos reais não precisa do topo do front. Precisa decidir entre preço e profundidade de raciocínio.

Onde cada um ganha — sem "depende"

Gemma 4 26B A4B leva quando:

  • O volume é alto e o orçamento manda. Processar milhões de tokens por dia no Haiku vira conta de quatro dígitos; no Gemma, ainda em centavos.
  • Você precisa rodar localmente — residência de dados, compliance, fine-tune.
  • A tarefa é multimodal com vídeo.
  • O trabalho é simples: extração, classificação, transformação de texto, resumos curtos.

Claude Haiku 4.5 leva quando:

  • O fluxo é agentic. Multi-step, tool use, decisões autônomas — a vantagem de quase 50% sobre o Gemma pesa em série.
  • Coding é o produto. Se cada token mal gasto vira bug, pagar o premium reduz retry.
  • Você precisa de um número de latência publicado.
  • A maturidade da API importa. Haiku tem seis meses a mais de tooling e integrações consolidadas.

A implicação prática

Comece com o Haiku 4.5 no workflow principal e meça o que gasta. Quando o pipeline estiver claro, desvie o tráfego simples e de alto volume para o Gemma 4 — via API barata ou self-host. Você paga caro só onde a inteligência e o agentic importam, e dilui o custo onde eles não fazem diferença. O Gemma 4 não é "alternativa barata" — é um tipo diferente de aposta: volume, controle e multimodalidade. O Haiku 4.5 não é "mais caro porque é melhor" — é mais caro porque entrega agentic que o Gemma ainda não alcança.

Em uma frase

Use Haiku 4.5 nos fluxos agentic e coding onde a inteligência pesa; desvie o volume simples e de alto tráfego para o Gemma 4, onde o custo domina.

Perguntas frequentes

Qual é mais barato, Gemma 4 ou Claude Haiku 4.5?

O Gemma 4 26B A4B. A saída custa US$ 0,34 por milhão de tokens contra US$ 5 do Haiku 4.5 — quase 15× de diferença no preço de output, e mais de 11× no preço blended.

O Gemma 4 é open weights?

Sim. Pode rodar localmente, fazer fine-tune e manter dados em casa. O Haiku 4.5 é API fechada, sem opção de self-host — o que pesa em compliance e residência de dados.

Quando vale pagar mais caro no Haiku 4.5?

Em fluxos agentic e coding pesado. Haiku marca 16,472 no índice agentic contra 11,036 do Gemma 4 — quase 50% de vantagem, que se acumula em tarefas multi-step e tool use.

Leia também