Gemma 4 custa 14× menos que Haiku 4.5 por milhão de tokens
O Gemma 4 é multimodal com vídeo, mais barato e tem pesos abertos. O Haiku 4.5 cobra quase 15× mais, mas entrega quase 50% a mais em agentic — vale para fluxos longos.
Pare um segundo e olha para o preço de saída: US$ 0,34 por milhão de tokens no Gemma 4 26B A4B, contra US$ 5 no Claude Haiku 4.5. São 14,7 vezes de diferença. Você não está olhando para dois modelos do mesmo segmento — está vendo dois pontos muito distantes na curva de custo por inteligência. E essa distância é o que define a escolha. Não é sobre qual é "melhor".
O que a Google entregou há duas semanas
O Gemma 4 26B A4B foi lançado em 3 de abril de 2026. É um Mixture-of-Experts com 25,2 bilhões de parâmetros totais, mas só 3,8 bilhões ativam por token. É essa arquitetura que derruba o custo: a inferência roda praticamente como a de um modelo pequeno, mas a "capacidade potencial" é de algo bem maior.
O preço reflete isso na lata: US$ 0,07 por milhão de input, US$ 0,34 por milhão de output. O preço blended fica em US$ 0,179 — quase 11 vezes mais barato que o Haiku. E três coisas que o Haiku 4.5 não entrega: pesos abertos, contexto de 262 mil tokens e entrada de vídeo.
Pesos abertos significam rodar local, ajustar, fazer fine-tune e manter dados em casa. O catálogo tem 392 modelos listados hoje; Gemma 4 é um dos pouquíssimos nessa faixa de preço com essa abertura. Em compliance pesado e em workloads com dado sensível, isso vale mais do que parece.
O que o Haiku 4.5 cobra caro para entregar
O Claude Haiku 4.5 chegou em outubro de 2025 — seis meses a mais de maturidade de API. Custa US$ 1/M de input e US$ 5/M de output, com cache de leitura a US$ 0,10/M. É mais caro, mas a inteligência é outra conversa.
Haiku marca 29,892 no índice Artificial Analysis. Gemma 4 marca 26,066. Diferença de 14,7%. Em coding, 43,892 contra 39,316. Em agentic — tarefas longas, multi-step, com ferramentas — Haiku chega a 16,472 contra 11,036 do Gemma. Quase 50% de vantagem em agentic.
| Critério | Claude Haiku 4.5 | Gemma 4 26B A4B |
|---|---|---|
| Índice de inteligência | 29.9 | 26.1 |
| Entrada US$/M | 1 | 0.07 |
| Saída US$/M | 5 | 0.34 |
| Contexto | 200k | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 90 | — |
| Índice de código | 43.9 | 39.3 |
| Índice agêntico | 16.5 | 11.0 |
Leitura direta: quanto mais complexa a tarefa, mais o prêmio do Haiku se justifica. Num fluxo de 10 turnos com tool use, essa distância entre 16,4 e 11,0 se acumula a cada rodada.
O detalhe que ninguém te conta sobre Gemma
Duas observações honestas sobre o catálogo desta data, 18 de abril: a velocidade publicada para o Haiku 4.5 é de 90,21, mas para o Gemma 4 26B A4B o catálogo não publicou número de velocidade. Se você precisa de latência na ponta e quer comparar com dado na mesa, Haiku é o único com número. Da mesma forma, o catálogo não publicou preço de cache para o Gemma 4 — se prompt cache é parte crítica do seu fluxo, é mais um motivo para testar o Haiku primeiro.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
E vale situar os dois: o topo do mercado hoje é o Gemini 3.1 Pro Preview com IQ 47,738, seguido do GPT-5.3-Codex com 45,512. Os dois modelos deste comparativo estão bem abaixo — mas a maioria dos produtos reais não precisa do topo do front. Precisa decidir entre preço e profundidade de raciocínio.
Onde cada um ganha — sem "depende"
Gemma 4 26B A4B leva quando:
- O volume é alto e o orçamento manda. Processar milhões de tokens por dia no Haiku vira conta de quatro dígitos; no Gemma, ainda em centavos.
- Você precisa rodar localmente — residência de dados, compliance, fine-tune.
- A tarefa é multimodal com vídeo.
- O trabalho é simples: extração, classificação, transformação de texto, resumos curtos.
Claude Haiku 4.5 leva quando:
- O fluxo é agentic. Multi-step, tool use, decisões autônomas — a vantagem de quase 50% sobre o Gemma pesa em série.
- Coding é o produto. Se cada token mal gasto vira bug, pagar o premium reduz retry.
- Você precisa de um número de latência publicado.
- A maturidade da API importa. Haiku tem seis meses a mais de tooling e integrações consolidadas.
A implicação prática
Comece com o Haiku 4.5 no workflow principal e meça o que gasta. Quando o pipeline estiver claro, desvie o tráfego simples e de alto volume para o Gemma 4 — via API barata ou self-host. Você paga caro só onde a inteligência e o agentic importam, e dilui o custo onde eles não fazem diferença. O Gemma 4 não é "alternativa barata" — é um tipo diferente de aposta: volume, controle e multimodalidade. O Haiku 4.5 não é "mais caro porque é melhor" — é mais caro porque entrega agentic que o Gemma ainda não alcança.
Use Haiku 4.5 nos fluxos agentic e coding onde a inteligência pesa; desvie o volume simples e de alto tráfego para o Gemma 4, onde o custo domina.
Perguntas frequentes
Qual é mais barato, Gemma 4 ou Claude Haiku 4.5?
O Gemma 4 26B A4B. A saída custa US$ 0,34 por milhão de tokens contra US$ 5 do Haiku 4.5 — quase 15× de diferença no preço de output, e mais de 11× no preço blended.
O Gemma 4 é open weights?
Sim. Pode rodar localmente, fazer fine-tune e manter dados em casa. O Haiku 4.5 é API fechada, sem opção de self-host — o que pesa em compliance e residência de dados.
Quando vale pagar mais caro no Haiku 4.5?
Em fluxos agentic e coding pesado. Haiku marca 16,472 no índice agentic contra 11,036 do Gemma 4 — quase 50% de vantagem, que se acumula em tarefas multi-step e tool use.