Claude Sonnet 4.6 vs Gemma 4 31B: 44x mais caro na saída
A diferença de preço é absurda, mas contexto de 1M tokens, raciocínio configurável e pesos abertos mudam o cálculo — veja quando cada um vence.
Você está olhando para o preço de saída e contando os zeros. US$ 15 por milhão de tokens do Claude Sonnet 4.6 contra US$ 0,34 do Gemma 4 31B são 44 vezes de diferença na conta. Para quem paga API, é o tipo de número que muda a arquitetura inteira de um produto. Mas preço sozinho é meia informação — e comparar os dois só por aí é deixar dinheiro na mesa na direção errada.
O buraco na fatura
A proporção se repete nas outras linhas. Input custa US$ 3 no Claude contra US$ 0,09 no Gemma — 33 vezes mais caro. No cache, a diferença cai para 6 vezes (US$ 0,30 contra US$ 0,05). Pense no cache como um restaurante que decora seu pedido: depois de pagar o couvert pela primeira vez, cada repetição do mesmo prefixo enorme fica baratíssima. Mesmo assim, o "barato" do Claude continua sendo caro.
Para situar o gasto: se você gasta hoje US$ 1.000 por mês em saída do Sonnet 4.6, o mesmo volume cairia para cerca de US$ 22,70 no Gemma 4 31B no preço de tabela. É a diferença entre fechar contrato com a API e tratar inferência como despesa de marketing.
O que os US$ 14,66 a mais estão comprando
A janela de contexto do Sonnet 4.6 é de 1 milhão de tokens, quase quatro vezes os 262.144 do Gemma 4 31B. Em projetos com codebase grande ou transcrições longas, isso muda o que cabe no prompt sem precisar truncar. Em tarefas curtas, é irrelevante.
O índice de inteligência do Claude está em 35,1 contra 29,7 do Gemma — cinco pontos na régua da Artificial Analysis. Visível, não abissal. E, olhando para o topo do mercado nesta data, os dois modelos comparados estão distantes da fronteira:
O Gemini 3.1 Pro Preview lidera com 47,7, seguido pelo GPT-5.3-Codex em 45,5. O Sonnet 4.6 ocupa o quarto lugar geral; o Gemma 4 31B está numa faixa intermediária densa, junto da maioria dos modelos abertos e fechados deste catálogo de 388 opções.
| Critério | Claude Sonnet 4.6 | Gemma 4 31B |
|---|---|---|
| Índice de inteligência | 35.1 | 29.7 |
| Entrada US$/M | 3 | 0.09 |
| Saída US$/M | 15 | 0.34 |
| Contexto | 1M | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 41 | 35 |
| Índice de código | — | 43.4 |
| Índice agêntico | — | 14.4 |
O detalhe que muda o cálculo
Três pontos que preço nenhum dos dois entrega na régua:
Pesos abertos. O Gemma 4 31B é open weights, com 30,7 bilhões de parâmetros denso. Dá para baixar e rodar em hardware próprio — o que significa que os US$ 0,34 do Google são o preço da API, não o custo real de inferência se você hospedar. Para volume alto e estável, rodar local pode ser bastante mais barato que o preço de tabela do Claude, mas exige equipe de MLOps e GPU, e esse custo não está na fatura da API.
Raciocínio configurável. O Gemma 4 31B tem reasoning mode. O Sonnet 4.6, não. Em tarefas que se beneficiam de cadeia de pensamento estendida, isso pode estreitar parte da diferença de IQ no uso prático.
Multimodalidade. O Gemma 4 31B aceita texto, imagem e vídeo; o Sonnet 4.6 trabalha com texto, imagem e arquivo. Quem precisa processar vídeo de entrada só tem uma opção nesta comparação.
Quando cada um ganha
Claude Sonnet 4.6 ganha quando:
- A tarefa exige engolir uma codebase ou documento que passa de 256 mil tokens.
- O índice de omnisciência importa: -2,1 do Sonnet contra -47,9 do Gemma indica o quanto o modelo "alucina" fora do domínio. Para agentes longos que não podem errar uma instrução crítica no meio do caminho, isso pesa.
- A velocidade de resposta faz diferença: 41,4 tokens por segundo contra 35,1 do Gemma.
Gemma 4 31B ganha quando:
- O volume de chamadas mensais está sufocando o orçamento e o trabalho cabe em 256 mil tokens.
- A aplicação lida com vídeo de entrada ou o pipeline precisa alternar entre API e self-hosted sem trocar de modelo.
- Você quer pagar barato agora mantendo a opção de trocar de modalidade de hospedagem depois.
Para volume alto e tarefas que cabem em 256 mil tokens, troque para o Gemma 4 31B e veja a fatura cair mais de 95%; para contextos enormes, agentes longos ou uso onde alucinação fora do domínio custa caro, o Claude Sonnet 4.6 continua justificando os US$ 14,66 a mais por milhão de tokens.
Perguntas frequentes
Claude Sonnet 4.6 ou Gemma 4 31B: qual é mais barato?
Gemma 4 31B, disparado. O preço de saída é US$ 0,34 por milhão de tokens contra US$ 15 do Claude Sonnet 4.6 — 44 vezes menos. O input também é mais barato (US$ 0,09 contra US$ 3) e o cache custa um sexto.
Posso rodar o Gemma 4 31B no meu próprio servidor?
Sim. O Gemma 4 31B tem pesos abertos com 30,7 bilhões de parâmetros densos. Você baixa os pesos e roda onde quiser, mas precisa de GPU e equipe para manter. Os US$ 0,34 são apenas o preço da API — uma das formas de acesso, não o teto do custo.
Qual dos dois tem a maior janela de contexto?
Claude Sonnet 4.6, com 1 milhão de tokens — quase quatro vezes os 262.144 do Gemma 4 31B. Para codebases muito grandes ou documentos extensos que precisam caber inteiros no prompt, o Claude leva.