Gemma 4 26B A4B custa o mesmo que a irmã 31B — e entrega menos
O MoE 26B A4B saiu um dia depois do Gemma 4 31B densa. Mesma fatura de saída, menos IQ, menos coding. A estratégia da Google parece clara — mas o preço não ajuda o usuário.
Ontem (03/04) a Google colocou no ar o Gemma 4 26B A4B IT. No dia anterior, tinha sido a vez do Gemma 4 31B. Dois lançamentos em 48 horas, dois formatos: um denso de 30,7B, outro MoE de 25,2B. O detalhe que muda tudo está na fatura — e não é da forma que o release sugere.
Dois Gemma 4 em 48 horas
A Google DeepMind abriu a família Gemma 4 com duas variantes quase simultâneas. O 31B é o tradicional: denso, multimodal, 256K de contexto. O 26B A4B é a aposta diferente — 25,2B parâmetros totais, mas só 3,8B ativos por token, em arquitetura Mixture-of-Experts.
A promessa é conhecida: "qualidade de 31B com compute de modelo pequeno". É como manter cinco especialistas na sala e só chamar um ou dois por pergunta — você não paga o salário de todo mundo, só dos que trabalharam naquele token. Para o provedor, a conta de GPU cai. Para quem está do outro lado da API, a história é outra.
O que muda (e o que não muda) na sua conta
O catálogo de hoje, com mais de 388 modelos listados e 31 lançamentos nos últimos 30 dias, mostra preços que desmentem a narrativa "MoE = mais barato":
O Gemma 4 26B A4B cobra US$ 0,07 por milhão de tokens de entrada e US$ 0,34 por milhão de saída. O Gemma 4 31B denso — irmã lançada no dia anterior — cobra US$ 0,09 e US$ 0,34. Mesmo preço de saída, byte a byte. A eficiência do MoE, se existe, fica no servidor da Google, não na sua invoice.
Pior: o gpt-oss-120b da OpenAI cobra US$ 0,17 por milhão de saída. Exatamente a metade. Então o "MoE econômico" do Gemma 4 26B sai mais caro na API que a alternativa aberta da própria OpenAI.
Onde ele se encaixa no tabuleiro
Em inteligência geral, o Gemma 4 26B A4B marca 26,066 no índice atual. Está fora do top 5 do dia:
O topo hoje é Gemini 3.1 Pro Preview (47,738) e GPT-5.3-Codex (45,512), seguidos pelos chineses Xiaomi MiMo-V2-Omni (35,866), Claude Sonnet 4.6 (35,108) e Qwen3.5 397B (34,262). O Gemma 4 26B fica numa faixa intermediária, sem briga pelo pódio.
Onde ele de fato se destaca é em coding: 39,316. Entre os pares listados, é o segundo melhor — atrás só do próprio Gemma 4 31B (43,431) e à frente do gpt-oss-120b (30,441). Para geração e revisão de código, o MoE aguenta o tranco.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Gemma 4 26B A4B (o novo) | 26.1 | 0.07 | 0.34 | 262k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Gemma 4 31B | 29.7 | 0.09 | 0.34 | 262k |
| Mercury 2 | 21.9 | 0.25 | 0.75 | 128k |
| Qwen3 Coder Next | 21.3 | 0.12 | 0.8 | 262k |
Em agentic, a história inverte: 11,036 contra 13,425 do gpt-oss-120b. Em fluxos autônomos longos, onde o modelo precisa decidir sozinho em sequência, a referência aberta da OpenAI ainda leva — e por menos dinheiro.
Para quem vale — e para quem não
Vale a pena se você:
- Quer modelo open-weight multimodal (texto + imagem + vídeo → texto) com 256K de contexto;
- Roda tarefas de codificação onde os 39 pontos de coding fazem diferença real;
- Precisa manter o stack dentro do ecossistema Google sem migrar para o Gemini Pro fechado.
Não vale se você:
- Precisa de raciocínio de topo — Gemini 3.1 Pro Preview (US$ 12/M de saída) e GPT-5.3-Codex (US$ 14/M) entregam quase o dobro de IQ;
- Está com orçamento apertado e o caso de uso é agentic — o gpt-oss-120b custa metade e vai melhor em autonomia;
- Quer o melhor da própria linha Gemma — o 31B denso custa os mesmos US$ 0,34 de saída e entrega mais IQ, mais coding e mais agentic.
O que fazer agora
Se o Gemma 4 26B A4B está no seu radar, rode seu próprio benchmark antes de migrar. O índice agregado diz pouco sobre o seu caso — principalmente porque ele perde da própria irmã de 30,7B cobrando o mesmo.
Para a maioria dos times olhando open-weight hoje, o gpt-oss-120b segue sendo a referência de custo-benefício — até a Google justificar os US$ 0,34 de saída com algo além do selo "3,8B ativos".
Para 90% dos casos, o Gemma 4 31B densa (mesma saída, mais IQ) ou o gpt-oss-120b (metade do preço, mais agentic) são escolhas mais racionais que o 26B A4B — só vale a pena se você rodar benchmark próprio mostrando ganho real no seu workload.
Perguntas frequentes
Gemma 4 26B A4B ou gpt-oss-120b: qual escolher?
Depende do uso. O Gemma tem IQ mais alto (26,066 vs 24,126) e melhor em coding (39,316 vs 30,441), mas cobra o dobro do preço de saída (US$ 0,34 vs US$ 0,17 por milhão). Em agentic, o gpt-oss-120b é superior (13,425 vs 11,036). Para codificação com orçamento flexível e multimodalidade, o Gemma; para autonomia e economia, o gpt-oss-120b.
O que significa "A4B" no nome do Gemma 4 26B?
Indica "4 bilhões de parâmetros ativos" — referência à arquitetura MoE, que tem 25,2B totais mas ativa apenas 3,8B por token. É a forma da Google comunicar a eficiência do modelo sem entrar em jargão técnico completo.
Por que a Google lançou o 26B A4B junto com o 31B?
O release fala em "qualidade de 31B com compute menor" graças ao MoE — o que faz sentido para a infraestrutura da Google, mas na fatura da API o preço de saída dos dois é o mesmo (US$ 0,34). É mais uma jogada de portfólio: o 26B A4B escala com menor custo de GPU no servidor; o 31B denso atende quem quer o máximo da família.