Mesma fatura, 7x menos tokens: Qwen 3.5 397B vs Gemma 4 31B
Qwen ganha em qualidade e velocidade; Gemma custa quase sete vezes menos e tem cache publicado. O caso de uso decide qual vale a pena.
Você tem US$ 34 todo mês para gastar em API. Com o Gemma 4 31B, esse valor paga 100 milhões de tokens de saída. Com o Qwen 3.5 397B, paga pouco mais de 14 milhões. Mesma fatura, volume quase sete vezes menor — a diferença de qualidade entre os dois compensa o que você deixa de gerar?
Coloque os dois lado a lado. O Qwen 3.5 397B A17B, da chinesa Qwen, lançado em 16 de fevereiro, é um modelo MoE (mistura de especialistas) com 397 bilhões de parâmetros totais mas só 17 bilhões ativos por token. Pense numa equipe de 397 pessoas onde só 17 atendem cada cliente de cada vez — e por isso o atendimento anda rápido. O Gemma 4 31B, do Google DeepMind (EUA), lançado em 2 de abril (seis dias atrás), é um modelo denso de 30,7 bilhões: todo mundo trabalha em toda chamada, sem especialização.
Ambos são open weights. Ambos multimodal (texto + imagem + vídeo para texto). Ambos com 262 mil tokens de contexto. Ambos com modo de raciocínio configurável. Parece briga justa. Não é.
Os números aparecem quando você testa
No índice de inteligência medido pelo Artificial Analysis, o Qwen marca 34,26 e o Gemma marca 29,70 — diferença de 15%. Em coding, 48,21 contra 43,43, 11% a mais. Em agentic (tarefas em que o modelo precisa agir em etapas, usar ferramentas e tomar decisões), o Qwen chega a 19,85 e o Gemma fica em 14,38, quase 28% abaixo.
Traduzindo: se você pede para o modelo escrever uma função não trivial, debugar código real ou operar um agente de software, o Qwen entrega um salto perceptível. Não é cosmético.
A conta que chega no fim do mês
Aqui é onde a coisa muda de figura. O Qwen cobra US$ 0,39 por milhão de tokens de entrada e US$ 2,34 por milhão de tokens de saída. O Gemma cobra US$ 0,09 e US$ 0,34, respectivamente. E o Gemma ainda oferece cache por US$ 0,05 por milhão — o Qwen simplesmente não publica preço de cache no catálogo desta data.
Na ponta do lápis, se o seu sistema gera 100 milhões de tokens de saída por mês:
- Qwen: US$ 234
- Gemma: US$ 34
São US$ 200 de diferença por mês, todo mês, pelo mesmo volume. Em um ano, são US$ 2.400. Em um sistema que processa 1 bilhão de tokens de saída, a conta vira US$ 2.340 contra US$ 340. A diferença é o salário de um estagiário júnior.
Velocidade muda a experiência do usuário
Mas tem um número que o gráfico de preço não mostra. O Qwen processa 87,91 tokens por segundo; o Gemma, 35,06. O Qwen é 2,5 vezes mais rápido.
| Critério | Qwen3.5 397B A17B | Gemma 4 31B |
|---|---|---|
| Índice de inteligência | 34.3 | 29.7 |
| Entrada US$/M | 0.55 | 0.09 |
| Saída US$/M | 3.5 | 0.34 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 88 | 35 |
| Índice de código | 48.2 | 43.4 |
| Índice agêntico | 19.8 | 14.4 |
Se você está construindo um produto onde o usuário espera resposta em tempo real — um chat, um copilot, um agente que executa comandos na tela —, essa diferença é perceptível. O Gemma funciona, mas a resposta demora um cadin a mais. Em batch jobs, em análises longas em que ninguém fica olhando a tela, isso não importa.
Quando cada um ganha
Qwen 3.5 397B ganha quando:
- A tarefa é coding sério, agentic ou raciocínio multi-etapa, e a qualidade do output muda resultado de negócio
- Você precisa de baixa latência para o usuário final
- O volume mensal não é absurdo e a economia não é o critério número um
Gemma 4 31B ganha quando:
- O orçamento é o critério número um
- Você roda muito volume de tarefas "boas o suficiente" (resumo, classificação, extração, chat simples, RAG)
- Você aceita tempos de resposta mais lentos
- Você quer aproveitar cache pricing (US$ 0,05/M) para reduzir ainda mais o custo — o Qwen não tem esse recurso publicado
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
No fim das contas, não é "depende". Se você consegue repassar a qualidade que o Qwen entrega ao cliente final — cobrar por isso, embutir num produto premium —, pague o Qwen. Se o seu produto vende por volume e margem, vá de Gemma e gaste a economia em aquisição de usuário.
Se a qualidade do output vira receita no seu produto, vá de Qwen 3.5 397B; se a margem depende do custo por token, vá de Gemma 4 31B e use o cache de US$ 0,05/M para economizar ainda mais.
Perguntas frequentes
Qwen 3.5 397B ou Gemma 4 31B é melhor para programação?
Qwen 3.5 397B. Ele marca 48,21 no benchmark de coding do Artificial Analysis, contra 43,43 do Gemma 4 31B. Em tarefas agentic, em que o modelo usa ferramentas e decide em etapas, a diferença é ainda maior: 19,85 contra 14,38.
Quanto custa rodar o Gemma 4 31B em produção?
A US$ 0,34 por milhão de tokens de saída, são US$ 34 para cada 100 milhões de tokens gerados. Com cache a US$ 0,05 por milhão, prompts repetidos ficam ainda mais baratos. O Qwen 3.5 397B, no mesmo volume, custaria US$ 234.
O Gemma 4 31B é mais lento que o Qwen 3.5 397B?
Sim, e de forma perceptível. O Qwen processa 87,91 tokens por segundo, contra 35,06 do Gemma — uma diferença de 2,5x. Em chat ou copilot com usuário esperando, isso aparece; em batch noturno, não.