FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Mesma fatura, 7x menos tokens: Qwen 3.5 397B vs Gemma 4 31B

Qwen ganha em qualidade e velocidade; Gemma custa quase sete vezes menos e tem cache publicado. O caso de uso decide qual vale a pena.

Redação FalaVIP IA 3 min de leitura
US$ 2,34 / US$ 0,34preço por milhão de tokens de saída (Qwen vs Gemma)
87,91 tok/svelocidade do Qwen 3.5 397B, 2,5x mais rápido que o Gemma
28% abaixodesempenho do Gemma 4 31B no benchmark agentic

Você tem US$ 34 todo mês para gastar em API. Com o Gemma 4 31B, esse valor paga 100 milhões de tokens de saída. Com o Qwen 3.5 397B, paga pouco mais de 14 milhões. Mesma fatura, volume quase sete vezes menor — a diferença de qualidade entre os dois compensa o que você deixa de gerar?

Coloque os dois lado a lado. O Qwen 3.5 397B A17B, da chinesa Qwen, lançado em 16 de fevereiro, é um modelo MoE (mistura de especialistas) com 397 bilhões de parâmetros totais mas só 17 bilhões ativos por token. Pense numa equipe de 397 pessoas onde só 17 atendem cada cliente de cada vez — e por isso o atendimento anda rápido. O Gemma 4 31B, do Google DeepMind (EUA), lançado em 2 de abril (seis dias atrás), é um modelo denso de 30,7 bilhões: todo mundo trabalha em toda chamada, sem especialização.

Ambos são open weights. Ambos multimodal (texto + imagem + vídeo para texto). Ambos com 262 mil tokens de contexto. Ambos com modo de raciocínio configurável. Parece briga justa. Não é.

Os números aparecem quando você testa

No índice de inteligência medido pelo Artificial Analysis, o Qwen marca 34,26 e o Gemma marca 29,70 — diferença de 15%. Em coding, 48,21 contra 43,43, 11% a mais. Em agentic (tarefas em que o modelo precisa agir em etapas, usar ferramentas e tomar decisões), o Qwen chega a 19,85 e o Gemma fica em 14,38, quase 28% abaixo.

Índice de inteligência (Artificial Analysis)
Qwen3.5 397B A17B34,3Gemma 4 31B29,7índice
Fonte: Artificial Analysis

Traduzindo: se você pede para o modelo escrever uma função não trivial, debugar código real ou operar um agente de software, o Qwen entrega um salto perceptível. Não é cosmético.

A conta que chega no fim do mês

Aqui é onde a coisa muda de figura. O Qwen cobra US$ 0,39 por milhão de tokens de entrada e US$ 2,34 por milhão de tokens de saída. O Gemma cobra US$ 0,09 e US$ 0,34, respectivamente. E o Gemma ainda oferece cache por US$ 0,05 por milhão — o Qwen simplesmente não publica preço de cache no catálogo desta data.

Preço de saída (US$ por milhão de tokens)
Qwen3.5 397B A17B3,5Gemma 4 31B0,34US$/M
Fonte: OpenRouter

Na ponta do lápis, se o seu sistema gera 100 milhões de tokens de saída por mês:

  • Qwen: US$ 234
  • Gemma: US$ 34

São US$ 200 de diferença por mês, todo mês, pelo mesmo volume. Em um ano, são US$ 2.400. Em um sistema que processa 1 bilhão de tokens de saída, a conta vira US$ 2.340 contra US$ 340. A diferença é o salário de um estagiário júnior.

Velocidade muda a experiência do usuário

Mas tem um número que o gráfico de preço não mostra. O Qwen processa 87,91 tokens por segundo; o Gemma, 35,06. O Qwen é 2,5 vezes mais rápido.

Qwen3.5 397B A17B × Gemma 4 31B
CritérioQwen3.5 397B A17BGemma 4 31B
Índice de inteligência34.329.7
Entrada US$/M0.550.09
Saída US$/M3.50.34
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)8835
Índice de código48.243.4
Índice agêntico19.814.4

Se você está construindo um produto onde o usuário espera resposta em tempo real — um chat, um copilot, um agente que executa comandos na tela —, essa diferença é perceptível. O Gemma funciona, mas a resposta demora um cadin a mais. Em batch jobs, em análises longas em que ninguém fica olhando a tela, isso não importa.

Quando cada um ganha

Qwen 3.5 397B ganha quando:

  • A tarefa é coding sério, agentic ou raciocínio multi-etapa, e a qualidade do output muda resultado de negócio
  • Você precisa de baixa latência para o usuário final
  • O volume mensal não é absurdo e a economia não é o critério número um

Gemma 4 31B ganha quando:

  • O orçamento é o critério número um
  • Você roda muito volume de tarefas "boas o suficiente" (resumo, classificação, extração, chat simples, RAG)
  • Você aceita tempos de resposta mais lentos
  • Você quer aproveitar cache pricing (US$ 0,05/M) para reduzir ainda mais o custo — o Qwen não tem esse recurso publicado
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 390 modelos disponíveis no catálogo nesta data.

No fim das contas, não é "depende". Se você consegue repassar a qualidade que o Qwen entrega ao cliente final — cobrar por isso, embutir num produto premium —, pague o Qwen. Se o seu produto vende por volume e margem, vá de Gemma e gaste a economia em aquisição de usuário.

Em uma frase

Se a qualidade do output vira receita no seu produto, vá de Qwen 3.5 397B; se a margem depende do custo por token, vá de Gemma 4 31B e use o cache de US$ 0,05/M para economizar ainda mais.

Perguntas frequentes

Qwen 3.5 397B ou Gemma 4 31B é melhor para programação?

Qwen 3.5 397B. Ele marca 48,21 no benchmark de coding do Artificial Analysis, contra 43,43 do Gemma 4 31B. Em tarefas agentic, em que o modelo usa ferramentas e decide em etapas, a diferença é ainda maior: 19,85 contra 14,38.

Quanto custa rodar o Gemma 4 31B em produção?

A US$ 0,34 por milhão de tokens de saída, são US$ 34 para cada 100 milhões de tokens gerados. Com cache a US$ 0,05 por milhão, prompts repetidos ficam ainda mais baratos. O Qwen 3.5 397B, no mesmo volume, custaria US$ 234.

O Gemma 4 31B é mais lento que o Qwen 3.5 397B?

Sim, e de forma perceptível. O Qwen processa 87,91 tokens por segundo, contra 35,06 do Gemma — uma diferença de 2,5x. Em chat ou copilot com usuário esperando, isso aparece; em batch noturno, não.

Leia também