FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Gemma 4 31B custa 7 vezes menos que Qwen3.5-122B na saída

Dois modelos abertos multimodal com a mesma janela de 256K, mas preços e perfis de uso bem diferentes.

Redação FalaVIP IA 3 min de leitura
US$ 0,34por milhão de tokens de saída no Gemma 4 31B
US$ 2,40por milhão de tokens de saída no Qwen3.5-122B-A10B
131,43 tokens/svelocidade do Qwen3.5-122B-A10B

Você está olhando dois modelos abertos com a mesma janela de 256K, ambos multimodal, ambos com modo de raciocínio. A diferença aparece quando a fatura chega.

O que cada um é

O Qwen3.5-122B-A10B, da Qwen, é um modelo híbrido: 125 bilhões de parâmetros no total, mas só 10 bilhões ativos a cada inferência, porque usa mistura de especialistas esparsa combinada com atenção linear. Pense nele como um restaurante com 125 chefs no quadro, mas só 10 cozinham seu prato por vez — você paga pela estrutura, mas o custo de cada pedido fica baixo.

O Gemma 4 31B, do Google DeepMind, é denso: 30,7 bilhões de parâmetros, todos ativos em cada passada. É o restaurante menor, com todo mundo na cozinha o tempo todo. Lançado em 2 de abril de 2026, ele traz suporte a texto, imagem e vídeo como entrada, saída em texto, e cache de prompt a US$ 0,05 por milhão de tokens — algo que o Qwen nem publicou.

Qwen3.5-122B-A10B × Gemma 4 31B
CritérioQwen3.5-122B-A10BGemma 4 31B
Índice de inteligência32.829.7
Entrada US$/M0.290.09
Saída US$/M2.40.34
Contexto262k262k
Pesos abertossimsim
Velocidade (tok/s)13135
Índice de código45.743.4
Índice agêntico21.314.4

Preço: a conta que dói diferente

Na saída, a diferença é brutal. O Gemma 4 31B cobra US$ 0,34 por milhão de tokens de saída; o Qwen3.5-122B-A10B cobra US$ 2,40. São cerca de 7 vezes mais caro por token gerado. Na entrada, a vantagem do Gemma também existe, mas é menor: US$ 0,09 contra US$ 0,29.

Preço de saída (US$ por milhão de tokens)
Qwen3.5-122B-A10B2,4Gemma 4 31B0,34US$/M
Fonte: OpenRouter

Se o seu produto é um chatbot que cospe muita resposta, ou um agente que encadeia chamadas longas, essa diferença de 7x se multiplica rápido no fim do mês. É o tipo de economia que paga um estagiário.

Inteligência e velocidade: quem entrega mais por token

No índice de inteligência medido pela Artificial Analysis hoje, o Qwen marca 32,847 e o Gemma 4 marca 29,695. Em coding, a vantagem do Qwen se mantém: 45,715 contra 43,431. Em tarefas agentic, 21,267 contra 14,379 — uma diferença grande, quase 50% a mais para o Qwen.

Índice de inteligência (Artificial Analysis)
Qwen3.5-122B-A10B32,8Gemma 4 31B29,7índice
Fonte: Artificial Analysis

Mas velocidade conta, e aqui o Qwen atropela: 131,43 tokens por segundo contra 35,06 do Gemma. Quase 4 vezes mais rápido. Em workloads agentic com muitas chamadas curtas, isso muda a experiência do usuário, não só a conta.

Onde cada um ganha

Gemma 4 31B ganha quando você precisa de multimodal barato para alto volume de saída: resumos, classificações, geração de texto em massa, qualquer coisa onde cada centavo por token de saída pesa. O cache de prompt a US$ 0,05 ajuda muito em prompts repetidos com pequenas variações — por exemplo, RAG com a mesma base de contexto.

Qwen3.5-122B-A10B ganha quando a tarefa exige raciocínio agentic mais forte e velocidade bruta: agentes que orquestram ferramentas, pipelines de código, workloads onde o tempo de resposta importa mais que o custo marginal. Os 10 bilhões de parâmetros ativos por inferência entregam um sweet spot raro entre capacidade e eficiência.

O tabuleiro em 11 de abril de 2026

Nenhum dos dois disputa a ponta do mercado — Gemini 3.1 Pro Preview (47,738) e GPT-5.3-Codex (45,512) lideram o catálogo de 390 modelos. Os dois aqui brigam é na faixa intermediária, onde o custo decide. O catálogo não publicou preço para os dois líderes acima de IQ 45, então não dá para comparar diretamente, mas a ordem de grandeza é outra.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 390 modelos disponíveis no catálogo nesta data.

O que você faz com isso amanhã

Se você está pagando a API hoje e multimodal aberto está no roadmap, rode os dois no seu caso de uso real antes de comprometer volume. O Gemma 4 31B é o candidato default para corte de custo sem perder multimodal; o Qwen3.5-122B-A10B é o candidato para quando agentic e velocidade valem o preço.

Em uma frase

Use Gemma 4 31B para multimodal de alto volume onde cada token de saída pesa no orçamento; use Qwen3.5-122B-A10B quando tarefas agentic e velocidade justificarem pagar 7 vezes mais por milhão de tokens de saída.

Perguntas frequentes

Qual a diferença de preço entre Gemma 4 31B e Qwen3.5-122B-A10B?

O Gemma 4 31B cobra US$ 0,34 por milhão de tokens de saída, enquanto o Qwen3.5-122B-A10B cobra US$ 2,40 — cerca de 7 vezes mais caro na saída. Na entrada, a diferença cai para cerca de 3 vezes (US$ 0,09 contra US$ 0,29).

Os dois modelos são open weights?

Sim, ambos têm pesos abertos. O Gemma 4 31B é denso, com 30,7 bilhões de parâmetros todos ativos. O Qwen3.5-122B-A10B é uma mistura de especialistas com 125 bilhões totais e 10 bilhões ativos por inferência.

Qual é melhor para agentes?

No índice agentic medido hoje, o Qwen3.5-122B-A10B marca 21,267 contra 14,379 do Gemma 4 31B, além de ser quase 4 vezes mais rápido em tokens por segundo. Para workloads agentic com muitas chamadas, o Qwen entrega mais por unidade de tempo, mesmo custando mais por token.

Leia também