Qwen 122B é 26% mais inteligente que Gemma 26B — e custa 7x mais
Dois modelos abertos e multimodais disputam o meio do mercado em abril de 2026. O chinês leva em código e agente; o americano, em volume barato.
O Qwen3.5 122B-A10B cobra US$ 2,40 por milhão de tokens de saída. O Gemma 4 26B A4B cobra US$ 0,34. Você leu certo: o modelo do Qwen custa sete vezes mais que o do Google DeepMind para gerar o mesmo texto. A pergunta que sobra é: vale os 26% a mais de QI que o Qwen entrega?
Os dois modelos são candidatos a "burro de carga" multimodal: ambos leem texto, imagem e vídeo, devolvem texto, têm janela de 262 mil tokens, publicam pesos e são raciocinantes. Mas foram desenhados para bolsos diferentes. E quando você coloca a régua do catálogo — mais de 390 modelos, 54 criadores, com Gemini 3.1 Pro Preview e GPT-5.3-Codex lá em cima cobrando US$ 12 e US$ 14 por milhão de tokens de saída, respectivamente — os dois brigam é pelo andar de baixo.
O que você paga, de verdade
O Gemma 4 26B A4B foi listado no catálogo em 3 de abril de 2026, dez dias antes deste texto. O Qwen3.5 122B-A10B está no ar desde 25 de fevereiro. A diferença de preço de entrada também é grande: US$ 0,07 contra US$ 0,29 por milhão — quatro vezes mais barato no Gemma. Quando você mistura entrada e saída no "blended" usado pelo catálogo, a conta fica US$ 0,18 contra US$ 1,10.
E atenção: o preço de cache (tokens reutilizados que o provedor cobra barato) não está publicado para nenhum dos dois. Se você rodá-los via API de terceiros, pergunte antes; se for self-host, é outro jogo.
O que a régua de inteligência diz
A nota agregada do Artificial Analysis coloca o Qwen em 32,8 e o Gemma em 26,1. Os dois ficam distantes do topo: o Gemini 3.1 Pro Preview lidera com 47,7 e o GPT-5.3-Codex vem logo atrás com 45,5. A briga aqui não é contra a OpenAI ou o Google flagship — é pelo lugar de "modelo aberto decente que cabe no orçamento", em um catálogo que recebeu 28 modelos novos nos últimos 30 dias.
Onde o Qwen realmente abre distância é em código: 45,7 contra 39,3. Em agente, a diferença chega a 93%: 21,3 contra 11,0. Se você está montando um loop agêntico que precisa chamar ferramentas e manter estado, o Qwen entrega quase o dobro de capacidade medida. Em tarefas mais simples — resumo, classificação, extração — os 26% a mais de QI do Qwen mal aparecem na ponta do usuário.
| Critério | Qwen3.5-122B-A10B | Gemma 4 26B A4B |
|---|---|---|
| Índice de inteligência | 32.8 | 26.1 |
| Entrada US$/M | 0.29 | 0.07 |
| Saída US$/M | 2.4 | 0.34 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 131 | — |
| Índice de código | 45.7 | 39.3 |
| Índice agêntico | 21.3 | 11.0 |
País, arquitetura e o detalhe do "ativo"
Ambos são MoE (mixture-of-experts), mas com perfis opostos. O Qwen ativa 10 bilhões de parâmetros de um total de 125 bilhões — uma fração de 8%. O Gemma ativa 3,8 bilhões de 25,2 bilhões — uma fração de 15%. O Gemma é menor no total, mas relativamente mais denso por token. O Qwen é um mamute que se move rápido porque só usa 1/12 de si mesmo por vez.
Os dois publicam pesos. O Qwen vem da China; o Gemma vem dos Estados Unidos. Para deploy on-prem com governança, isso importa: jurisdição de auditoria, cadeia de suprimento de pesos, política de compliance do seu cliente.
Quem leva em quê
Se o seu caso é agente de várias etapas, geração de código não trivial ou raciocínio encadeado, o Qwen ganha. Os 93% a mais em agente e os 16% a mais em coding se traduzem em menos iterações humanas, menos loops de correção, menos tokens desperdiçados — e aí a conta pode até empatar.
Se o seu caso é volume — classificação, OCR multimodal, sumarização, atendimento de primeira linha, qualquer coisa em que cada centavo por mil tokens pesa — o Gemma 4 26B A4B ganha. Sete vezes mais barato na saída não é detalhe, é mudança de modelo de negócio.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
E o resto do catálogo? Os dois ficam abaixo do pelotão de elite, mas acima da média. O Qwen tem velocidade publicada de 131 tokens por segundo; o Gemma não publicou a dele. Se latência importa, o Qwen entrega o número; o Gemma você só descobre rodando.
A implicação prática: não escolha pelo nome da família nem pelo QI agregado. Pegue os três números que importam para o seu fluxo — preço de saída, benchmark de agente, tokens por segundo — e simule o seu caso. A diferença entre os dois é grande o suficiente para que a resposta "qual é melhor" só exista depois dessa conta.
Para agente e código, escolha Qwen 122B e pare de olhar preço; para volume multimodal barato, escolha Gemma 4 26B e aceite os 26% a menos de QI.
Perguntas frequentes
Qwen 3.5 122B ou Gemma 4 26B: qual é melhor para código?
Para código, o Qwen 3.5 122B-A10B lidera com 45,7 contra 39,3 do Gemma 4 26B A4B no benchmark de coding do Artificial Analysis. Em agente, a diferença é ainda maior: 21,3 contra 11,0. Mas o Qwen custa sete vezes mais na saída.
Gemma 4 26B A4B roda em hardware menor?
Em tese sim, porque ativa só 3,8 bilhões de parâmetros por token contra 10 bilhões do Qwen. Na prática, os dois têm 262 mil tokens de contexto e exigem VRAM proporcional. O Gemma não publicou a velocidade em tokens por segundo; o Qwen declarou 131.
Qual dos dois tem cache de prompt com desconto?
Nenhum dos dois publicou preço de cache no catálogo. Se você roda via API de hospedeiro, pergunte diretamente; se faz self-host, cache é decisão sua e não aparece na fatura.