Qwen3.5 122B cobra US$ 2,40 por milhão de saída e mira o Haiku 4.5
Modelo chinês open-weights de 125B parâmetros chega dois dias depois do irmão maior e fica entre o MiMo da Xiaomi e o Haiku da Anthropic no radar de preço.
O que a Qwen entregou nesta semana
A Qwen colocou no catálogo, em 27 de fevereiro de 2026, o Qwen3.5-122B-A10B, lançado dois dias antes. É um modelo vision-language nativo — aceita texto, imagem e vídeo na entrada e devolve texto — com 125 bilhões de parâmetros totais e apenas 10 bilhões ativos por inferência, graças à arquitetura híbrida de atenção linear com mixture-of-experts esparso. O preço de saída é US$ 2,40 por milhão de tokens e a entrada custa US$ 0,29. Janela de contexto de 262 mil tokens, raciocínio habilitado, pesos abertos.
Onde ele se encaixa no catálogo
O índice de inteligência geral é 32,8, abaixo do irmão maior 397B (34,3) e do MiMo-V2-Flash da Xiaomi (34,0), mas acima do Claude Haiku 4.5 (29,9) e do o3 da OpenAI (31,1). Em coding, porém, o 122B marca 45,7 — pontuação que coloca o modelo acima do próprio Haiku 4.5 (43,9) e perto do 397B (48,2). Em tarefas agentic, 21,3 contra 19,8 do irmão maior.
A leitura prática: para fluxos que dependem mais de gerar código correto do que de raciocínio encadeado longo, o 122B entrega mais do que o IQ geral sugere. Para fluxos agentic longos e cheios de ferramenta, o 397B ainda é a melhor escolha dentro da casa.
Para quem vale
Se você roda um backend que consome muito token de saída — geração de código, refactor, testes, documentação técnica — e quer manter a fatura baixa, o Qwen3.5-122B-A10B entra na conta. Sai por US$ 2,40 o milhão de tokens de saída, contra US$ 5,00 do Haiku 4.5 e US$ 8,00 do o3. É quase metade do Haiku e um terço do o3.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Qwen3.5-122B-A10B (o novo) | 32.8 | 0.29 | 2.4 | 262k |
| MiMo-V2-Flash | 34.0 | 0.1 | 0.3 | 262k |
| Qwen3.5 397B A17B | 34.3 | 0.55 | 3.5 | 262k |
| Claude Haiku 4.5 | 29.9 | 1 | 5 | 200k |
| o3 | 31.1 | 2 | 8 | 200k |
Como os pesos são abertos, dá para hospedar em GPU própria e zerar a conta de API quando o volume justificar. A Qwen não publicou preço de cache de leitura neste modelo, então quem depende de cache agressivo precisa testar antes — não dá para cravar economia sem medir.
Para quem não muda nada
Se o seu gargalo é raciocínio pesado, o Gemini 3.1 Pro Preview (IQ 47,7) e o GPT-5.3-Codex (IQ 45,5) seguem em outro andar. Custam mais — US$ 12 e US$ 14 por milhão de saída — mas a diferença de capacidade não se resolve com prompt engineering.
Se você já roda o MiMo-V2-Flash da Xiaomi, vale comparar antes de trocar: o MiMo é mais barato (US$ 0,30 de saída) e tem IQ geral um pouco maior (34,0 contra 32,8), embora não tenha os números de coding e agentic publicados. Para workloads multimodais nativos com vídeo, o 122B é o mais barato da família Qwen3.5 com essa capacidade — o MiMo é só texto.
O tabuleiro em 27 de fevereiro
O catálogo soma mais de 350 modelos de 52 criadores, com 25 lançamentos nos últimos 30 dias. Os dois únicos acima de IQ 45 são Gemini 3.1 Pro Preview e GPT-5.3-Codex, e ambos custam US$ 12 ou mais por milhão de saída. A faixa intermediária — IQ entre 30 e 35 — é onde a briga está: Qwen, Xiaomi e Anthropic disputam cada centavo por milhão de tokens.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3.5-122b-a10b |
| Criador | qwen |
| Preço de entrada | US$ 0.290 / M tokens |
| Preço de saída | US$ 2.40 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image+video->text |
| Índice de inteligência (AA) | 32.8 |
| Índice de código | 45.7 |
| Índice agêntico | 21.3 |
| Parâmetros | 125B (10B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 131 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O que fazer com isso
Se a sua fila de tarefas é majoritariamente geração de código ou texto técnico em volume, teste o Qwen3.5-122B-A10B contra o Haiku 4.5 que você usa hoje. A diferença de preço é grande o suficiente para mudar a fatura mensal mesmo em rotinas mistas. Se o seu caso é multimodal com vídeo ou raciocínio agentic longo, continue no 397B ou suba para a faixa acima de IQ 45 — o 122B não foi feito para isso.
Troque o Haiku 4.5 pelo Qwen3.5-122B-A10B em fluxos de geração de código e texto técnico em volume para cortar quase metade da fatura de API, mas mantenha o 397B ou um modelo de IQ acima de 45 quando raciocínio agentic longo entra em jogo.
Perguntas frequentes
Qwen3.5-122B-A10B é mais barato que o Claude Haiku 4.5?
Sim. Custa US$ 2,40 por milhão de tokens de saída contra US$ 5,00 do Haiku 4.5 — quase metade. Na entrada, a diferença é menor: US$ 0,29 contra US$ 1,00.
Quais são os parâmetros ativos do Qwen3.5-122B-A10B?
São 10 bilhões de parâmetros ativos por inferência, de um total de 125 bilhões. A arquitetura híbrida combina atenção linear com mixture-of-experts esparso para reduzir custo sem perder capacidade multimodal.
O Qwen3.5-122B-A10B serve para tarefas agentic?
Serve para agentic curto. O índice agentic é 21,3, acima do irmão maior 397B (19,8) e bem acima do Haiku 4.5 (16,5). Para agentic longo com muitas chamadas de ferramenta, o 397B ou modelos acima de IQ 45 ainda rendem mais.