FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3.5 122B cobra US$ 2,40 por milhão de saída e mira o Haiku 4.5

Modelo chinês open-weights de 125B parâmetros chega dois dias depois do irmão maior e fica entre o MiMo da Xiaomi e o Haiku da Anthropic no radar de preço.

Redação FalaVIP IA 3 min de leitura
US$ 2,40por milhão de tokens de saída
45,7índice de coding (acima do IQ geral)
10Bparâmetros ativos de 125B totais

O que a Qwen entregou nesta semana

A Qwen colocou no catálogo, em 27 de fevereiro de 2026, o Qwen3.5-122B-A10B, lançado dois dias antes. É um modelo vision-language nativo — aceita texto, imagem e vídeo na entrada e devolve texto — com 125 bilhões de parâmetros totais e apenas 10 bilhões ativos por inferência, graças à arquitetura híbrida de atenção linear com mixture-of-experts esparso. O preço de saída é US$ 2,40 por milhão de tokens e a entrada custa US$ 0,29. Janela de contexto de 262 mil tokens, raciocínio habilitado, pesos abertos.

Preço de saída (US$ por milhão de tokens)
Qwen3.5-122B-A10B2,4MiMo-V2-Flash0,3Qwen3.5 397B A17B3,5Claude Haiku 4.55o38US$/M
Fonte: OpenRouter

Onde ele se encaixa no catálogo

O índice de inteligência geral é 32,8, abaixo do irmão maior 397B (34,3) e do MiMo-V2-Flash da Xiaomi (34,0), mas acima do Claude Haiku 4.5 (29,9) e do o3 da OpenAI (31,1). Em coding, porém, o 122B marca 45,7 — pontuação que coloca o modelo acima do próprio Haiku 4.5 (43,9) e perto do 397B (48,2). Em tarefas agentic, 21,3 contra 19,8 do irmão maior.

Índice de inteligência (Artificial Analysis)
Qwen3.5-122B-A10B32,8MiMo-V2-Flash34Qwen3.5 397B A17B34,3Claude Haiku 4.529,9o331,1índice
Fonte: Artificial Analysis

A leitura prática: para fluxos que dependem mais de gerar código correto do que de raciocínio encadeado longo, o 122B entrega mais do que o IQ geral sugere. Para fluxos agentic longos e cheios de ferramenta, o 397B ainda é a melhor escolha dentro da casa.

Para quem vale

Se você roda um backend que consome muito token de saída — geração de código, refactor, testes, documentação técnica — e quer manter a fatura baixa, o Qwen3.5-122B-A10B entra na conta. Sai por US$ 2,40 o milhão de tokens de saída, contra US$ 5,00 do Haiku 4.5 e US$ 8,00 do o3. É quase metade do Haiku e um terço do o3.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen3.5-122B-A10B (o novo)32.80.292.4262k
MiMo-V2-Flash34.00.10.3262k
Qwen3.5 397B A17B34.30.553.5262k
Claude Haiku 4.529.915200k
o331.128200k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Como os pesos são abertos, dá para hospedar em GPU própria e zerar a conta de API quando o volume justificar. A Qwen não publicou preço de cache de leitura neste modelo, então quem depende de cache agressivo precisa testar antes — não dá para cravar economia sem medir.

Para quem não muda nada

Se o seu gargalo é raciocínio pesado, o Gemini 3.1 Pro Preview (IQ 47,7) e o GPT-5.3-Codex (IQ 45,5) seguem em outro andar. Custam mais — US$ 12 e US$ 14 por milhão de saída — mas a diferença de capacidade não se resolve com prompt engineering.

Inteligência × preço de saída
Qwen3.5-122B-A10BMiMo-V2-FlashQwen3.5 397B A17BClaude Haiku 4.5o3US$ por milhão (saída, escala log)índice de inteligência

Se você já roda o MiMo-V2-Flash da Xiaomi, vale comparar antes de trocar: o MiMo é mais barato (US$ 0,30 de saída) e tem IQ geral um pouco maior (34,0 contra 32,8), embora não tenha os números de coding e agentic publicados. Para workloads multimodais nativos com vídeo, o 122B é o mais barato da família Qwen3.5 com essa capacidade — o MiMo é só texto.

O tabuleiro em 27 de fevereiro

O catálogo soma mais de 350 modelos de 52 criadores, com 25 lançamentos nos últimos 30 dias. Os dois únicos acima de IQ 45 são Gemini 3.1 Pro Preview e GPT-5.3-Codex, e ambos custam US$ 12 ou mais por milhão de saída. A faixa intermediária — IQ entre 30 e 35 — é onde a briga está: Qwen, Xiaomi e Anthropic disputam cada centavo por milhão de tokens.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 350 modelos disponíveis no catálogo nesta data.
Ficha técnica — Qwen3.5-122B-A10B
CampoValor
Identificadorqwen/qwen3.5-122b-a10b
Criadorqwen
Preço de entradaUS$ 0.290 / M tokens
Preço de saídaUS$ 2.40 / M tokens
Janela de contexto262k
Modalidadetext+image+video->text
Índice de inteligência (AA)32.8
Índice de código45.7
Índice agêntico21.3
Parâmetros125B (10B ativos por token)
Pesosabertos
Velocidade de saída131 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O que fazer com isso

Se a sua fila de tarefas é majoritariamente geração de código ou texto técnico em volume, teste o Qwen3.5-122B-A10B contra o Haiku 4.5 que você usa hoje. A diferença de preço é grande o suficiente para mudar a fatura mensal mesmo em rotinas mistas. Se o seu caso é multimodal com vídeo ou raciocínio agentic longo, continue no 397B ou suba para a faixa acima de IQ 45 — o 122B não foi feito para isso.

Em uma frase

Troque o Haiku 4.5 pelo Qwen3.5-122B-A10B em fluxos de geração de código e texto técnico em volume para cortar quase metade da fatura de API, mas mantenha o 397B ou um modelo de IQ acima de 45 quando raciocínio agentic longo entra em jogo.

Perguntas frequentes

Qwen3.5-122B-A10B é mais barato que o Claude Haiku 4.5?

Sim. Custa US$ 2,40 por milhão de tokens de saída contra US$ 5,00 do Haiku 4.5 — quase metade. Na entrada, a diferença é menor: US$ 0,29 contra US$ 1,00.

Quais são os parâmetros ativos do Qwen3.5-122B-A10B?

São 10 bilhões de parâmetros ativos por inferência, de um total de 125 bilhões. A arquitetura híbrida combina atenção linear com mixture-of-experts esparso para reduzir custo sem perder capacidade multimodal.

O Qwen3.5-122B-A10B serve para tarefas agentic?

Serve para agentic curto. O índice agentic é 21,3, acima do irmão maior 397B (19,8) e bem acima do Haiku 4.5 (16,5). Para agentic longo com muitas chamadas de ferramenta, o 397B ou modelos acima de IQ 45 ainda rendem mais.

Leia também