FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3.5-35B-A3B: 3 bilhões ativos cobrando US$ 1,25 por milhão de saída

Modelo chinês de pesos abertos chega três dias depois do irmão maior e mira o mesmo nicho barato — mas com multimodalidade nativa e contexto de 256K.

Redação FalaVIP IA 4 min de leitura
US$ 1,25por milhão de tokens de saída
3 bilhõesparâmetros ativos de 36B totais
36,98índice de coding (Artificial Analysis)

O que está em jogo aqui

Você está olhando para um modelo de 36 bilhões de parâmetros totais que só ativa 3 por vez — e custa US$ 1,25 por milhão de tokens de saída. Em 28 de fevereiro de 2026, a conta de API do Qwen3.5-35B-A3B sai mais barata que a do irmão especializado em código, o Qwen3 Coder Next (US$ 0,80), só que cobra pela multimodalidade nativa e por um índice de coding de 36,98, contra 36,23 do coder. Três dias após o lançamento, a pergunta não é se ele é bom: é onde ele encaixa sem brigar com o que já está na pilha.

O que o modelo é, de verdade

Pensa em um escritório com 36 funcionários onde só três resolvem cada tarefa de cada vez. É a cara de um Mixture-of-Experts (MoE) sparse: a maior parte do peso fica guardada, e o custo de inferência cai porque pouca coisa roda por token. O Qwen3.5-35B-A3B é nativo de visão e linguagem, aceita texto, imagem e vídeo como entrada e devolve só texto — algo que o gpt-oss-120b, da OpenAI, não faz. O contexto vai a 262.144 tokens, o dobro do gpt-oss-120b.

Ficha técnica — Qwen3.5-35B-A3B
CampoValor
Identificadorqwen/qwen3.5-35b-a3b
Criadorqwen
Preço de entradaUS$ 0.250 / M tokens
Preço de saídaUS$ 1.25 / M tokens
Janela de contexto262k
Modalidadetext+image+video->text
Leitura de cacheUS$ 0.250 / M (0% de desconto)
Índice de inteligência (AA)24.3
Índice de código37.0
Índice agêntico11.8
Parâmetros36B (3B ativos por token)
Pesosabertos
Velocidade de saída168 tokens/s

O índice de inteligência geral fica em 24,32 — basicamente colado no gpt-oss-120b (24,13). Em coding, porém, ele abre 6,5 pontos: 36,98 contra 30,44. Em agentic, perde: 11,82 contra 13,43. É um modelo que escreve código melhor do que opera agente, e isso define o terreno.

O preço contado sem propaganda

O catálogo mostra US$ 0,25 por milhão de entrada e US$ 1,25 por milhão de saída. Para efeito de comparação direta, o gpt-oss-120b cobra US$ 0,037 de entrada e US$ 0,17 de saída — é mais barato em quase uma ordem de grandeza. O Devstral 2, da Mistral, cobra US$ 2,00 de saída. Então o Qwen3.5-35B-A3B não é o mais barato da categoria; é o mais barato multimodal da categoria.

Preço de saída (US$ por milhão de tokens)
Qwen3.5-35B-A3B1,25gpt-oss-120b0,17Qwen3 Coder Next0,8Devstral 2 25122Nova 2 Lite2,5US$/M
Fonte: OpenRouter

O cache de leitura está em US$ 0,25 por milhão, igual ao preço de entrada — não há desconto agressivo de cache como o Qwen3 Coder Next pratica (US$ 0,07). Quem repete muito o mesmo prompt grande vai sentir isso na fatura.

Onde ele ganha, onde ele perde

Inteligência × preço de saída
Qwen3.5-35B-A3Bgpt-oss-120bQwen3 Coder NextDevstral 2 2512Nova 2 LiteUS$ por milhão (saída, escala log)índice de inteligência

Contra o gpt-oss-120b, o chinês vence em três coisas que importam em produto: multimodalidade nativa, contexto de 256K (vs. 128K) e coding. Perde em agentic, em preço de saída e em preço de entrada. O Devstral 2 fica atrás em coding (31,26) e custa 60% mais por token de saída. O Nova 2 Lite, da Amazon, é mais barato de entrada (US$ 0,30) e mais caro de saída (US$ 2,50), e não tem pesos abertos.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Qwen3.5-35B-A3B (o novo)24.30.251.25262k
gpt-oss-120b24.10.0370.17131k
Qwen3 Coder Next21.30.120.8262k
Devstral 2 251219.20.42262k
Nova 2 Lite19.20.32.51M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

A leitura fria: este é um modelo para quem precisa ver documentos, prints ou frames e quer manter o orçamento sob controle, sem abrir mão de pesos abertos para rodar local ou auditar. Não é para quem está montando agente de longo prazo — o índice agentic de 11,82 e a velocidade de 167,5 tokens/s não compensam a desvantagem contra o gpt-oss-120b nesse eixo.

O tabuleiro em 28 de fevereiro

Índice de inteligência (Artificial Analysis)
Qwen3.5-35B-A3B24,3gpt-oss-120b24,1Qwen3 Coder Next21,3Devstral 2 251219,2Nova 2 Lite19,2índice
Fonte: Artificial Analysis

O topo do mercado segue distante: Gemini 3.1 Pro Preview lidera com IQ 47,74 cobrando US$ 12/M de saída, seguido do GPT-5.3-Codex (45,51 a US$ 14) e do Claude Sonnet 4.6 (35,11 a US$ 15). O Qwen3.5-35B-A3B não está nesse jogo — está três andares abaixo em inteligência geral. O que ele está disputando é a faixa dos US$ 1 a US$ 2 de saída, onde hoje aparecem o Qwen3 Coder Next, o Devstral 2 e o Nova 2 Lite.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 350 modelos disponíveis no catálogo nesta data.

Dos 350 modelos listados hoje no catálogo, 24 foram lançados nos últimos 30 dias. O Qwen entrou com dois deles em fevereiro — o Coder Next e este. A estratégia é clara: fatiar a família por caso de uso, não por tamanho.

Para quem vale — e para quem não

Vale para você se: precisa entender imagem ou vídeo como entrada, quer pesos abertos para inspecionar ou hospedar, e o gargalo da sua aplicação é geração de texto a partir de conteúdo visual. Pensa em análise de screenshots, extração de dados de PDFs escaneados, sumarização de vídeos curtos.

Não muda nada se: você já roda o gpt-oss-120b por API e não precisa de visão, ou se o seu fluxo é agentic puro — nesse caso o gpt-oss-120b entrega mais por menos. Também não vale se você repete prompts enormes: o cache sem desconto vai comer a economia.

A implicação prática: se multimodalidade nativa com pesos abertos estava faltando na sua pilha abaixo de US$ 2/M de saída, este modelo resolve. Se não estava, segue com o que já paga menos.

Em uma frase

Use o Qwen3.5-35B-A3B quando multimodalidade nativa e pesos abertos importam mais que preço de saída mínimo; ignore quando o fluxo é agentic puro ou cache-heavy.

Perguntas frequentes

O Qwen3.5-35B-A3B é melhor que o gpt-oss-120b?

Depende do eixo. Em coding e multimodalidade, sim — 36,98 de coding contra 30,44, e aceita imagem e vídeo. Em agentic e preço por token, perde: 11,82 contra 13,43 de agentic, e custa quase 8x mais por milhão de saída.

Quanto custa rodar 1 milhão de tokens de saída no Qwen3.5-35B-A3B?

US$ 1,25 por milhão de tokens de saída, com entrada a US$ 0,25 e cache de leitura também a US$ 0,25 — sem desconto de cache como o Qwen3 Coder Next pratica.

Posso rodar o Qwen3.5-35B-A3B localmente?

Sim, os pesos são abertos e o modelo tem 36B de parâmetros totais com apenas 3B ativos por inferência, o que reduz memória e custo de hospedagem em comparação com um modelo denso do mesmo tamanho.

Leia também