Qwen3.5-35B-A3B: 3 bilhões ativos cobrando US$ 1,25 por milhão de saída
Modelo chinês de pesos abertos chega três dias depois do irmão maior e mira o mesmo nicho barato — mas com multimodalidade nativa e contexto de 256K.
O que está em jogo aqui
Você está olhando para um modelo de 36 bilhões de parâmetros totais que só ativa 3 por vez — e custa US$ 1,25 por milhão de tokens de saída. Em 28 de fevereiro de 2026, a conta de API do Qwen3.5-35B-A3B sai mais barata que a do irmão especializado em código, o Qwen3 Coder Next (US$ 0,80), só que cobra pela multimodalidade nativa e por um índice de coding de 36,98, contra 36,23 do coder. Três dias após o lançamento, a pergunta não é se ele é bom: é onde ele encaixa sem brigar com o que já está na pilha.
O que o modelo é, de verdade
Pensa em um escritório com 36 funcionários onde só três resolvem cada tarefa de cada vez. É a cara de um Mixture-of-Experts (MoE) sparse: a maior parte do peso fica guardada, e o custo de inferência cai porque pouca coisa roda por token. O Qwen3.5-35B-A3B é nativo de visão e linguagem, aceita texto, imagem e vídeo como entrada e devolve só texto — algo que o gpt-oss-120b, da OpenAI, não faz. O contexto vai a 262.144 tokens, o dobro do gpt-oss-120b.
| Campo | Valor |
|---|---|
| Identificador | qwen/qwen3.5-35b-a3b |
| Criador | qwen |
| Preço de entrada | US$ 0.250 / M tokens |
| Preço de saída | US$ 1.25 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text+image+video->text |
| Leitura de cache | US$ 0.250 / M (0% de desconto) |
| Índice de inteligência (AA) | 24.3 |
| Índice de código | 37.0 |
| Índice agêntico | 11.8 |
| Parâmetros | 36B (3B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 168 tokens/s |
O índice de inteligência geral fica em 24,32 — basicamente colado no gpt-oss-120b (24,13). Em coding, porém, ele abre 6,5 pontos: 36,98 contra 30,44. Em agentic, perde: 11,82 contra 13,43. É um modelo que escreve código melhor do que opera agente, e isso define o terreno.
O preço contado sem propaganda
O catálogo mostra US$ 0,25 por milhão de entrada e US$ 1,25 por milhão de saída. Para efeito de comparação direta, o gpt-oss-120b cobra US$ 0,037 de entrada e US$ 0,17 de saída — é mais barato em quase uma ordem de grandeza. O Devstral 2, da Mistral, cobra US$ 2,00 de saída. Então o Qwen3.5-35B-A3B não é o mais barato da categoria; é o mais barato multimodal da categoria.
O cache de leitura está em US$ 0,25 por milhão, igual ao preço de entrada — não há desconto agressivo de cache como o Qwen3 Coder Next pratica (US$ 0,07). Quem repete muito o mesmo prompt grande vai sentir isso na fatura.
Onde ele ganha, onde ele perde
Contra o gpt-oss-120b, o chinês vence em três coisas que importam em produto: multimodalidade nativa, contexto de 256K (vs. 128K) e coding. Perde em agentic, em preço de saída e em preço de entrada. O Devstral 2 fica atrás em coding (31,26) e custa 60% mais por token de saída. O Nova 2 Lite, da Amazon, é mais barato de entrada (US$ 0,30) e mais caro de saída (US$ 2,50), e não tem pesos abertos.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Qwen3.5-35B-A3B (o novo) | 24.3 | 0.25 | 1.25 | 262k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Qwen3 Coder Next | 21.3 | 0.12 | 0.8 | 262k |
| Devstral 2 2512 | 19.2 | 0.4 | 2 | 262k |
| Nova 2 Lite | 19.2 | 0.3 | 2.5 | 1M |
A leitura fria: este é um modelo para quem precisa ver documentos, prints ou frames e quer manter o orçamento sob controle, sem abrir mão de pesos abertos para rodar local ou auditar. Não é para quem está montando agente de longo prazo — o índice agentic de 11,82 e a velocidade de 167,5 tokens/s não compensam a desvantagem contra o gpt-oss-120b nesse eixo.
O tabuleiro em 28 de fevereiro
O topo do mercado segue distante: Gemini 3.1 Pro Preview lidera com IQ 47,74 cobrando US$ 12/M de saída, seguido do GPT-5.3-Codex (45,51 a US$ 14) e do Claude Sonnet 4.6 (35,11 a US$ 15). O Qwen3.5-35B-A3B não está nesse jogo — está três andares abaixo em inteligência geral. O que ele está disputando é a faixa dos US$ 1 a US$ 2 de saída, onde hoje aparecem o Qwen3 Coder Next, o Devstral 2 e o Nova 2 Lite.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
Dos 350 modelos listados hoje no catálogo, 24 foram lançados nos últimos 30 dias. O Qwen entrou com dois deles em fevereiro — o Coder Next e este. A estratégia é clara: fatiar a família por caso de uso, não por tamanho.
Para quem vale — e para quem não
Vale para você se: precisa entender imagem ou vídeo como entrada, quer pesos abertos para inspecionar ou hospedar, e o gargalo da sua aplicação é geração de texto a partir de conteúdo visual. Pensa em análise de screenshots, extração de dados de PDFs escaneados, sumarização de vídeos curtos.
Não muda nada se: você já roda o gpt-oss-120b por API e não precisa de visão, ou se o seu fluxo é agentic puro — nesse caso o gpt-oss-120b entrega mais por menos. Também não vale se você repete prompts enormes: o cache sem desconto vai comer a economia.
A implicação prática: se multimodalidade nativa com pesos abertos estava faltando na sua pilha abaixo de US$ 2/M de saída, este modelo resolve. Se não estava, segue com o que já paga menos.
Use o Qwen3.5-35B-A3B quando multimodalidade nativa e pesos abertos importam mais que preço de saída mínimo; ignore quando o fluxo é agentic puro ou cache-heavy.
Perguntas frequentes
O Qwen3.5-35B-A3B é melhor que o gpt-oss-120b?
Depende do eixo. Em coding e multimodalidade, sim — 36,98 de coding contra 30,44, e aceita imagem e vídeo. Em agentic e preço por token, perde: 11,82 contra 13,43 de agentic, e custa quase 8x mais por milhão de saída.
Quanto custa rodar 1 milhão de tokens de saída no Qwen3.5-35B-A3B?
US$ 1,25 por milhão de tokens de saída, com entrada a US$ 0,25 e cache de leitura também a US$ 0,25 — sem desconto de cache como o Qwen3 Coder Next pratica.
Posso rodar o Qwen3.5-35B-A3B localmente?
Sim, os pesos são abertos e o modelo tem 36B de parâmetros totais com apenas 3B ativos por inferência, o que reduz memória e custo de hospedagem em comparação com um modelo denso do mesmo tamanho.