FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen 3.5 35B-A3B cobra 7 vezes mais que o gpt-oss-120b com o mesmo QI

Os dois são modelos abertos que empatam no índice de inteligência mas têm contas 7 vezes diferentes na saída. Modalidade, janela de contexto e modo de raciocínio decidem quando vale pagar mais.

Redação FalaVIP IA 2 min de leitura
US$ 0,17por milhão de tokens de saída do gpt-oss-120b
US$ 1,25por milhão de tokens de saída do Qwen 3.5 35B-A3B
262.144tokens de contexto máximo do Qwen, o dobro do gpt-oss-120b

US$ 0,17 ou US$ 1,25 por milhão de tokens de saída. Os dois preços são de modelos abertos com QI quase idêntico, na casa de 24. O que justifica essa diferença — e quando ela vale a pena — está nos recursos que não aparecem no índice de inteligência.

A conta de saída

Os preços vêm do catálogo desta data, 26 de março de 2026. O modelo da OpenAI, lançado em agosto de 2025, é o mais barato dos dois por uma margem grande: US$ 0,037 por milhão de tokens de entrada contra US$ 0,25 do Qwen. Na saída, US$ 0,17 contra US$ 1,25.

Preço de saída (US$ por milhão de tokens)
Qwen3.5-35B-A3B1,25gpt-oss-120b0,17US$/M
Fonte: OpenRouter

Se você roda 10 milhões de tokens de saída por dia, a fatura mensal do gpt-oss-120b fica em torno de US$ 51. A do Qwen passa dos US$ 375. Mesmo com janela maior e multimodalidade, é difícil defender um múltiplo de 7x só pela capacidade bruta.

QI empatado, músculos diferentes

O índice de inteligência medido hoje marca 24,322 para o Qwen 3.5 35B-A3B e 24,126 para o gpt-oss-120b. Diferença de 0,2 ponto. Os dois estão bem abaixo do topo do mercado, onde Gemini 3.1 Pro Preview atinge 47,738 e GPT-5.3-Codex 45,512 — quase o dobro.

Índice de inteligência (Artificial Analysis)
Qwen3.5-35B-A3B24,3gpt-oss-120b24,1índice
Fonte: Artificial Analysis

Onde eles se separam de verdade:

  • Codificação: Qwen 36,977, OpenAI 30,441. Diferença real de 6,5 pontos.
  • Tarefas agentic: gpt-oss-120b leva com 13,425 contra 11,823 do Qwen. Vantagem pequena, mas existe.
  • Raciocínio: só o gpt-oss-120b está marcado como modelo de raciocínio.

Os dois são MoE esparsos. O Qwen ativa 3B dos 36B totais. O gpt-oss ativa 5,1B dos 117B. Em eficiência por token ativo, o Qwen parece mais barato de rodar — mas o preço final da API não reflete isso.

Qwen3.5-35B-A3B × gpt-oss-120b
CritérioQwen3.5-35B-A3Bgpt-oss-120b
Índice de inteligência24.324.1
Entrada US$/M0.250.037
Saída US$/M1.250.17
Contexto262k131k
Pesos abertossimsim
Velocidade (tok/s)168155
Índice de código37.030.4
Índice agêntico11.813.4

Onde o Qwen cobra caro e vale

Dois recursos justificam o premium para workloads específicos:

  1. Contexto de 262.144 tokens, o dobro dos 131.072 do gpt-oss-120b. Para quem joga código longo, documentos jurídicos inteiros ou transcrições longas numa única chamada, o limite extra abre casos que o concorrente não cobre.
  2. Multimodalidade real: Qwen é text+image+video → text. O modelo da OpenAI é text → text. Se o pipeline inclui screenshots, fotos de produto ou frames de vídeo, o gpt-oss-120b nem entra na conversa.

O país de origem pesa para alguns compradores. O Qwen vem da China, com corte de conhecimento não publicado. O gpt-oss-120b é americano, com corte em junho de 2024.

Quando cada um ganha

Escolha gpt-oss-120b quando o trabalho é só texto, a fatura é apertada, e você quer o modo de raciocínio ligado para encadear ferramentas. Para agentes que disparam chamadas em loop, classificação em massa, extração estruturada onde cada centavo conta, é a escolha racional.

Escolha Qwen 3.5 35B-A3B quando você precisa de janela de 262k, entrada visual ou de vídeo, e a fatura aguenta o múltiplo. Em revisão de código com repositórios inteiros no prompt, ou em pipelines que recebem PDFs com diagramas, o custo extra vira investimento.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 374 modelos disponíveis no catálogo nesta data.

Para quem precisa do topo absoluto da categoria, nenhum dos dois serve. Eles ocupam a faixa barata do mercado aberto, com QI na casa dos 24 — úteis para volume, distantes do que Gemini 3.1 Pro Preview entrega. A escolha entre eles não é sobre inteligência. É sobre modalidade, contexto e quanto sobra no orçamento.

Em uma frase

Se o pipeline cabe em texto puro e 131k tokens, vá de gpt-oss-120b e gaste 7 vezes menos. Se precisa de multimodalidade ou de uma janela de 262k, o Qwen 3.5 35B-A3B justifica o preço — e se a tarefa exigir o topo da categoria, nenhum dos dois serve.

Perguntas frequentes

Qual dos dois tem melhor custo-benefício em produção?

O gpt-oss-120b. Sai cerca de 7 vezes mais barato na saída e tem QI equivalente ao do Qwen. Só compensa trocar pelo Qwen quando a tarefa exige multimodalidade ou contexto acima de 131 mil tokens.

Por que o Qwen cobra tão mais caro sendo open weights?

O preço de API não reflete só o custo de inferência. O Qwen entrega 262k de contexto, entrada de imagem e vídeo, e o catálogo não publicou preço de cache para ele. O gpt-oss-120b é text-only, com 131k de contexto e também sem cache divulgado.

Algum dos dois substitui o Gemini 3.1 Pro Preview?

Não. Os dois têm QI próximo de 24, contra 47,738 do Gemini 3.1 Pro Preview. Para raciocínio pesado ou tarefas de alta complexidade, o topo do mercado continua em outra faixa de preço e capacidade.

Leia também