Qwen 3.5 35B-A3B cobra 7 vezes mais que o gpt-oss-120b com o mesmo QI
Os dois são modelos abertos que empatam no índice de inteligência mas têm contas 7 vezes diferentes na saída. Modalidade, janela de contexto e modo de raciocínio decidem quando vale pagar mais.
US$ 0,17 ou US$ 1,25 por milhão de tokens de saída. Os dois preços são de modelos abertos com QI quase idêntico, na casa de 24. O que justifica essa diferença — e quando ela vale a pena — está nos recursos que não aparecem no índice de inteligência.
A conta de saída
Os preços vêm do catálogo desta data, 26 de março de 2026. O modelo da OpenAI, lançado em agosto de 2025, é o mais barato dos dois por uma margem grande: US$ 0,037 por milhão de tokens de entrada contra US$ 0,25 do Qwen. Na saída, US$ 0,17 contra US$ 1,25.
Se você roda 10 milhões de tokens de saída por dia, a fatura mensal do gpt-oss-120b fica em torno de US$ 51. A do Qwen passa dos US$ 375. Mesmo com janela maior e multimodalidade, é difícil defender um múltiplo de 7x só pela capacidade bruta.
QI empatado, músculos diferentes
O índice de inteligência medido hoje marca 24,322 para o Qwen 3.5 35B-A3B e 24,126 para o gpt-oss-120b. Diferença de 0,2 ponto. Os dois estão bem abaixo do topo do mercado, onde Gemini 3.1 Pro Preview atinge 47,738 e GPT-5.3-Codex 45,512 — quase o dobro.
Onde eles se separam de verdade:
- Codificação: Qwen 36,977, OpenAI 30,441. Diferença real de 6,5 pontos.
- Tarefas agentic: gpt-oss-120b leva com 13,425 contra 11,823 do Qwen. Vantagem pequena, mas existe.
- Raciocínio: só o gpt-oss-120b está marcado como modelo de raciocínio.
Os dois são MoE esparsos. O Qwen ativa 3B dos 36B totais. O gpt-oss ativa 5,1B dos 117B. Em eficiência por token ativo, o Qwen parece mais barato de rodar — mas o preço final da API não reflete isso.
| Critério | Qwen3.5-35B-A3B | gpt-oss-120b |
|---|---|---|
| Índice de inteligência | 24.3 | 24.1 |
| Entrada US$/M | 0.25 | 0.037 |
| Saída US$/M | 1.25 | 0.17 |
| Contexto | 262k | 131k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 168 | 155 |
| Índice de código | 37.0 | 30.4 |
| Índice agêntico | 11.8 | 13.4 |
Onde o Qwen cobra caro e vale
Dois recursos justificam o premium para workloads específicos:
- Contexto de 262.144 tokens, o dobro dos 131.072 do gpt-oss-120b. Para quem joga código longo, documentos jurídicos inteiros ou transcrições longas numa única chamada, o limite extra abre casos que o concorrente não cobre.
- Multimodalidade real: Qwen é text+image+video → text. O modelo da OpenAI é text → text. Se o pipeline inclui screenshots, fotos de produto ou frames de vídeo, o gpt-oss-120b nem entra na conversa.
O país de origem pesa para alguns compradores. O Qwen vem da China, com corte de conhecimento não publicado. O gpt-oss-120b é americano, com corte em junho de 2024.
Quando cada um ganha
Escolha gpt-oss-120b quando o trabalho é só texto, a fatura é apertada, e você quer o modo de raciocínio ligado para encadear ferramentas. Para agentes que disparam chamadas em loop, classificação em massa, extração estruturada onde cada centavo conta, é a escolha racional.
Escolha Qwen 3.5 35B-A3B quando você precisa de janela de 262k, entrada visual ou de vídeo, e a fatura aguenta o múltiplo. Em revisão de código com repositórios inteiros no prompt, ou em pipelines que recebem PDFs com diagramas, o custo extra vira investimento.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Para quem precisa do topo absoluto da categoria, nenhum dos dois serve. Eles ocupam a faixa barata do mercado aberto, com QI na casa dos 24 — úteis para volume, distantes do que Gemini 3.1 Pro Preview entrega. A escolha entre eles não é sobre inteligência. É sobre modalidade, contexto e quanto sobra no orçamento.
Se o pipeline cabe em texto puro e 131k tokens, vá de gpt-oss-120b e gaste 7 vezes menos. Se precisa de multimodalidade ou de uma janela de 262k, o Qwen 3.5 35B-A3B justifica o preço — e se a tarefa exigir o topo da categoria, nenhum dos dois serve.
Perguntas frequentes
Qual dos dois tem melhor custo-benefício em produção?
O gpt-oss-120b. Sai cerca de 7 vezes mais barato na saída e tem QI equivalente ao do Qwen. Só compensa trocar pelo Qwen quando a tarefa exige multimodalidade ou contexto acima de 131 mil tokens.
Por que o Qwen cobra tão mais caro sendo open weights?
O preço de API não reflete só o custo de inferência. O Qwen entrega 262k de contexto, entrada de imagem e vídeo, e o catálogo não publicou preço de cache para ele. O gpt-oss-120b é text-only, com 131k de contexto e também sem cache divulgado.
Algum dos dois substitui o Gemini 3.1 Pro Preview?
Não. Os dois têm QI próximo de 24, contra 47,738 do Gemini 3.1 Pro Preview. Para raciocínio pesado ou tarefas de alta complexidade, o topo do mercado continua em outra faixa de preço e capacidade.