FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

o3 custa 6 vezes mais que o Qwen3.5-35B e entrega 28% mais IQ

Comparativo frente a frente entre o modelo de raciocínio da OpenAI e o MoE chinês de 35B, com a conta de quem paga a API no fim.

Redação FalaVIP IA 3 min de leitura
US$ 8 vs US$ 1,25preço por milhão de tokens de saída
31,096 vs 24,322índice de inteligência (Artificial Analysis)
3B ativos de 36B totaisparâmetros do Qwen3.5-35B-A3B

A conta que ninguém faz no tweet de lançamento

Você já deve ter visto o Qwen3.5-35B-A3B aparecer em alguma thread com o selo de "barato e bom". E o o3 da OpenAI continua sendo o velho conhecido de quem precisa de raciocínio sério. O problema é que, lado a lado, esses dois modelos quase não disputam a mesma categoria — e é exatamente isso que torna a comparação útil. Um cobra US$ 8 por milhão de tokens de saída. O outro, US$ 1,25. A diferença é de 6,4 vezes no bolso, e o índice de inteligência diz que o mais caro marca 31,096 contra 24,322 do Qwen. Em outras palavras: cada ponto de IQ a mais no o3 custa caro. Cabe a você decidir se vale o que a OpenAI cobra.

Índice de inteligência (Artificial Analysis)
o331,1Qwen3.5-35B-A3B24,3índice
Fonte: Artificial Analysis

O que cada um traz de diferente

O o3 é um modelo de raciocínio da OpenAI, lançado em abril de 2025, fechado (sem pesos abertos), treinado até junho de 2024, com contexto de 200 mil tokens. Aceita texto, imagem e arquivo, devolve só texto. É o perfil clássico de quem precisa de matemática, ciência, código e escrita técnica com cadeia de pensamento por trás.

O Qwen3.5-35B-A3B é outra filosofia. Lançado em 25 de fevereiro de 2026, é um modelo de visão-linguagem nativo, com arquitetura híbrida que mistura atenção linear e um MoE esparso: 36 bilhões de parâmetros totais, mas só 3 bilhões ativos por inferência. É chinês, open weights, e ainda aceita vídeo na entrada — coisa que o o3 não faz. Não é modelo de raciocínio declarado.

Preço de saída (US$ por milhão de tokens)
o38Qwen3.5-35B-A3B1,25US$/M
Fonte: OpenRouter

A conta, de verdade

Vamos ao que interessa para quem paga API. O preço de entrada do o3 é US$ 2 por milhão de tokens, o de saída US$ 8, com cache a US$ 0,50. O blended (média ponderada entre entrada e saída típica) fica em US$ 3,50 por milhão. Já o Qwen3.5-35B-A3B cobra US$ 0,25 de entrada, US$ 1,25 de saída e US$ 0,25 de cache — blended de US$ 0,6875 por milhão. Em volume alto, a diferença entre US$ 3,50 e US$ 0,6875 é o que decide o orçamento do mês.

o3 × Qwen3.5-35B-A3B
Critérioo3Qwen3.5-35B-A3B
Índice de inteligência31.124.3
Entrada US$/M20.25
Saída US$/M81.25
Contexto200k262k
Pesos abertosnãosim
Velocidade (tok/s)109168
Índice de código37.0
Índice agêntico11.8

Velocidade e contexto

O Qwen é mais rápido: 167,5 tokens por segundo contra 108,93 do o3. O contexto também é maior, 262.144 tokens contra 200.000. Em tarefas longas — resumir um livro, analisar um dump de logs, processar um vídeo — o Qwen simplesmente cabe mais. Mas velocidade bruta não é tudo: o o3 foi desenhado para gastar mais tempo pensando antes de responder, e isso aparece no índice de raciocínio.

Onde cada um ganha

O o3 ganha quando o problema exige cadeia de pensamento. Raciocínio multi-etapa, matemática, código complexo, escrita técnica com instruções precisas. É o caso clássico de "poucos tokens de entrada, muita exigência de qualidade na saída". Para um agente que precisa planejar antes de agir, o o3 justifica os US$ 8 por milhão.

O Qwen3.5-35B-A3B ganha quando o gargalo é volume. Processar milhares de documentos, multimodal com vídeo, workloads que aceitam uma queda de 22% no IQ em troca de 6,4 vezes mais barato por token. Como tem pesos abertos, ainda dá para hospedar e eliminar o custo variável por completo — aí a comparação de preço deixa de fazer sentido e vira comparação de infraestrutura.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 362 modelos disponíveis no catálogo nesta data.

O tabuleiro em março de 2026

Para situar os dois: o topo do índice de inteligência hoje é o Gemini 3.1 Pro Preview, com 47,738, seguido do GPT-5.3-Codex, com 45,512. O o3, com 31,096, está bem abaixo desses dois — e o Qwen3.5-35B-A3B, com 24,322, está ainda mais abaixo. Os dois modelos analisados aqui não estão brigando pela liderança; estão brigando pelo melhor custo-benefício dentro de faixas de IQ diferentes. O catálogo tem 362 modelos listados, 53 criadores, e 31 lançamentos nos últimos 30 dias — o Qwen é um deles.

Se você precisa de raciocínio sério e o orçamento aguenta, o o3 ainda entrega mais qualidade por token. Se o orçamento é o teto, o Qwen3.5-35B-A3B é o que sobra — e ainda traz vídeo, open weights e velocidade.

Em uma frase

Use o o3 quando o problema exige raciocínio multi-etapa e a fatura aguenta; use o Qwen3.5-35B-A3B quando o volume de tokens é o gargalo ou quando você quer tirar a OpenAI do meio hospedando o modelo.

Perguntas frequentes

o3 ou Qwen3.5-35B-A3B: qual é mais barato por milhão de tokens?

O Qwen3.5-35B-A3B é mais barato em todas as métricas: US$ 0,25 de entrada, US$ 1,25 de saída e US$ 0,25 de cache por milhão de tokens, contra US$ 2, US$ 8 e US$ 0,50 do o3. O preço blended do Qwen é US$ 0,6875 por milhão, contra US$ 3,50 do o3.

Qual dos dois tem índice de inteligência maior?

O o3, com 31,096 contra 24,322 do Qwen3.5-35B-A3B segundo a medição atual da Artificial Analysis. A diferença é de cerca de 28% a favor do o3.

O Qwen3.5-35B-A3B é open weights?

Sim. O Qwen3.5-35B-A3B tem pesos abertos e arquitetura mixture-of-experts com 36 bilhões de parâmetros totais e 3 bilhões ativos por inferência. O o3 é modelo fechado, sem pesos públicos.

Leia também