o3 custa 6 vezes mais que o Qwen3.5-35B e entrega 28% mais IQ
Comparativo frente a frente entre o modelo de raciocínio da OpenAI e o MoE chinês de 35B, com a conta de quem paga a API no fim.
A conta que ninguém faz no tweet de lançamento
Você já deve ter visto o Qwen3.5-35B-A3B aparecer em alguma thread com o selo de "barato e bom". E o o3 da OpenAI continua sendo o velho conhecido de quem precisa de raciocínio sério. O problema é que, lado a lado, esses dois modelos quase não disputam a mesma categoria — e é exatamente isso que torna a comparação útil. Um cobra US$ 8 por milhão de tokens de saída. O outro, US$ 1,25. A diferença é de 6,4 vezes no bolso, e o índice de inteligência diz que o mais caro marca 31,096 contra 24,322 do Qwen. Em outras palavras: cada ponto de IQ a mais no o3 custa caro. Cabe a você decidir se vale o que a OpenAI cobra.
O que cada um traz de diferente
O o3 é um modelo de raciocínio da OpenAI, lançado em abril de 2025, fechado (sem pesos abertos), treinado até junho de 2024, com contexto de 200 mil tokens. Aceita texto, imagem e arquivo, devolve só texto. É o perfil clássico de quem precisa de matemática, ciência, código e escrita técnica com cadeia de pensamento por trás.
O Qwen3.5-35B-A3B é outra filosofia. Lançado em 25 de fevereiro de 2026, é um modelo de visão-linguagem nativo, com arquitetura híbrida que mistura atenção linear e um MoE esparso: 36 bilhões de parâmetros totais, mas só 3 bilhões ativos por inferência. É chinês, open weights, e ainda aceita vídeo na entrada — coisa que o o3 não faz. Não é modelo de raciocínio declarado.
A conta, de verdade
Vamos ao que interessa para quem paga API. O preço de entrada do o3 é US$ 2 por milhão de tokens, o de saída US$ 8, com cache a US$ 0,50. O blended (média ponderada entre entrada e saída típica) fica em US$ 3,50 por milhão. Já o Qwen3.5-35B-A3B cobra US$ 0,25 de entrada, US$ 1,25 de saída e US$ 0,25 de cache — blended de US$ 0,6875 por milhão. Em volume alto, a diferença entre US$ 3,50 e US$ 0,6875 é o que decide o orçamento do mês.
| Critério | o3 | Qwen3.5-35B-A3B |
|---|---|---|
| Índice de inteligência | 31.1 | 24.3 |
| Entrada US$/M | 2 | 0.25 |
| Saída US$/M | 8 | 1.25 |
| Contexto | 200k | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 109 | 168 |
| Índice de código | — | 37.0 |
| Índice agêntico | — | 11.8 |
Velocidade e contexto
O Qwen é mais rápido: 167,5 tokens por segundo contra 108,93 do o3. O contexto também é maior, 262.144 tokens contra 200.000. Em tarefas longas — resumir um livro, analisar um dump de logs, processar um vídeo — o Qwen simplesmente cabe mais. Mas velocidade bruta não é tudo: o o3 foi desenhado para gastar mais tempo pensando antes de responder, e isso aparece no índice de raciocínio.
Onde cada um ganha
O o3 ganha quando o problema exige cadeia de pensamento. Raciocínio multi-etapa, matemática, código complexo, escrita técnica com instruções precisas. É o caso clássico de "poucos tokens de entrada, muita exigência de qualidade na saída". Para um agente que precisa planejar antes de agir, o o3 justifica os US$ 8 por milhão.
O Qwen3.5-35B-A3B ganha quando o gargalo é volume. Processar milhares de documentos, multimodal com vídeo, workloads que aceitam uma queda de 22% no IQ em troca de 6,4 vezes mais barato por token. Como tem pesos abertos, ainda dá para hospedar e eliminar o custo variável por completo — aí a comparação de preço deixa de fazer sentido e vira comparação de infraestrutura.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
O tabuleiro em março de 2026
Para situar os dois: o topo do índice de inteligência hoje é o Gemini 3.1 Pro Preview, com 47,738, seguido do GPT-5.3-Codex, com 45,512. O o3, com 31,096, está bem abaixo desses dois — e o Qwen3.5-35B-A3B, com 24,322, está ainda mais abaixo. Os dois modelos analisados aqui não estão brigando pela liderança; estão brigando pelo melhor custo-benefício dentro de faixas de IQ diferentes. O catálogo tem 362 modelos listados, 53 criadores, e 31 lançamentos nos últimos 30 dias — o Qwen é um deles.
Se você precisa de raciocínio sério e o orçamento aguenta, o o3 ainda entrega mais qualidade por token. Se o orçamento é o teto, o Qwen3.5-35B-A3B é o que sobra — e ainda traz vídeo, open weights e velocidade.
Use o o3 quando o problema exige raciocínio multi-etapa e a fatura aguenta; use o Qwen3.5-35B-A3B quando o volume de tokens é o gargalo ou quando você quer tirar a OpenAI do meio hospedando o modelo.
Perguntas frequentes
o3 ou Qwen3.5-35B-A3B: qual é mais barato por milhão de tokens?
O Qwen3.5-35B-A3B é mais barato em todas as métricas: US$ 0,25 de entrada, US$ 1,25 de saída e US$ 0,25 de cache por milhão de tokens, contra US$ 2, US$ 8 e US$ 0,50 do o3. O preço blended do Qwen é US$ 0,6875 por milhão, contra US$ 3,50 do o3.
Qual dos dois tem índice de inteligência maior?
O o3, com 31,096 contra 24,322 do Qwen3.5-35B-A3B segundo a medição atual da Artificial Analysis. A diferença é de cerca de 28% a favor do o3.
O Qwen3.5-35B-A3B é open weights?
Sim. O Qwen3.5-35B-A3B tem pesos abertos e arquitetura mixture-of-experts com 36 bilhões de parâmetros totais e 3 bilhões ativos por inferência. O o3 é modelo fechado, sem pesos públicos.