FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3.5 397B custa um terço do o3 e empata em raciocínio

Modelo chinês de 17B ativos chega ao catálogo com preço de commodity e benchmark de peso pesado — o que muda na sua fila de produção.

Redação FalaVIP IA 3 min de leitura
US$ 2,34por milhão de tokens de saída no Qwen3.5 397B
US$ 8,00por milhão de tokens de saída no o3
34,26índice de inteligência do Qwen3.5 vs 31,10 do o3

O número que ninguém pôs no slide

O3 saiu em abril de 2025 cobrando US$ 8 por milhão de tokens de saída. Um ano depois, em fevereiro de 2026, a Qwen lança um modelo de raciocínio com 397 bilhões de parâmetros totais (sendo 17B ativos por inferência) cobrando US$ 2,34 pelo mesmo milhão de tokens. Você não leu errado: é quase 70% mais barato. E, no índice de inteligência da Artificial Analysis medido hoje, o Qwen3.5 397B marca 34,26 contra 31,10 do o3.

Preço de saída (US$ por milhão de tokens)
Qwen3.5 397B A17B3,5o38US$/M
Fonte: OpenRouter

Essa é a diferença entre o que o anúncio promete e o que a fatura mostra. O resto do texto é o que sobra.

O que cada um faz bem — e onde tropeça

O o3 ainda lidera em alguns terrenos que o catálogo não publica em número: tarefas visuais, escrita técnica e seguir instruções complexas. É o modelo "bem arredondado" que a própria OpenAI descreve. Mas o catálogo desta data não traz nota de coding nem agentic para ele — só blended de 3,5 e velocidade de 108,93 tokens por segundo.

O Qwen3.5 397B, por outro lado, vem com ficha cheia: coding 48,21, agentic 19,84, velocidade de 87,91 t/s. Em coding, especificamente, a nota é quase o dobro do índice geral — sinal claro de onde o modelo foi otimizado. A modalidade é mais ampla também: aceita vídeo como entrada, coisa que o o3 não faz.

Qwen3.5 397B A17B × o3
CritérioQwen3.5 397B A17Bo3
Índice de inteligência34.331.1
Entrada US$/M0.552
Saída US$/M3.58
Contexto262k200k
Pesos abertossimnão
Velocidade (tok/s)88109
Índice de código48.2
Índice agêntico19.8

A velocidade menor do Qwen importa? Para um agente que faz 200 chamadas por hora, 20% a menos de t/s significa orçamento maior de tempo de parede. Para um job batch noturno, é irrelevante.

Onde o Qwen ganha e onde não muda nada

O Qwen ganha onde o gargalo é custo por token em workload de raciocínio pesado: pipelines de código, agentes que precisam chamar o modelo dezenas de vezes por sessão, qualquer coisa que hoje infla a fatura do o3. O modelo é de pesos abertos — você pode self-host se a conta da API passar de um certo volume, o que derruba o custo marginal a quase zero.

O o3 ainda ganha em três cenários práticos. Primeiro, quando você precisa de conhecimento atualizado até junho de 2024 (o cutoff declarado dele) e não pode treinar embeddings próprios — o Qwen não publica cutoff, então você está no escuro. Segundo, em workloads multimodais com arquivos e imagens onde a OpenAI tem track record mais longo. Terceiro, quando o sistema do cliente já tem integração com a API da OpenAI e migrar significa refazer prompts e guardrails.

Índice de inteligência (Artificial Analysis)
Qwen3.5 397B A17B34,3o331,1índice
Fonte: Artificial Analysis

E tem um detalhe que o marketing da Qwen não vai gritar: o índice de "omniscience" do Qwen3.5 é -30,75, contra -15,55 do o3. Quanto mais negativo, mais o modelo alucina事实 que não existem. Em produção, isso significa revisão humana obrigatória para qualquer saída que vá direto para o cliente.

O tabuleiro em 23 de fevereiro de 2026

O catálogo tem 341 modelos listados, 52 criadores, 19 lançamentos nos últimos 30 dias. O topo de inteligência hoje é o Gemini 3.1 Pro Preview, com 47,74 — único acima de 45, único com preço publicado nessa faixa. O Qwen3.5 397B entra em terceiro lugar geral, atrás do Claude Sonnet 4.6 (35,11) e à frente do o3.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
o331.18
Entre os 341 modelos disponíveis no catálogo nesta data.

Ou seja: não estamos falando de um modelo chinês obscuro disputando a ponta com um azarão. Estamos falando de um modelo que, na semana em que foi listado, já sentou na mesa dos três maiores do índice.

O que você faz com isso amanhã

Se sua fatura da OpenAI tem linha "o3" aparecendo todo mês, rode um piloto de duas semanas com o Qwen3.5 397B no mesmo workload. Meça custo por tarefa concluída, não só por token — porque o índice de alucinação mais alto pode dobrar o número de retries. Se o número fechar, você migra. Se não fechar, você tem um teto de negociação com a OpenAI que não tinha antes.

Em uma frase

Troque o o3 pelo Qwen3.5 397B em workloads de código e agentes onde custo domina, e mantenha o o3 quando multimodal maduro e menor taxa de alucinação são inegociáveis.

Perguntas frequentes

O Qwen3.5 397B é realmente mais barato que o o3?

Sim. O preço de saída é US$ 2,34 por milhão de tokens contra US$ 8 do o3 — quase 70% mais barato. No preço de entrada a diferença é menor: US$ 0,39 contra US$ 2,00 por milhão.

Posso rodar o Qwen3.5 397B localmente?

Sim, ele é de pesos abertos. São 397 bilhões de parâmetros totais com 17B ativos por inferência, então dá para servir em hardware de consumo com quantização agressiva, embora o ideal seja GPU de datacenter.

O Qwen3.5 397B substitui o o3 em qualquer tarefa?

Não. Em multimodal com arquivos e em tarefas que exigem menos alucinação factual, o o3 ainda leva vantagem. O Qwen ganha em coding, custo e em workloads agentic com muitas chamadas.

Leia também