Qwen3.5 397B custa um terço do o3 e empata em raciocínio
Modelo chinês de 17B ativos chega ao catálogo com preço de commodity e benchmark de peso pesado — o que muda na sua fila de produção.
O número que ninguém pôs no slide
O3 saiu em abril de 2025 cobrando US$ 8 por milhão de tokens de saída. Um ano depois, em fevereiro de 2026, a Qwen lança um modelo de raciocínio com 397 bilhões de parâmetros totais (sendo 17B ativos por inferência) cobrando US$ 2,34 pelo mesmo milhão de tokens. Você não leu errado: é quase 70% mais barato. E, no índice de inteligência da Artificial Analysis medido hoje, o Qwen3.5 397B marca 34,26 contra 31,10 do o3.
Essa é a diferença entre o que o anúncio promete e o que a fatura mostra. O resto do texto é o que sobra.
O que cada um faz bem — e onde tropeça
O o3 ainda lidera em alguns terrenos que o catálogo não publica em número: tarefas visuais, escrita técnica e seguir instruções complexas. É o modelo "bem arredondado" que a própria OpenAI descreve. Mas o catálogo desta data não traz nota de coding nem agentic para ele — só blended de 3,5 e velocidade de 108,93 tokens por segundo.
O Qwen3.5 397B, por outro lado, vem com ficha cheia: coding 48,21, agentic 19,84, velocidade de 87,91 t/s. Em coding, especificamente, a nota é quase o dobro do índice geral — sinal claro de onde o modelo foi otimizado. A modalidade é mais ampla também: aceita vídeo como entrada, coisa que o o3 não faz.
| Critério | Qwen3.5 397B A17B | o3 |
|---|---|---|
| Índice de inteligência | 34.3 | 31.1 |
| Entrada US$/M | 0.55 | 2 |
| Saída US$/M | 3.5 | 8 |
| Contexto | 262k | 200k |
| Pesos abertos | sim | não |
| Velocidade (tok/s) | 88 | 109 |
| Índice de código | 48.2 | — |
| Índice agêntico | 19.8 | — |
A velocidade menor do Qwen importa? Para um agente que faz 200 chamadas por hora, 20% a menos de t/s significa orçamento maior de tempo de parede. Para um job batch noturno, é irrelevante.
Onde o Qwen ganha e onde não muda nada
O Qwen ganha onde o gargalo é custo por token em workload de raciocínio pesado: pipelines de código, agentes que precisam chamar o modelo dezenas de vezes por sessão, qualquer coisa que hoje infla a fatura do o3. O modelo é de pesos abertos — você pode self-host se a conta da API passar de um certo volume, o que derruba o custo marginal a quase zero.
O o3 ainda ganha em três cenários práticos. Primeiro, quando você precisa de conhecimento atualizado até junho de 2024 (o cutoff declarado dele) e não pode treinar embeddings próprios — o Qwen não publica cutoff, então você está no escuro. Segundo, em workloads multimodais com arquivos e imagens onde a OpenAI tem track record mais longo. Terceiro, quando o sistema do cliente já tem integração com a API da OpenAI e migrar significa refazer prompts e guardrails.
E tem um detalhe que o marketing da Qwen não vai gritar: o índice de "omniscience" do Qwen3.5 é -30,75, contra -15,55 do o3. Quanto mais negativo, mais o modelo alucina事实 que não existem. Em produção, isso significa revisão humana obrigatória para qualquer saída que vá direto para o cliente.
O tabuleiro em 23 de fevereiro de 2026
O catálogo tem 341 modelos listados, 52 criadores, 19 lançamentos nos últimos 30 dias. O topo de inteligência hoje é o Gemini 3.1 Pro Preview, com 47,74 — único acima de 45, único com preço publicado nessa faixa. O Qwen3.5 397B entra em terceiro lugar geral, atrás do Claude Sonnet 4.6 (35,11) e à frente do o3.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
Ou seja: não estamos falando de um modelo chinês obscuro disputando a ponta com um azarão. Estamos falando de um modelo que, na semana em que foi listado, já sentou na mesa dos três maiores do índice.
O que você faz com isso amanhã
Se sua fatura da OpenAI tem linha "o3" aparecendo todo mês, rode um piloto de duas semanas com o Qwen3.5 397B no mesmo workload. Meça custo por tarefa concluída, não só por token — porque o índice de alucinação mais alto pode dobrar o número de retries. Se o número fechar, você migra. Se não fechar, você tem um teto de negociação com a OpenAI que não tinha antes.
Troque o o3 pelo Qwen3.5 397B em workloads de código e agentes onde custo domina, e mantenha o o3 quando multimodal maduro e menor taxa de alucinação são inegociáveis.
Perguntas frequentes
O Qwen3.5 397B é realmente mais barato que o o3?
Sim. O preço de saída é US$ 2,34 por milhão de tokens contra US$ 8 do o3 — quase 70% mais barato. No preço de entrada a diferença é menor: US$ 0,39 contra US$ 2,00 por milhão.
Posso rodar o Qwen3.5 397B localmente?
Sim, ele é de pesos abertos. São 397 bilhões de parâmetros totais com 17B ativos por inferência, então dá para servir em hardware de consumo com quantização agressiva, embora o ideal seja GPU de datacenter.
O Qwen3.5 397B substitui o o3 em qualquer tarefa?
Não. Em multimodal com arquivos e em tarefas que exigem menos alucinação factual, o o3 ainda leva vantagem. O Qwen ganha em coding, custo e em workloads agentic com muitas chamadas.