FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Codex da OpenAI custa quase 4× o Qwen3.6 27B por token de saída

Comparativo frente a frente entre o modelo agêntico da OpenAI e o 27B denso da Alibaba que entende vídeo.

Redação FalaVIP IA 3 min de leitura
US$ 14preço de saída do GPT-5.3-Codex por milhão de tokens
US$ 3,60preço de saída do Qwen3.6 27B por milhão de tokens
45,5 × 37,7índice de inteligência (Codex × Qwen3.6 27B)

O que a conta mostra antes do código rodar

Você está prestes a pagar US$ 14 por milhão de tokens de saída no GPT-5.3-Codex, ou US$ 3,60 no Qwen3.6 27B. A diferença é quase 4× — e isso é só a linha de saída do boleto. Antes de escolher pelo nome ou pelo hype, vale olhar para o que cada um realmente entrega em troca desse dinheiro.

Inteligência não é tudo, mas é onde a conversa começa

O índice de inteligência Artificial Analysis coloca o Codex em 45,5 e o Qwen3.6 27B em 37,7. São quase 8 pontos de distância, o que não é pouco. Mas o catálogo desta data traz mais de 441 modelos, e o topo absoluto é o Gemini 3.1 Pro Preview, com 47,7 — então o Codex não é nem o mais inteligente da prateleira, só está entre os três primeiros.

Índice de inteligência (Artificial Analysis)
GPT-5.3-Codex45,5Qwen3.6 27B37,7índice
Fonte: Artificial Analysis

O Qwen, por outro lado, vem de outro extremo do catálogo: é um modelo denso de 27,8 bilhões de parâmetros, com pesos abertos, da equipe Qwen dentro da Alibaba. Quando você roda um 27B denso, cada token passa pela mesma quantidade de computação — diferente dos modelos mixture-of-experts que ativam só parte dos parâmetros por inferência. É a diferença entre um Fusca bem tuneado e um motor V12 com metade dos cilindros desligados em cada viagem.

O preço traduzido: o que cada dólar compra

Vamos abrir a conta:

  • Entrada: Codex cobra US$ 1,75 por milhão de tokens; Qwen cobra US$ 0,60. Quase 3× de diferença.
  • Saída: US$ 14 contra US$ 3,60. Quase 4×.
  • Cache: US$ 0,175 contra US$ 0,12. Aqui a diferença cai para ~46%.
Preço de saída (US$ por milhão de tokens)
GPT-5.3-Codex14Qwen3.6 27B3,6US$/M
Fonte: OpenRouter

O cache é onde o Qwen menos economiza proporcionalmente. Se a sua aplicação relê muito contexto — RAG, chat com histórico longo, agent loops —, essa linha pesa mais do que parece. Já para workloads de geração pura, a saída é onde a diferença de 4× sangra no fim do mês.

Onde cada um foi feito para brilhar

O Codex foi desenhado como modelo agêntico de engenharia de software: raciocínio alongado, planejamento de múltiplos passos, uso de ferramentas. A velocidade reportada é 118 tokens por segundo, mais que o dobro do Qwen. Em tarefas que exigem cadeia longa de raciocínio e iteração sobre código, esse fôlego compensa.

O Qwen3.6 27B traz um trunfo que o Codex não traz: aceita vídeo como entrada. É multimodal de texto, imagem e vídeo → texto. Se o seu pipeline precisa assistir a um clipe, transcrever uma reunião ou analisar frames, o Codex simplesmente não entra nessa fila — a modalidade dele é texto+imagem+arquivo.

GPT-5.3-Codex × Qwen3.6 27B
CritérioGPT-5.3-CodexQwen3.6 27B
Índice de inteligência45.537.7
Entrada US$/M1.750.6
Saída US$/M143.6
Contexto400k262k
Pesos abertosnãosim
Velocidade (tok/s)11850
Índice de código53.7
Índice agêntico27.5

A janela de contexto também conta uma história: 400 mil tokens no Codex contra 262 mil no Qwen. Em workloads de codebase gigante ou documentos únicos enormes, o Codex aguenta mais sem precisar de chunking.

Quando cada um ganha

Codex ganha quando: você está construindo um agente de software que precisa planejar, raciocinar em cadeia longa e iterar sobre código complexo. A velocidade de 118 t/s e a janela de 400k tokens fazem diferença em agent loops que martelam o contexto até achar a resposta.

Qwen3.6 27B ganha quando: você precisa de multimodal com vídeo, quer rodar localmente (pesos abertos, 27B denso cabe em uma GPU de 48GB com quantização), ou está operando em escala onde cada centavo por token de saída multiplica por milhões. O Coding Index do Qwen (53,7) é superior ao do Codex em algumas métricas específicas — então para tarefas de código mais curtas e bem definidas, o chinês pode entregar resultado equivalente por uma fração do custo.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
DeepSeek V4 Pro 042345.32.0845
MiMo-V2.5-Pro42.90.87
MiMo-V2.538.00.28
Entre os 441 modelos disponíveis no catálogo nesta data.

Implicação para quem paga a conta

Se a sua fatura de API passa de quatro dígitos todo mês e você está usando Codex para tudo, faça o teste: rode o mesmo workload no Qwen3.6 27B e meça qualidade percebida, não só benchmark. Para 80% das tarefas que não exigem raciocínio agêntico profundo, a economia de 4× no token de saída pode valer a troca — ou pelo menos a segregação: Codex para o que é difícil, Qwen para o que é volume.

Em uma frase

Codex para agentes de software longos e complexos; Qwen3.6 27B para volume, multimodal com vídeo e quem quer rodar local com pesos abertos — e vale testar a mistura dos dois antes de renovar o contrato.

Perguntas frequentes

GPT-5.3-Codex ou Qwen3.6 27B: qual é mais barato?

O Qwen3.6 27B é mais barato em todas as linhas: US$ 0,60/M de entrada contra US$ 1,75/M do Codex, e US$ 3,60/M de saída contra US$ 14/M. A diferença na saída é de quase 4×.

O Qwen3.6 27B aceita vídeo mesmo?

Sim. A modalidade declarada é text+image+video→text. O GPT-5.3-Codex trabalha com text+image+file→text, ou seja, não entra vídeo no pipeline.

Posso rodar o Qwen3.6 27B localmente?

Sim. São 27,8 bilhões de parâmetros densos, com pesos abertos. Com quantização adequada, cabe em GPUs de consumo topo de linha; em precisão plena, exige hardware de datacenter.

Leia também