Codex da OpenAI custa quase 4× o Qwen3.6 27B por token de saída
Comparativo frente a frente entre o modelo agêntico da OpenAI e o 27B denso da Alibaba que entende vídeo.
O que a conta mostra antes do código rodar
Você está prestes a pagar US$ 14 por milhão de tokens de saída no GPT-5.3-Codex, ou US$ 3,60 no Qwen3.6 27B. A diferença é quase 4× — e isso é só a linha de saída do boleto. Antes de escolher pelo nome ou pelo hype, vale olhar para o que cada um realmente entrega em troca desse dinheiro.
Inteligência não é tudo, mas é onde a conversa começa
O índice de inteligência Artificial Analysis coloca o Codex em 45,5 e o Qwen3.6 27B em 37,7. São quase 8 pontos de distância, o que não é pouco. Mas o catálogo desta data traz mais de 441 modelos, e o topo absoluto é o Gemini 3.1 Pro Preview, com 47,7 — então o Codex não é nem o mais inteligente da prateleira, só está entre os três primeiros.
O Qwen, por outro lado, vem de outro extremo do catálogo: é um modelo denso de 27,8 bilhões de parâmetros, com pesos abertos, da equipe Qwen dentro da Alibaba. Quando você roda um 27B denso, cada token passa pela mesma quantidade de computação — diferente dos modelos mixture-of-experts que ativam só parte dos parâmetros por inferência. É a diferença entre um Fusca bem tuneado e um motor V12 com metade dos cilindros desligados em cada viagem.
O preço traduzido: o que cada dólar compra
Vamos abrir a conta:
- Entrada: Codex cobra US$ 1,75 por milhão de tokens; Qwen cobra US$ 0,60. Quase 3× de diferença.
- Saída: US$ 14 contra US$ 3,60. Quase 4×.
- Cache: US$ 0,175 contra US$ 0,12. Aqui a diferença cai para ~46%.
O cache é onde o Qwen menos economiza proporcionalmente. Se a sua aplicação relê muito contexto — RAG, chat com histórico longo, agent loops —, essa linha pesa mais do que parece. Já para workloads de geração pura, a saída é onde a diferença de 4× sangra no fim do mês.
Onde cada um foi feito para brilhar
O Codex foi desenhado como modelo agêntico de engenharia de software: raciocínio alongado, planejamento de múltiplos passos, uso de ferramentas. A velocidade reportada é 118 tokens por segundo, mais que o dobro do Qwen. Em tarefas que exigem cadeia longa de raciocínio e iteração sobre código, esse fôlego compensa.
O Qwen3.6 27B traz um trunfo que o Codex não traz: aceita vídeo como entrada. É multimodal de texto, imagem e vídeo → texto. Se o seu pipeline precisa assistir a um clipe, transcrever uma reunião ou analisar frames, o Codex simplesmente não entra nessa fila — a modalidade dele é texto+imagem+arquivo.
| Critério | GPT-5.3-Codex | Qwen3.6 27B |
|---|---|---|
| Índice de inteligência | 45.5 | 37.7 |
| Entrada US$/M | 1.75 | 0.6 |
| Saída US$/M | 14 | 3.6 |
| Contexto | 400k | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 118 | 50 |
| Índice de código | — | 53.7 |
| Índice agêntico | — | 27.5 |
A janela de contexto também conta uma história: 400 mil tokens no Codex contra 262 mil no Qwen. Em workloads de codebase gigante ou documentos únicos enormes, o Codex aguenta mais sem precisar de chunking.
Quando cada um ganha
Codex ganha quando: você está construindo um agente de software que precisa planejar, raciocinar em cadeia longa e iterar sobre código complexo. A velocidade de 118 t/s e a janela de 400k tokens fazem diferença em agent loops que martelam o contexto até achar a resposta.
Qwen3.6 27B ganha quando: você precisa de multimodal com vídeo, quer rodar localmente (pesos abertos, 27B denso cabe em uma GPU de 48GB com quantização), ou está operando em escala onde cada centavo por token de saída multiplica por milhões. O Coding Index do Qwen (53,7) é superior ao do Codex em algumas métricas específicas — então para tarefas de código mais curtas e bem definidas, o chinês pode entregar resultado equivalente por uma fração do custo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
| MiMo-V2.5-Pro | 42.9 | 0.87 |
| MiMo-V2.5 | 38.0 | 0.28 |
Implicação para quem paga a conta
Se a sua fatura de API passa de quatro dígitos todo mês e você está usando Codex para tudo, faça o teste: rode o mesmo workload no Qwen3.6 27B e meça qualidade percebida, não só benchmark. Para 80% das tarefas que não exigem raciocínio agêntico profundo, a economia de 4× no token de saída pode valer a troca — ou pelo menos a segregação: Codex para o que é difícil, Qwen para o que é volume.
Codex para agentes de software longos e complexos; Qwen3.6 27B para volume, multimodal com vídeo e quem quer rodar local com pesos abertos — e vale testar a mistura dos dois antes de renovar o contrato.
Perguntas frequentes
GPT-5.3-Codex ou Qwen3.6 27B: qual é mais barato?
O Qwen3.6 27B é mais barato em todas as linhas: US$ 0,60/M de entrada contra US$ 1,75/M do Codex, e US$ 3,60/M de saída contra US$ 14/M. A diferença na saída é de quase 4×.
O Qwen3.6 27B aceita vídeo mesmo?
Sim. A modalidade declarada é text+image+video→text. O GPT-5.3-Codex trabalha com text+image+file→text, ou seja, não entra vídeo no pipeline.
Posso rodar o Qwen3.6 27B localmente?
Sim. São 27,8 bilhões de parâmetros densos, com pesos abertos. Com quantização adequada, cabe em GPUs de consumo topo de linha; em precisão plena, exige hardware de datacenter.