GPT-5.3-Codex custa 11 vezes mais que o Qwen3.7 Plus por token de saída
Codex cobra US$ 14 por milhão de tokens de saída; Qwen3.7 Plus cobra US$ 1,28. O que separa os dois vai além do índice de inteligência.
US$ 14 por milhão de tokens de saída. É isso que o GPT-5.3-Codex cobra hoje, 10 de junho de 2026. O Qwen3.7 Plus, da Alibaba, cobra US$ 1,28 pelo mesmo milhão. A pergunta não é qual é "melhor" — é qual trabalho paga a conta de qual modelo.
Inteligência: Codex lidera, mas por margem pequena
No índice da Artificial Analysis medido hoje, o GPT-5.3-Codex marca 45,5 contra 39,4 do Qwen3.7 Plus. A diferença é de 6,1 pontos, cerca de 15% acima. Em uma escala em que o líder do catálogo, o Claude Fable 5 da Anthropic, está em 62,1, nenhum dos dois está no topo: o Codex aparece em quarto lugar, atrás do Gemini 3.1 Pro Preview (47,7) e do Gemini 3.5 Flash (46,7). O Qwen está fora do top 5.
| Critério | GPT-5.3-Codex | Qwen3.7 Plus |
|---|---|---|
| Índice de inteligência | 45.5 | 39.4 |
| Entrada US$/M | 1.75 | 0.32 |
| Saída US$/M | 14 | 1.28 |
| Contexto | 400k | 1M |
| Pesos abertos | não | não |
| Velocidade (tok/s) | 118 | 57 |
| Índice de código | — | 55.9 |
| Índice agêntico | — | 20.7 |
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiniMax M3 | 45.4 | 1.2 |
Preço: 10,9 vezes mais caro por token de saída
A diferença de preço de saída é de 10,9 vezes. No preço blended, que mistura entrada, saída e cache em proporções típicas, o Codex sai a US$ 4,81 por milhão e o Qwen a US$ 0,70 — 6,9 vezes mais barato. O cache do Qwen também é mais em conta: US$ 0,064 contra US$ 0,175 do Codex. Quem roda volume sente isso no fim do mês, não na primeira requisição.
Velocidade, contexto e código: três trade-offs distintos
O Codex processa 118 tokens por segundo; o Qwen entrega 56. Em pipelines interativos isso muda a experiência do usuário; em batch noturno ninguém percebe. A janela de contexto inverte o jogo: o Qwen abre para 1 milhão de tokens, contra 400 mil do Codex. Quem enfia repositórios inteiros, livros ou bases longas no prompt leva vantagem clara no modelo chinês.
E aqui mora um detalhe sujo. O Qwen3.7 Plus tem nota específica de coding de 55,9 — acima da sua pontuação geral de 39,4. O Codex não tem nota de coding publicada no catálogo: o campo veio vazio. Dá para afirmar que o Codex lidera em raciocínio geral, mas não dá para cravar quem escreve código melhor só com estes números. A nota agentic do Qwen, 20,7, é modesta mas existe; a do Codex também não foi publicada.
Em que situação cada um ganha
Codex ganha quando você precisa de baixa latência em produto interativo, de raciocínio agentic em cadeias longas, ou de um modelo com "omniscience" dez vezes maior (10,9 contra 1,1 do Qwen) para responder sobre temas fora do óbvio. Pagar US$ 14 pelo milhão de saída compensa se cada requisição gera valor alto: agente que mexe em banco, geração de código crítico, análise jurídica ou financeira.
Qwen3.7 Plus ganha quando a variável é volume. Classificação de tickets, tradução em massa, geração de descrições de produto, resumos de documentos longos — qualquer fluxo em que a janela de 1M e o custo blended de US$ 0,70 pesem mais que os 6 pontos de IQ. Lançado em 3 de junho, há uma semana, entra no catálogo como a opção de baixo custo acima de IQ 35.
A regra prática: se a conta da API dói no fim do mês, comece pelo Qwen3.7 Plus. Promova para Codex só quando latência, raciocínio longo ou cobertura de conhecimento começarem a travar o produto.
Comece a integração no Qwen3.7 Plus e só promova para GPT-5.3-Codex quando latência, raciocínio longo ou cobertura de conhecimento amplia começarem a limitar o produto — não antes.
Perguntas frequentes
GPT-5.3-Codex ainda vale o preço em junho de 2026?
Vale para fluxos em que latência, raciocínio agentic longo e cobertura de conhecimento (omniscience 10,9 contra 1,1 do Qwen) geram mais valor do que custam. Para volume genérico, o Qwen3.7 Plus entrega 85% da inteligência por 1/10 do preço de saída.
Qwen3.7 Plus serve para programação?
Tem nota de coding de 55,9 no catálogo, acima da própria pontuação geral de 39,4. O GPT-5.3-Codex não publicou nota de coding no catálogo, então a comparação direta de código não é possível só com estes dados.
Qual dos dois tem contexto maior?
O Qwen3.7 Plus, com 1 milhão de tokens de contexto, contra 400 mil do GPT-5.3-Codex — 2,5 vezes mais. Para prompts que carregam repositórios ou documentos extensos, o Qwen leva vantagem clara.