GLM 5.3 custa quase metade do GPT-5.6 Sol e brilha em coding
Modelo chinês da Z.ai traz 1,3 milhão de tokens de contexto, 753B de parâmetros com pesos abertos e nota 74,8 em coding. O IQ 59,5 não ameaça os topos — mas o preço mexe.
A Z.ai não entrou no catálogo de 550 modelos brigando pelo topo do índice de inteligência. Nem pelo fundo do preço. O GLM 5.3, listado hoje, mira o meio: cobra US$ 4,40 por milhão de tokens de saída — menos da metade do que o GPT-5.6 Sol pede (US$ 10) — e aposta que a nota 74,8 em coding compensa o IQ 59,5 que não ameaça a liderança do Claude Opus 5.
Em 30 dias, 41 modelos novos entraram no catálogo. O GLM 5.3 não é mais um na pilha — combina três coisas raras: 1,3 milhão de tokens de contexto, pesos abertos e 753 bilhões de parâmetros totais com apenas 40 bilhões ativos, via arquitetura MoE em que só uma fração dos parâmetros é escalada por token, mantendo o custo de inferência viável mesmo em escala de fronteira.
O que ele faz de melhor
A descrição do catálogo destaca duas frentes: engenharia de software complexa e tarefas agentic de longo horizonte. Os números confirmam: 74,8 em coding, 59,1 em agentic, 62,8 tokens por segundo de velocidade. É um modelo de raciocínio — gasta tokens pensando antes de responder, então o custo efetivo por chamada pode ser maior que o preço de tabela. O cache sai por US$ 0,26 por milhão de tokens, útil se você faz chamadas repetidas com o mesmo contexto, como RAG ou análise de codebase em loop.
| Campo | Valor |
|---|---|
| Identificador | z-ai/glm-5.3 |
| Criador | z-ai |
| Preço de entrada | US$ 1.40 / M tokens |
| Preço de saída | US$ 4.40 / M tokens |
| Janela de contexto | 1.31M |
| Modalidade | text->text |
| Leitura de cache | US$ 0.260 / M (81% de desconto) |
| Índice de inteligência (AA) | 59.5 |
| Índice de código | 74.8 |
| Índice agêntico | 59.1 |
| Parâmetros | 753B (40B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 63 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
Como ele se compara com o que já estava disponível
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| GLM 5.3 (o novo) | 59.5 | 1.4 | 4.4 | 1.31M |
| Claude Opus 5 | 63.1 | 5 | 25 | 1M |
| Claude Fable 5 | 62.1 | 10 | 50 | 1M |
| GPT-5.6 Sol | 60.9 | 2 | 10 | 1.05M |
| DeepSeek V4 Flash 0731 | 51.8 | 0.065 | 0.18 | 1.31M |
| MiniMax M3 | 45.4 | 0.3 | 1.2 | 1.05M |
A leitura é simples. O Claude Opus 5 entrega IQ 63,1 por US$ 25 por milhão de tokens de saída. O GPT-5.6 Sol entrega IQ 60,9 por US$ 10. O GLM 5.3 entrega IQ 59,5 por US$ 4,40. O preço blended — entrada e saída combinados na proporção típica — fica em US$ 2,15 por milhão, abaixo do Sol e muito abaixo do Opus 5. Cada degrau de IQ custa caro no topo do mercado, e o GLM 5.3 aproveita exatamente essa curva para entregar um IQ alto a um preço que ainda não existia nesta faixa.
Para quem vale
- Times de engenharia com agente de código em produção. A nota 74,8 em coding é o argumento principal. Se a fatura pesa, trocar GPT-5.6 Sol por GLM 5.3 no fluxo de geração de código pode quase cortar o custo pela metade sem perda visível de qualidade.
- Quem quer self-host. Pesos abertos + 753B totais / 40B ativos dá para rodar em cluster multi-GPU, e o custo por token em volume fica abaixo de qualquer modelo fechado.
- Times que precisam de contexto longo. Janela de 1,3 milhão de tokens é rara. Análise de codebase inteiro, documentação técnica ou logs históricos cabe sem cortar.
Para quem não muda nada
- Se o gargalo é preço puro. O DeepSeek V4 Flash 0731 custa US$ 0,18 por milhão de tokens de saída. Para uso geral — resumo, classificação, extração, chatbot — pagar 24 vezes mais no GLM 5.3 só se justifica se o ganho nos 7,7 pontos de IQ virar resultado mensurável.
- Se você já tem contrato agressivo com Anthropic ou OpenAI. A conta tem que comparar o preço que você paga de fato, não o de prateleira.
- Se você precisa do teto absoluto de raciocínio, sem foco em código. Opus 5, Fable 5 e GPT-5.6 Sol seguem à frente em IQ. Para tarefas que exigem o melhor genérico, a economia do GLM 5.3 não compensa.
O que fazer com isso
Se código é o centro do seu produto, vale rodar um A/B esta semana: mesmo prompt, mesmo fluxo, comparar taxa de aceitação entre GLM 5.3 e o que você usa hoje. A diferença de margem potencial é grande — desde que a qualidade do código gerado não regrida. Se o caso de uso é chatbot, sumarização ou tarefas onde o DeepSeek V4 Flash já resolve, continue lá: trocar por GLM 5.3 é pagar caro à toa.
Em um mercado que ganha 41 modelos por mês, o GLM 5.3 não tenta ser o melhor. Tenta ser a melhor compra em coding com pesos abertos. Nesse recorte, hoje, ele está.
Rode um A/B esta semana entre GLM 5.3 e o modelo atual no fluxo de geração de código: a economia de quase 56% sobre o GPT-5.6 Sol só vale se a taxa de aceitação do código não cair.
Perguntas frequentes
Quanto custa o GLM 5.3 por milhão de tokens?
US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de tokens de saída. O cache de prompt sai por US$ 0,26 por milhão, útil para chamadas repetidas com o mesmo contexto, como RAG ou análise de codebase em loop.
GLM 5.3 é open source?
Não exatamente. A Z.ai publicou os pesos abertos (open weights): 753 bilhões de parâmetros totais, com 40 bilhões ativos por inferência via arquitetura MoE. Dá para baixar e rodar self-hosted em cluster multi-GPU, mas o código de treino não foi liberado.
GLM 5.3 é melhor que o Claude Opus 5?
Em IQ geral, não: o GLM 5.3 marca 59,5 contra 63,1 do Opus 5. A vantagem do GLM 5.3 é o preço — US$ 4,40 por milhão de tokens de saída contra US$ 25 do Opus 5, quase seis vezes mais barato.