FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Z.ai traz contexto de 1 milhão; Tencent cobra US$ 0,074

O GLM Latest mira cargas longas, enquanto o Hy-MT2-7B aposta no menor preço de entrada. Nenhum dos dois chega acompanhado de notas de inteligência, código ou uso agêntico.

Redação FalaVIP IA 4 min de leitura
1.048.576tokens de contexto do Z.ai GLM Latest
US$ 0,074por milhão de tokens de entrada do Tencent Hy-MT2-7B
US$ 4,40por milhão de tokens de saída do Z.ai GLM Latest

Se você paga por inferência, a diferença entre os dois lançamentos de hoje é mais importante que o nome dos modelos: o Z.ai GLM Latest chega com uma janela de contexto de 1.048.576 tokens, enquanto o Tencent Hy-MT2-7B cobra US$ 0,074 por milhão de tokens de entrada. Um foi desenhado para comportar grandes volumes de informação; o outro, para reduzir a conta de operações repetitivas.

Os dois modelos entraram no catálogo em 19 de agosto de 2026. Mas não são substitutos diretos. O GLM Latest custa US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de tokens de saída. O Hy-MT2-7B custa US$ 0,074 na entrada e US$ 0,295 na saída. Os preços e as janelas de contexto são os listados no OpenRouter.

O GLM Latest compra espaço, não uma nota de qualidade

A janela de 1.048.576 tokens coloca o GLM Latest na categoria de modelos para prompts extensos. Isso pode interessar a aplicações que precisam enviar documentos grandes, históricos longos de conversa, bases de código ou múltiplos arquivos em uma única chamada, sem dividir tudo em várias etapas.

Mas contexto não é sinônimo de inteligência. O catálogo não traz, para esse lançamento, notas de inteligência, código ou capacidade agêntica no Artificial Analysis. Também não há, nos dados disponíveis, informação sobre pesos abertos ou número de parâmetros. Portanto, não dá para afirmar que o GLM Latest supera modelos concorrentes em raciocínio, programação ou execução de tarefas.

O preço também muda a decisão. A entrada custa menos que a saída, mas não é a parte mais cara do modelo: cada milhão de tokens gerados custa US$ 4,40. Se a aplicação envia documentos grandes e produz respostas curtas, o GLM Latest pode fazer sentido. Se ela gera muito texto, a saída precisa entrar na simulação de custo antes da migração.

Tencent mira o custo de entrada

O Hy-MT2-7B oferece o movimento oposto. Sua janela é de 8.192 tokens, muito menor que a do GLM Latest. Em compensação, a entrada sai por US$ 0,074 por milhão de tokens e a saída por US$ 0,295.

Esse desenho favorece tarefas com prompts menores e alto volume: classificação, extração estruturada, roteamento, respostas curtas e etapas auxiliares de um fluxo. Para esse tipo de uso, o preço reduzido pode pesar mais que uma janela de contexto ampla.

Ainda assim, “altíssima eficiência” não deve ser lido como uma nota de desempenho. O Hy-MT2-7B também não tem índices de inteligência, código ou uso agêntico registrados no Artificial Analysis. O dado objetivo disponível é o preço, junto da janela de 8.192 tokens. A validação precisa vir de testes próprios com o tráfego real da aplicação.

O catálogo cresce, mas a fatura continua se mexendo

Os lançamentos chegam em um dia de forte mudança de preços. O catálogo passou a reunir 552 modelos de 69 criadores, enquanto 16 modelos tiveram alterações de preço na mesma data.

A direção não foi uniforme. O preço de saída do batch do MoonshotAI Kimi K2.7 Code dobrou de US$ 2 para US$ 4 por milhão de tokens. O GLM 5.2 em batch também passou de US$ 2,20 para US$ 4,40. MiniMax M3 em batch subiu de US$ 0,60 para US$ 1,20.

Houve cortes relevantes em outros modelos. O Qwen3.5-35B-A3B caiu de US$ 1,80 para US$ 1,25 por milhão de tokens de saída, enquanto o DeepSeek V3 0324 passou de US$ 1,12 para US$ 1. O próprio Kimi K2.6 aparece com registros de alta e de queda no mesmo dia, de US$ 2,36 para US$ 4 e de US$ 4 para US$ 2,36. Para quem escolhe modelo pelo preço, isso é um alerta: o valor precisa ser fixado por versão e rota, não apenas pelo nome.

Para quem cada lançamento vale

O GLM Latest vale a avaliação de quem enfrenta limites de contexto ou quer consolidar documentos e histórico em menos chamadas. Ele não muda muito para quem trabalha com prompts curtos, respostas enxutas e orçamento dominado pelo volume de saída.

O Hy-MT2-7B interessa a equipes que priorizam custo baixo na entrada e conseguem operar dentro de 8.192 tokens. Ele não resolve uma aplicação que precisa manter grandes documentos no prompt, mesmo que o preço por token seja atraente.

O Artificial Analysis registrou também a estreia do GLM-5.3 (max), com índice de inteligência de 59,5 e preço de US$ 2,15 por milhão de tokens. Esse registro é de benchmark e não deve ser confundido com uma avaliação do GLM Latest: são entradas diferentes, e o novo modelo não recebeu nota equivalente nos dados disponíveis.

A decisão prática é separar arquitetura de preço: use o GLM Latest quando a janela evitar fragmentação de contexto, e teste o Hy-MT2-7B quando a prioridade for processar muitas chamadas baratas — sempre medindo a saída, onde a diferença de custo também aparece.

Em uma frase

Escolha o GLM Latest para reduzir a fragmentação de contextos extensos e o Hy-MT2-7B para tarefas curtas de alto volume, mas valide o custo da saída antes de colocar qualquer um em produção.

Perguntas frequentes

Qual é o preço do Z.ai GLM Latest?

No OpenRouter, o Z.ai GLM Latest custa US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de tokens de saída. A janela de contexto é de 1.048.576 tokens.

O Tencent Hy-MT2-7B é mais barato que o GLM Latest?

Sim, nos preços de entrada e saída listados no OpenRouter: US$ 0,074 e US$ 0,295 por milhão de tokens, respectivamente. A contrapartida é uma janela de contexto de 8.192 tokens, muito menor que a do GLM Latest.

O GLM Latest já tem nota de inteligência ou código?

Não nos dados registrados pelo Artificial Analysis para esse lançamento. Não há nota de inteligência, código ou uso agêntico disponível para o GLM Latest.

Leia também