FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Tencent entra no jogo dos MoE com Hy3 a US$ 0,33 por milhão de saída

Modelo de 295B parâmetros com 21B ativos mira reasoning e agentes por uma fração do preço dos rivais americanos

Redação FalaVIP IA 3 min de leitura
US$ 0,33por milhão de tokens de saída
295B parâmetrostotais, com 21B ativos
42,2índice de inteligência do Hy3

O que a Tencent jogou na mesa

A conta de API começa a pesar quando o modelo "barato" cobra US$ 50 por milhão de tokens de saída. Foi exatamente esse o número que a Anthropic cravou no topo do índice de inteligência hoje — Claude Fable 5, IQ 62,073, a US$ 50/M de saída. A Tencent entra agora nesse mesmo mercado com o Hy3, um modelo de 295 bilhões de parâmetros totais mas só 21 bilhões ativos por inferência, vendido a US$ 0,33 por milhão de tokens de saída. É 150 vezes mais barato que o Fable 5 na conta do output. A diferença não está no anúncio: está no fechamento do mês.

Preço de saída (US$ por milhão de tokens)
Hy30,528Claude Fable 550Claude Sonnet 510GLM 5.23,036MiniMax M31,2DeepSeek V4 Pro 04232,0845US$/M
Fonte: OpenRouter

O que é MoE e por que isso importa na fatura

Mixture-of-Experts é a ideia de manter um modelo enorme guardado no servidor, mas só ligar parte dele quando você faz uma pergunta. Pense num restaurante com cardápio de 192 pratos, mas o chef só prepara oito por pedido. Você paga pelo cozinheiro que efetivamente trabalha, não pela cozinha inteira. O Hy3 declara 192 especialistas e top-8 routing — ou seja, oito especialistas por token gerado. O resultado prático: 295B no papel, 21B no consumo. É por isso que a Tencent consegue cobrar US$ 0,0825 por milhão de tokens de entrada e US$ 0,33 por milhão de saída, com cache de US$ 0,0206.

Ficha técnica — Hy3
CampoValor
Identificadortencent/hy3
Criadortencent
Preço de entradaUS$ 0.132 / M tokens
Preço de saídaUS$ 0.528 / M tokens
Janela de contexto262k
Modalidadetext->text
Leitura de cacheUS$ 0.033 / M (75% de desconto)
Índice de inteligência (AA)42.2
Índice de código58.8
Índice agêntico31.4
Parâmetros299B (21B ativos por token)
Pesosabertos
Velocidade de saída92 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

Onde o Hy3 ganha e onde perde

O índice de inteligência do Hy3 ficou em 42,213 — abaixo do corte de 45 que separa os modelos "úteis" dos "experimentais" no catálogo. Em coding, ele sobe para 58,803; em agentic, despenca para 31,417. Isso diz uma coisa direta: o modelo escreve código razoável, mas não é o que você quer para um agente rodando 200 passos sozinho. A velocidade declarada é 92,1 tokens por segundo, saudável para a categoria.

Índice de inteligência (Artificial Analysis)
Hy342,2Claude Fable 562,1Claude Sonnet 555,3GLM 5.252,6MiniMax M345,4DeepSeek V4 Pro 042345,3índice
Fonte: Artificial Analysis

Na prateleira chinesa, o Hy3 fica atrás do GLM 5.2 da Z.ai (IQ 52,641, US$ 3,036/M de saída). Na ponta americana, perde feio para o Sonnet 5 (IQ 55,261) e para o Fable 5. Mas olha o gráfico de custo-benefício e a conversa muda.

Inteligência × preço de saída
Hy3Claude Fable 5Claude Sonnet 5GLM 5.2MiniMax M3DeepSeek V4 Pro 0423US$ por milhão (saída, escala log)índice de inteligência

A linha completa que a Tencent soltou hoje

A Tencent não lançou só um modelo: soltou o Hy3 pago e a versão free do mesmo modelo, com 262k de contexto. É a mesma estratégia de sempre — um chamariz gratuito para puxar tráfego e um produto pago para converter. O catálogo soma 484 modelos listados hoje, vindos de 62 criadores, e 25 foram lançados nos últimos 30 dias.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Hy3 (free)00262k

Para quem vale e para quem não muda nada

Vale para você se está montando pipeline de geração de código, transformação de texto em massa, ou um agente simples onde o orçamento pesa mais que a taxa de sucesso. A US$ 0,33 por milhão de saída, dá para rodar volumes que seriam impensáveis no Fable 5. Não vale se você precisa de raciocínio agente de verdade — o agentic de 31,417 está abaixo do que você quer delegar sem supervisão. Também não muda nada para quem já está no Sonnet 5 ou no GLM 5.2 e está satisfeito com o índice de inteligência que tem.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Hy3 (o novo)42.20.1320.528262k
Claude Fable 562.110501M
Claude Sonnet 555.32101M
GLM 5.252.60.9663.0361.05M
MiniMax M345.40.31.21.05M
DeepSeek V4 Pro 042345.31.04232.08451.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Para referência, o cenário completo de topo hoje:

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
Claude Sonnet 555.310
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
Entre os 484 modelos disponíveis no catálogo nesta data.

O que você faz amanhã

Se você paga API e ainda não testou modelo chinês open weights, o Hy3 é mais um motivo para rodar um benchmark interno seu — não o do fornecedor. Pegue uma amostra de 100 chamadas reais, meça custo e taxa de retrabalho, e compare com o que está rodando. Se o retrabalho for menor que 30% acima do seu modelo atual, a economia de 100x no output paga o experimento em uma semana.

Em uma frase

Rode um benchmark interno seu com o Hy3 em tarefas de coding e transformação de texto: a economia de até 150x no output pode compensar um índice de inteligência menor se o retrabalho ficar sob controle.

Perguntas frequentes

Quanto custa o Tencent Hy3 por milhão de tokens?

Cobra US$ 0,0825 por milhão de tokens de entrada e US$ 0,33 por milhão de tokens de saída, com cache a US$ 0,0206 por milhão. É cerca de 150 vezes mais barato que o Claude Fable 5 no output.

O Hy3 é melhor que o Claude Sonnet 5?

Não. O índice de inteligência do Hy3 ficou em 42,213, contra 55,261 do Sonnet 5. O Hy3 vence em preço; o Sonnet 5 vence em capacidade bruta, especialmente em agentic.

O que significa MoE no caso do Hy3?

Mixture-of-Experts com 295 bilhões de parâmetros totais e 21 bilhões ativos por inferência, usando 192 especialistas com roteamento top-8. Na prática, é um modelo grande que só aciona parte de si mesmo a cada chamada, o que explica o preço baixo.

Leia também