Tencent entra no jogo dos MoE com Hy3 a US$ 0,33 por milhão de saída
Modelo de 295B parâmetros com 21B ativos mira reasoning e agentes por uma fração do preço dos rivais americanos
O que a Tencent jogou na mesa
A conta de API começa a pesar quando o modelo "barato" cobra US$ 50 por milhão de tokens de saída. Foi exatamente esse o número que a Anthropic cravou no topo do índice de inteligência hoje — Claude Fable 5, IQ 62,073, a US$ 50/M de saída. A Tencent entra agora nesse mesmo mercado com o Hy3, um modelo de 295 bilhões de parâmetros totais mas só 21 bilhões ativos por inferência, vendido a US$ 0,33 por milhão de tokens de saída. É 150 vezes mais barato que o Fable 5 na conta do output. A diferença não está no anúncio: está no fechamento do mês.
O que é MoE e por que isso importa na fatura
Mixture-of-Experts é a ideia de manter um modelo enorme guardado no servidor, mas só ligar parte dele quando você faz uma pergunta. Pense num restaurante com cardápio de 192 pratos, mas o chef só prepara oito por pedido. Você paga pelo cozinheiro que efetivamente trabalha, não pela cozinha inteira. O Hy3 declara 192 especialistas e top-8 routing — ou seja, oito especialistas por token gerado. O resultado prático: 295B no papel, 21B no consumo. É por isso que a Tencent consegue cobrar US$ 0,0825 por milhão de tokens de entrada e US$ 0,33 por milhão de saída, com cache de US$ 0,0206.
| Campo | Valor |
|---|---|
| Identificador | tencent/hy3 |
| Criador | tencent |
| Preço de entrada | US$ 0.132 / M tokens |
| Preço de saída | US$ 0.528 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.033 / M (75% de desconto) |
| Índice de inteligência (AA) | 42.2 |
| Índice de código | 58.8 |
| Índice agêntico | 31.4 |
| Parâmetros | 299B (21B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 92 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
Onde o Hy3 ganha e onde perde
O índice de inteligência do Hy3 ficou em 42,213 — abaixo do corte de 45 que separa os modelos "úteis" dos "experimentais" no catálogo. Em coding, ele sobe para 58,803; em agentic, despenca para 31,417. Isso diz uma coisa direta: o modelo escreve código razoável, mas não é o que você quer para um agente rodando 200 passos sozinho. A velocidade declarada é 92,1 tokens por segundo, saudável para a categoria.
Na prateleira chinesa, o Hy3 fica atrás do GLM 5.2 da Z.ai (IQ 52,641, US$ 3,036/M de saída). Na ponta americana, perde feio para o Sonnet 5 (IQ 55,261) e para o Fable 5. Mas olha o gráfico de custo-benefício e a conversa muda.
A linha completa que a Tencent soltou hoje
A Tencent não lançou só um modelo: soltou o Hy3 pago e a versão free do mesmo modelo, com 262k de contexto. É a mesma estratégia de sempre — um chamariz gratuito para puxar tráfego e um produto pago para converter. O catálogo soma 484 modelos listados hoje, vindos de 62 criadores, e 25 foram lançados nos últimos 30 dias.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Hy3 (free) | 0 | 0 | 262k |
Para quem vale e para quem não muda nada
Vale para você se está montando pipeline de geração de código, transformação de texto em massa, ou um agente simples onde o orçamento pesa mais que a taxa de sucesso. A US$ 0,33 por milhão de saída, dá para rodar volumes que seriam impensáveis no Fable 5. Não vale se você precisa de raciocínio agente de verdade — o agentic de 31,417 está abaixo do que você quer delegar sem supervisão. Também não muda nada para quem já está no Sonnet 5 ou no GLM 5.2 e está satisfeito com o índice de inteligência que tem.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Hy3 (o novo) | 42.2 | 0.132 | 0.528 | 262k |
| Claude Fable 5 | 62.1 | 10 | 50 | 1M |
| Claude Sonnet 5 | 55.3 | 2 | 10 | 1M |
| GLM 5.2 | 52.6 | 0.966 | 3.036 | 1.05M |
| MiniMax M3 | 45.4 | 0.3 | 1.2 | 1.05M |
| DeepSeek V4 Pro 0423 | 45.3 | 1.0423 | 2.0845 | 1.05M |
Para referência, o cenário completo de topo hoje:
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Claude Sonnet 5 | 55.3 | 10 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
O que você faz amanhã
Se você paga API e ainda não testou modelo chinês open weights, o Hy3 é mais um motivo para rodar um benchmark interno seu — não o do fornecedor. Pegue uma amostra de 100 chamadas reais, meça custo e taxa de retrabalho, e compare com o que está rodando. Se o retrabalho for menor que 30% acima do seu modelo atual, a economia de 100x no output paga o experimento em uma semana.
Rode um benchmark interno seu com o Hy3 em tarefas de coding e transformação de texto: a economia de até 150x no output pode compensar um índice de inteligência menor se o retrabalho ficar sob controle.
Perguntas frequentes
Quanto custa o Tencent Hy3 por milhão de tokens?
Cobra US$ 0,0825 por milhão de tokens de entrada e US$ 0,33 por milhão de tokens de saída, com cache a US$ 0,0206 por milhão. É cerca de 150 vezes mais barato que o Claude Fable 5 no output.
O Hy3 é melhor que o Claude Sonnet 5?
Não. O índice de inteligência do Hy3 ficou em 42,213, contra 55,261 do Sonnet 5. O Hy3 vence em preço; o Sonnet 5 vence em capacidade bruta, especialmente em agentic.
O que significa MoE no caso do Hy3?
Mixture-of-Experts com 295 bilhões de parâmetros totais e 21 bilhões ativos por inferência, usando 192 especialistas com roteamento top-8. Na prática, é um modelo grande que só aciona parte de si mesmo a cada chamada, o que explica o preço baixo.