Kimi K2 Thinking estreia por US$ 0,60 o milhão de tokens de entrada: vale para quem?
Modelo de raciocínio da Moonshot AI chega ao catálogo com contexto de 262 mil tokens, cobrança separada para cache e proposta de agente de longo horizonte — mas não traz índice de inteligência nem preço aberto.
Dia de lançamento não é dia de celebração: é dia de conferir a fatura. A Moonshot AI coloca hoje no catálogo o Kimi K2 Thinking, um modelo de raciocínio construído sobre uma arquitetura Mixture-of-Experts com escala de trilionésimo de parâmetro, voltado a "raciocínio agente de horizonte longo". A pergunta que importa para quem paga a API é direta: o que esse modelo entrega, contra quem compete e em qual cenário ele realmente entra no orçamento?
O preço de tabela
A conta é simples de montar. Entrada sai a US$ 0,60 por milhão de tokens, saída a US$ 2,50 por milhão e há cobrança separada para leitura em cache, fixada em US$ 0,15 por milhão. Em tradução direta: cada 1.000 chamadas com 1.000 tokens de resposta custam cerca de US$ 4,40 — e isso antes do tráfego de entrada, que costuma dominar workloads analíticos longos.
| Campo | Valor |
|---|---|
| Identificador | moonshotai/kimi-k2-thinking |
| Criador | moonshotai |
| Preço de entrada | US$ 0.600 / M tokens |
| Preço de saída | US$ 2.50 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.150 / M (75% de desconto) |
Para efeito de comparação, no recorte que o catálogo mostra hoje, o o3 da OpenAI sai por US$ 8 por milhão de tokens de saída — mais que o triplo do Kimi K2 Thinking. O Claude Haiku 4.5, da Anthropic, cobra US$ 5 pelo mesmo trecho. O modelo da Moonshot entra mais barato em ambos os lados da tabela, mas há uma ressalva importante: o catálogo não publicou nenhum índice de inteligência para esse lançamento. Você está pagando um preço menor sem saber, por enquanto, em que posição do ranking ele se encaixa.
Onde ele realmente se coloca
O K2 Thinking foi desenhado para uma faixa específica: tarefas em que o modelo precisa planejar, usar ferramentas e encadear passos ao longo de uma janela de contexto de 262.144 tokens. É o tipo de uso em que o agente faz dezenas de chamadas internas antes de devolver a resposta — e onde cada token de cache lido vira economia real.
Nesse terreno, o concorrente natural é o o3 da OpenAI, que lidera o ranking de inteligência do catálogo hoje, com IQ 31,096. Mas o o3 custa três vezes mais na saída e não traz leitura em cache publicada. Para fluxos agente que martelam o mesmo prompt de sistema vezes seguidas, o Kimi K2 Thinking pode terminar o mês mais barato mesmo entregando menos capacidade bruta de raciocínio.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Para quem vale
Você se encaixa no público deste modelo se: roda agente que consome contexto longo, faz poucas chamadas externas e reaproveita o mesmo bloco de instruções entre requisições. Startups montando automações internas, times de pesquisa encadeando ferramentas, equipes jurídicas ou de análise financeira processando documentos extensos — todos se beneficiam do preço agressivo e da janela ampla.
Se o seu caso de uso é comparação pontual de modelos, raciocínio puro sem ferramenta ou tarefas curtas de classificação, o ganho some. Em workloads assim, o Claude Haiku 4.5 entrega IQ 29,892 com saída a US$ 5, e o o3 mantém a dianteira quando a qualidade da resposta pesa mais que o cents por token.
Para quem não muda nada
Se você já está no ecossistema OpenAI com o3 ou no Anthropic com Haiku 4.5, e seus custos estão sob controle, o K2 Thinking não é troca obrigatória. É uma alternativa a ser testada em workload específico — não um substituto universal.
Outro ponto que pesa: o catálogo não trouxe dados sobre país de origem, velocidade, conhecimento de corte e nem os índices padronizados. Você vai precisar rodar benchmark próprio antes de colocar em produção crítica. Para quem vende SLA, isso importa mais que três vezes o preço.
O que olhar nas próximas semanas
O Moonshot K2 Thinking entra no catálogo em um momento em que 21 modelos foram lançados nos últimos 30 dias e a faixa de "modelo de raciocínio barato" está cada vez mais disputada. O preço de US$ 0,60 de entrada é agressivo, mas sem índice de inteligência publicado ele ainda é uma promessa — e promessas, em API, se medem em cents por resposta correta, não em slides de lançamento.
Teste o Kimi K2 Thinking em fluxos agente de contexto longo e reaproveitamento de cache; mantenha o3 ou Haiku 4.5 para tarefas onde o índice de inteligência publicado ainda pesa mais que a diferença de centavos por token.
Perguntas frequentes
Quanto custa o Kimi K2 Thinking na API?
O catálogo lista US$ 0,60 por milhão de tokens de entrada, US$ 2,50 por milhão de tokens de saída e US$ 0,15 por milhão de tokens lidos em cache. Não há tier gratuito publicado.
O Kimi K2 Thinking é melhor que o o3 da OpenAI?
Sem índice de inteligência publicado no catálogo, não é possível afirmar. O o3 lidera o ranking atual com IQ 31,096 e custa três vezes mais na saída — então a comparação real depende do seu workload e do peso que você dá a cada eixo.
Para qual tipo de tarefa o Kimi K2 Thinking foi feito?
A descrição oficial aponta raciocínio agente de horizonte longo, com 262 mil tokens de contexto. É indicado para fluxos que encadeiam ferramentas e processam instruções longas; menos indicado para tarefas curtas ou de comparação direta de qualidade bruta.