Kimi K2 Thinking custa US$ 2,50 por milhão de saída — e a comparação muda tudo
Modelo de raciocínio da MoonshotAI chega ao mesmo dia em que o catálogo mostra 270 modelos ativos e a faixa dos US$ 8 já virou referência entre os modelos que pensam.
O que está na nota e o que está no silêncio
Você está olhando a tabela de preços do Kimi K2 Thinking — lançado hoje pela chinesa MoonshotAI — e vendo um número que, em tese, deveria fazer você repensar o próximo ciclo de cobrança. US$ 0,60 de entrada e US$ 2,50 de saída por milhão de tokens, com cache a US$ 0,15. Bonito no papel. Mas o catálogo que você usa hoje tem 270 modelos listados e 21 deles foram lançados nos últimos 30 dias. Em outras palavras, o chão muda toda semana.
Então a pergunta não é se o Kimi K2 Thinking é barato. É barato contra o quê — e em qual tipo de tarefa.
Onde ele se encaixa no tabuleiro
Olhe os números que estão públicos hoje. O topo da categoria de raciocínio ainda tem dono: o OpenAI o3 cobra US$ 8 por milhão de tokens de saída, e o Claude Haiku 4.5 cobra US$ 5. Abaixo deles, em ordem de preço, aparecem o gpt-oss-120b a US$ 0,17 e o gpt-oss-20b a US$ 0,13 — modelos abertos, sem custo de saída equivalente, mas que servem a um perfil de uso diferente.
O Kimi K2 Thinking entra exatamente na faixa que faltava preencher para quem quer raciocínio de verdade sem pagar o piso do o3: ele é mais que 3 vezes mais barato na saída que o o3, e custa metade do Claude Haiku 4.5. Com uma janela de 262.144 tokens, ele conversa com o material grande — código com múltiplos arquivos, documentação técnica inteira, transcripts de call.
| Campo | Valor |
|---|---|
| Identificador | moonshotai/kimi-k2-thinking |
| Criador | moonshotai |
| Preço de entrada | US$ 0.600 / M tokens |
| Preço de saída | US$ 2.50 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.150 / M (75% de desconto) |
Para quem ele vale a pena
Se você roda um agente que precisa planejar, decidir entre ferramentas e voltar para checar o próprio trabalho, o K2 Thinking foi treinado exatamente para isso — é o que o fabricante chama de raciocínio agêntico de horizonte longo, construído sobre uma arquitetura Mixture-of-Experts na casa do trilhão de parâmetros totais.
Na prática, isso significa três casos em que o custo-benefício pesa a favor dele:
- Pipelines agênticos que usam o3 hoje. Se sua chamada média consome muito raciocínio e pouco texto final, pagar US$ 2,50 em vez de US$ 8 por milhão de saída muda a margem do produto sem mudar a arquitetura.
- Processamento de documentos grandes. Com 256K de contexto, cabe uma codebase inteira, um PDF de 400 páginas ou um dump de logs. O cache a US$ 0,15 torna a segunda passagem sobre o mesmo material quase gratuita.
- Times que querem pesos abertos sem montar cluster. É modelo aberto; dá para inspecionar, ajustar, hospedar quando a conta apertar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Quando NÃO vale a pena
Pagar US$ 2,50 por milhão de saída não é barganha se o que você precisa cabe em outro perfil. Três cenários em que o K2 Thinking não é a escolha certa:
- Tarefas curtas e de baixa complexidade. Resumir uma chamada de suporte ou extrair um campo de um JSON não exige raciocínio agêntico. Um gpt-oss-20b a US$ 0,13 de saída custa uma fração e entrega o suficiente.
- Latência sensível. Modelos "thinking" pagam o preço de pensar antes de responder. Se o seu produto tem SLA de sub-segundo, essa categoria não é a sua.
- Quem já fechou contrato com Claude ou OpenAI. Sem dado de qualidade publicado para comparar (o catálogo não traz índice de inteligência, nota agentic nem codificação para esse lançamento hoje), não há motivo para trocar uma stack que funciona por uma promessa.
O que falta — e por que isso importa
Aqui está o silêncio que você precisa ouvir antes de colocar no orçamento: o Kimi K2 Thinking chega sem nota de inteligência publicada, sem benchmark de código, sem nota agentic, sem país de origem declarado, sem parâmetro ativo informado, sem velocidade, sem data de corte de conhecimento. É o tipo de lacuna que não se resolve com release — se resolve depois, com uso real.
Enquanto essas notas não aparecem, a comparação justa com o3 e Claude Haiku 4.5 fica incompleta. O preço é o fato. A qualidade, por enquanto, é promessa.
O que você faz com isso hoje
Roda um piloto curto: pegue o caso de uso mais caro do seu mês — o agente que mais consome tokens, a esteira de processamento de documentos que mais gasta — e meça o K2 Thinking por uma semana com a mesma carga que roda no o3 ou no Claude Haiku 4.5. Se a entrega passar no seu critério de aceite, você tem um candidato real a substituir o topo do seu stack com economia que vai de 50% a 68% na saída. Se não passar, o preço é só ruído.
Rode um piloto de uma semana no seu caso de uso mais caro antes de migrar: o preço é o fato, a qualidade do raciocínio ainda precisa ser medida na sua carga.
Perguntas frequentes
Quanto custa o Kimi K2 Thinking por milhão de tokens?
US$ 0,60 de entrada, US$ 2,50 de saída e US$ 0,15 para tokens em cache por milhão. É mais barato que o OpenAI o3 (US$ 8 de saída) e que o Claude Haiku 4.5 (US$ 5 de saída), e mais caro que os modelos abertos da OpenAI como o gpt-oss-20b (US$ 0,13).
O Kimi K2 Thinking serve para que tipo de tarefa?
Raciocinio agêntico de horizonte longo, processamento de documentos grandes (até 262K tokens de contexto) e pipelines que precisam planejar e revisar o próprio trabalho. Para tarefas curtas ou sensíveis a latência, não é a escolha certa.
O Kimi K2 Thinking é modelo aberto?
Sim, foi divulgado como modelo de pesos abertos da MoonshotAI, construído sobre uma arquitetura Mixture-of-Experts na casa do trilhão de parâmetros. O catálogo ainda não publicou o número de parâmetros ativos nem o país de origem.