FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Kimi K2.7 Code em batch cobra US$ 4 por milhão — mas não publicou benchmark

Lançado há oito dias pela MoonshotAI, o modelo mira jobs longos de programação com preço competitivo. O problema é que o catálogo ainda não tem nota de inteligência, coding nem agentic para ele.

Redação FalaVIP IA 3 min de leitura
US$ 4 / milhãotokens de saída
US$ 0,19 / milhãotokens em cache
262.144 tokensjanela de contexto

US$ 4 o milhão e zero benchmark

US$ 4 por milhão de tokens de saída. 262.144 tokens de contexto. Oito dias no catálogo. E nenhuma nota de inteligência publicada. É assim que o Kimi K2.7 Code (batch) da MoonshotAI chega para brigar com Claude Fable 5 e GPT-5.3-Codex.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
Entre os 475 modelos disponíveis no catálogo nesta data.

Olha o tabuleiro neste 20 de junho de 2026. O topo da medição de inteligência é da Anthropic, com Claude Fable 5 a 62,07 e US$ 50 por milhão de saída. Logo abaixo, o GPT-5.3-Codex da OpenAI a US$ 14. O Kimi K2.7 Code entra cobrando US$ 4 — mas sem nota publicada para saber em que altura da régua ele realmente cai.

O que o sufixo "batch" muda no cálculo

Batch não é decoração no nome. É o endpoint assíncrono da API: você manda um lote de requisições, a fila processa em segundo plano e os resultados voltam depois. Para chat interativo é inviável — você não espera meia hora por uma resposta. Para um job noturno que refatora 500 arquivos ou varre bugs em vários repositórios, é exatamente o que serve.

A descrição oficial reforça o foco: tarefas de programação de ponta a ponta em contextos longos. A modalidade text+image→text aceita um screenshot como insumo — útil quando o trabalho é implementar algo a partir de um mockup. O contexto de 262 mil tokens comporta uma codebase inteira na janela.

A conta contra os concorrentes

Coloca o Kimi K2.7 Code em batch na régua dos preços:

  • 12,5× mais barato que o Claude Fable 5 (US$ 50/M) no output
  • 3,5× mais barato que o GPT-5.3-Codex (US$ 14/M)
  • 3× mais barato que o Gemini 3.1 Pro Preview (US$ 12/M)
  • Na faixa do GLM 5.2 da Z.ai (US$ 3,036/M), que aparece entre os modelos fortes em coding da própria lista
Ficha técnica — Kimi K2.7 Code (free)
CampoValor
Identificadormoonshotai/kimi-k2.7-code:free
Criadormoonshotai
Preço de entradaUS$ 0.000 / M tokens
Preço de saídaUS$ 0.000 / M tokens
Janela de contexto262k
Modalidadetext+image->text

Mas quando você olha a fila dos "baratos acima de IQ 45", o cenário muda. O Kimi K2.7 Code em batch a US$ 4/M é mais caro que o MiniMax M3 (US$ 1,2/M) e o DeepSeek V4 Pro 0423 (US$ 1,74/M) — e esses dois têm nota de inteligência medida no catálogo, 45,4 e 45,3 respectivamente.

E o cache? US$ 0,19 por milhão de tokens. Esse é o número que mais pesa em jobs batch com prompt repetido: o custo de input despenca quando o system prompt é reaproveitado entre milhares de chamadas. Em escala, essa linha da fatura vale mais que o preço nominal de output.

Para quem vale

Você tem um pipeline noturno de transformação de código — migração de framework, geração em massa de testes, varredura de bugs em vários repositórios. Chamadas assíncronas, prompt repetido, contexto longo. O cache a US$ 0,19 paga o custo, e o output a US$ 4 cabe no orçamento.

Você quer input multimodal barato num job que aceita um screenshot e devolve código. A modalidade text+image→text está aí para isso.

Você roda a API onde latência não importa — overnight jobs, varreduras em lote, refatorações massivas. O sufixo batch é literal.

Para quem NÃO muda nada

Você está montando geração crítica de código que vai direto para commit. Sem nota de coding publicada, sem dado de agentic, sem comparativo com GPT-5.3-Codex, a aposta no Kimi K2.7 Code em batch é cega. Pode render bem; pode engolir parte do orçamento em retrabalho. O catálogo não te diz.

Você precisa de resposta em tempo real no IDE. Batch não serve. Procure a versão síncrona — se a MoonshotAI oferecer — ou desista.

Você quer o teto conhecido em coding e está disposto a pagar por ele. Claude Fable 5 e GPT-5.3-Codex continuam sendo a referência medida. O Kimi K2.7 Code em batch entra como ferramenta auxiliar, não como substituto do carro-chefe.

O que decidir agora

Roda benchmark interno antes de promover o modelo a fornecedor principal. Pega um conjunto de issues reais do seu repositório, joga em batch, mede taxa de aceitação. Se o número passar do seu padrão interno, encaixa no pipeline. Se ficar abaixo, deixa como opção barata para tarefas descartáveis — documentação, rascunhos de testes, comentários de PR.

A conta de API agradece quando a decisão vem com número. Sem nota publicada pelo catálogo, o número é seu.

Em uma frase

Trate o Kimi K2.7 Code em batch como ferramenta auxiliar barata para jobs assíncronos de código com prompt repetido, mas só promova a fornecedor principal depois de medir taxa de aceitação no seu próprio repositório — o catálogo não publicou benchmark.

Perguntas frequentes

O que é a versão batch do Kimi K2.7 Code?

É o endpoint assíncrono da MoonshotAI para o modelo K2.7 Code. Você envia um lote de requisições, elas entram numa fila e voltam processadas horas depois — ideal para jobs longos de código onde latência não importa, mas inviável para uso interativo no chat.

Por que não há benchmark publicado para o Kimi K2.7 Code?

O catálogo onde o modelo foi listado ainda não trouxe nota de inteligência, coding nem agentic para ele, mesmo oito dias depois do lançamento. Isso é comum com modelos recém-chegados e não significa, por si só, que o modelo é fraco — só que não há dado público para comparar com Claude Fable 5 ou GPT-5.3-Codex ainda.

Quando faz sentido trocar o GPT-5.3-Codex pelo Kimi K2.7 Code em batch?

Quando você roda jobs assíncronos de programação com prompt repetido e contexto longo, e o orçamento pesa mais que a necessidade de benchmark conhecido. O Kimi custa US$ 4 por milhão de saída contra US$ 14 do Codex, e o cache a US$ 0,19 corta ainda mais o custo de input. Não faz sentido para código crítico de produção sem teste próprio antes.

Leia também