FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Kimi K2.7 Code de graça: vale substituir seu modelo pago por uma semana?

Lançado há sete dias, o coding-focused da MoonshotAI entra no catálogo com preço zero — e contexto de 262 mil tokens. A pergunta é se isso muda alguma coisa na sua fila de produção.

Redação FalaVIP IA 3 min de leitura
US$ 0por milhão de tokens de entrada e saída
262.144tokens de contexto
29modelos lançados nos últimos 30 dias no catálogo

Sete dias após o lançamento, o Kimi K2.7 Code aparece no catálogo com uma proposta que costuma fazer desenvolvedor apertar o botão de teste antes de ler a documentação: preço zero tanto na entrada quanto na saída, com 262 mil tokens de contexto e foco declarado em tarefas de programação de ponta a ponta. A pergunta que interessa não é se o modelo é bom — é se ele tira o seu modelo pago do caminho em algum cenário real.

O que está em jogo quando o preço é zero

Quando um modelo entra como :free, o catálogo está te dizendo duas coisas ao mesmo tempo. A primeira: não há cobrança por token, nem na leitura do seu prompt, nem na geração da resposta. A segunda, mais importante: você não está pagando a conta, então alguém está — e isso costuma significar rate limit agressivo, fila de espera ou janela de instabilidade. Quem já queimou uma madrugada num deploy porque o tier gratuito caiu no meio do batch reconhece esse trade-off de longe.

O Kimi K2.7 Code foi descrito pela MoonshotAI como um modelo focado em completar tarefas de programação de ponta a ponta de forma confiável em contextos longos, usando uma arquitetura multimodal mixture-of-experts nativa. É a primeira vez que essa linha da MoonshotAI aparece com a etiqueta :free no catálogo, o que por si só já é um sinal: a empresa está testando distribuição, não cobrando por uso.

Ficha técnica — Kimi K2.7 Code (batch)
CampoValor
Identificadormoonshotai/kimi-k2.7-code:batch
Criadormoonshotai
Preço de entradaUS$ 0.950 / M tokens
Preço de saídaUS$ 4.00 / M tokens
Janela de contexto262k
Modalidadetext+image->text
Leitura de cacheUS$ 0.190 / M (80% de desconto)

Onde ele entra no tabuleiro

Olhe o topo do catálogo hoje e a fotografia fica clara. O Claude Fable 5 da Anthropic lidera o ranking de inteligência com folga, cobrando US$ 50 por milhão de tokens de saída. Logo abaixo vem o GLM 5.2 da Z.ai, com IQ de 52,6 e preço de US$ 3,04 por milhão de saída — uma das ofertas mais agressivas entre os modelos fortes. O Gemini 3.1 Pro Preview da Google aparece em terceiro, a US$ 12 por milhão. Mais abaixo, na faixa de IQ em torno de 45, o catálogo lista três opções que disputam o título de melhor custo-benefício: o MiniMax M3 a US$ 1,20, o DeepSeek V4 Pro a US$ 1,74 e o próprio GLM 5.2.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GLM 5.252.63.036
Gemini 3.1 Pro Preview47.712
Gemini 3.5 Flash46.79
GPT-5.3-Codex45.514
Entre os 475 modelos disponíveis no catálogo nesta data.

O Kimi K2.7 Code entra nesse cenário sem nota de IQ publicada no catálogo — e aqui vai uma advertência honesta: sem benchmark, qualquer afirmação sobre qualidade é chute. O que dá para dizer com base nos dados é que ele foi listado como gratuito, multimodal (texto e imagem na entrada, texto na saída), com contexto de 262 mil tokens, e que foi lançado há sete dias, junto de outros 28 modelos que entraram no catálogo nos últimos 30 dias.

Para quem isso muda o jogo

Se você roda tarefas de programação em alto volume — revisão de PR, geração de testes, refactor em arquivos grandes — e hoje paga caro por isso, vale um experimento controlado: apontar uma fração do tráfego para o K2.7 Code e medir latência, taxa de erro e qualidade percebida. O contexto de 262 mil tokens é generoso o suficiente para comportar boa parte dos repositórios médios sem precisar de chunking agressivo.

Se você precisa de garantia de SLA, fila previsível e resposta em horário comercial, modelo gratuito raramente entrega isso. Para workloads críticos, o caminho continua sendo um modelo pago com preço conhecido e suporte contratual. A conta da API no fim do mês não mente, e ela costuma doer mais quando o tier gratuito cai no meio do fluxo.

O que ninguém te conta sobre o :free

Três detalhes que costumam escapar no anúncio. Primeiro, o preço zero não significa ausência de custo de oportunidade: o tempo gasto debugando instabilidade é dinheiro. Segundo, sem nota de IQ, de coding e de agentic publicadas, não dá para comparar o K2.7 Code com o Claude Fable 5 ou com o GLM 5.2 em qualidade — só em preço, e nesse quesito ele ganha de todos por definição. Terceiro, a MoonshotAI é uma criadora chinesa que já opera em escala global; o modelo :free provavelmente é uma porta de entrada para quem ainda não conhece a família Kimi K2, e não uma linha de produto permanente.

Veredito prático

Se você está pagando caro por um modelo forte para tarefas de código que toleram alguma instabilidade, o Kimi K2.7 Code é a aposta óbvia da semana. Se seu fluxo depende de previsibilidade, ele é um complemento, não uma substituição. E se você está só colecionando opções gratuitas, lembre-se: gratuito demais, sem benchmark publicado, é experimento — não é stack.

Em uma frase

Teste o Kimi K2.7 Code em uma fração do seu tráfego de código esta semana, meça latência e taxa de erro, e só promova para produção se o ganho de custo compensar a perda de previsibilidade.

Perguntas frequentes

O Kimi K2.7 Code é realmente de graça?

Sim, no catálogo ele aparece com preço zero tanto na entrada quanto na saída de tokens. Isso não elimina rate limits nem instabilidade típica de tiers gratuitos — significa apenas que a conta da API não cresce por uso direto.

Qual a diferença entre Kimi K2.7 Code e o Claude Fable 5?

O Claude Fable 5 lidera o ranking de inteligência do catálogo hoje, com IQ de 62, e custa US$ 50 por milhão de tokens de saída. O Kimi K2.7 Code é gratuito, mas não tem nota de IQ publicada, então a comparação em qualidade é impossível com os dados disponíveis — só em preço, onde a diferença é total.

262 mil tokens de contexto é muito?

É generoso. Comporta a maior parte de repositórios médios inteiros sem precisar quebrar em pedaços, o que é útil para tarefas de refactor e revisão que pedem visão ampla do código.

Leia também