FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Thinking Machines lança Inkling de 975B; rivais a US$ 1,20 já ganham em IQ

Open-weights, multimodal e com 1M de contexto, o modelo entra no catálogo com cache a US$ 0,17 — mas a defesa do Inkling não é o preço da API.

Redação FalaVIP IA 4 min de leitura
975 bilhõesparâmetros totais (41B ativos por inferência)
US$ 4,05por milhão de tokens de saída
US$ 0,17por milhão de tokens em cache

O tamanho impressiona; o IQ, não

A Thinking Machines Lab, sediada nos EUA, abriu os pesos do Inkling nesta sexta-feira (17 de julho): 975 bilhões de parâmetros totais, 41 bilhões ativos em inferência por mistura de especialistas, multimodal — texto, imagem e áudio na entrada, texto na saída —, 1.048.576 tokens de contexto. O catálogo de modelos listados hoje soma mais de 509, vindo de 65 criadores, com 36 lançamentos só nos últimos 30 dias. O Inkling entra nesse fluxo como o maior anúncio do dia em volume de marketing. Só que o índice de inteligência medido em snapshot coloca o modelo em 42,295, abaixo do piso de 45 que costuma balizar a lista de baratos com IQ razoável no catálogo. Em julho, a régua de entrada para essa turma é outra.

Índice de inteligência (Artificial Analysis)
Inkling42,3Claude Fable 562,1GPT-5.6 Sol60,9Kimi K359,7MiniMax M345,4GPT-5.6 Luna52,3índice
Fonte: Artificial Analysis

Pense assim: o Inkling é o prédio mais alto do quarteirão, mas, na hora de alugar, o apartamento do vizinho é mais barato e mais bem localizado. O lançamento da Thinking Machines Lab é grande — o ponto da compra, no entanto, mora em outro lugar.

Na API, a conta não fecha

O preço de saída do Inkling é US$ 4,05 por milhão de tokens. Na entrada, US$ 1 por milhão. O cache de leitura custa US$ 0,17 por milhão — esse é o número de infraestrutura que vale guardar. Agora olhe os concorrentes diretos, no recorte de modelos acima de IQ 45 mais baratos da lista: o GPT-5.6 Luna cobra US$ 1,20 de saída e marca IQ 52,318; o MiniMax M3 também sai a US$ 1,20 e fica em IQ 45,397; o DeepSeek V4 Pro sai a US$ 1,74 com IQ 45,268. Os três ficam acima do Inkling em inteligência e abaixo no preço de saída.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Inkling (o novo)42.314.051.05M
Claude Fable 562.110501M
GPT-5.6 Sol60.92101.05M
Kimi K359.73151.05M
MiniMax M345.40.31.21.05M
GPT-5.6 Luna52.30.21.21.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

E se a régua for topo de mercado, o Inkling também não entra: o Claude Fable 5 lidera com IQ 62,073 a US$ 50 por milhão de saída, o GPT-5.6 Sol marca 60,93 a US$ 10, e o Kimi K3 chega a 59,699 a US$ 15. O Inkling está mais perto do chão da régua do que do teto. Para quem chama modelo via API pública e a métrica é custo por ponto de IQ, o Inkling entra em desvantagem hoje. O marketing de "modelo de peso aberto" não aparece na fatura do cartão de crédito.

Onde o Inkling faz sentido de verdade

A defesa real do Inkling mora em três números que não entram na régua de preço-por-IQ. O primeiro é open weights: dá para baixar, hospedar e ajustar. Em um catálogo de 509 modelos, isso separa "API de fornecedor" de "infraestrutura interna" — e tem implicação direta para quem lida com dados sensíveis, regulação ou latência de rede. O segundo é 1.048.576 tokens de contexto: para resumir uma base de código inteira, despejar transcrições longas de áudio ou carregar um repositório jurídico, é o playground. O terceiro é cache a US$ 0,17 por milhão — em workloads com muito reuso de prompt, esse é o multiplicador de economia que os rivais não oferecem nesse nível.

Ficha técnica — Inkling
CampoValor
Identificadorthinkingmachines/inkling
Criadorthinkingmachines
Preço de entradaUS$ 1.00 / M tokens
Preço de saídaUS$ 4.05 / M tokens
Janela de contexto1.05M
Modalidadetext+image+audio->text
Leitura de cacheUS$ 0.170 / M (83% de desconto)
Índice de inteligência (AA)42.3
Índice de código52.1
Índice agêntico34.1
Parâmetros975B (41B ativos por token)
Pesosabertos
Velocidade de saída75 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

A multimodalidade também pesa. Texto, imagem e áudio como entrada num único modelo não é detalhe: a maioria dos concorrentes baratos do catálogo é só texto, e o Inkling processa os três formatos de uma vez. Para times que já trabalhavam com pipelines separados de transcrição e visão, a consolidação tem valor de arquitetura.

A família completa

A Thinking Machines Lab não soltou um modelo — soltou três.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Inkling (free)001.05M
Inkling (batch)14.05524k

O Inkling padrão é o carro-chefe. A versão :batch corta o contexto pela metade (524.288 tokens) e mantém o preço de US$ 4,05 por milhão de saída; foi feita para processamento em lote sem pressão de latência, onde o throughput importa mais que o tempo de primeira resposta. A :free zera o preço de entrada e saída, mantém 1M de contexto e serve como porta de entrada para quem quer experimentar antes de hospedar ou de colocar a versão completa em produção. É a primeira vez que esse desenho de três-trilhas aparece no catálogo com 975B por trás.

O que fazer com isso hoje

Se o seu cenário é "API barata para chamada geral", siga com o Luna ou o M3 — eles já estão no catálogo, custam menos e marcam IQ maior. Se o cenário é "preciso de multimodal, contexto grande e posso hospedar", abra a página do Inkling, baixe os pesos e faça a conta de TCO incluindo GPU, equipe de MLOps e manutenção. O lançamento da Thinking Machines Lab de hoje é um evento de infraestrutura, não de preço — e essa é a diferença que o release da empresa não escreve em lugar nenhum.

Em uma frase

Se você consome via API, siga com Luna ou M3; o Inkling só compensa quando o caso é hospedar multimodal com 1M de contexto e reuso pesado de prompt.

Perguntas frequentes

O Inkling é melhor que o GPT-5.6 Luna em IQ?

Não. O Luna marca IQ 52,318 a US$ 1,20 por milhão de tokens de saída, contra IQ 42,295 e US$ 4,05 do Inkling — quase 10 pontos de IQ a menos e cerca de 3,4 vezes mais caro no Inkling.

O que é o Inkling (free) e vale a pena?

É a versão de preço zero, com 1M de contexto igual ao padrão, voltada para experimentar o modelo antes de hospedar ou migrar para a versão paga. Limites práticos de uso não foram publicados pela Thinking Machines Lab.

Quanto custa rodar o Inkling nos meus próprios servidores?

Depende do hardware, mas são 41 bilhões de parâmetros ativos por inferência, o que exige GPUs de data center. A Thinking Machines Lab não publicou estimativa oficial de TCO junto com o lançamento.

Leia também