Thinking Machines lança Inkling de 975B; rivais a US$ 1,20 já ganham em IQ
Open-weights, multimodal e com 1M de contexto, o modelo entra no catálogo com cache a US$ 0,17 — mas a defesa do Inkling não é o preço da API.
O tamanho impressiona; o IQ, não
A Thinking Machines Lab, sediada nos EUA, abriu os pesos do Inkling nesta sexta-feira (17 de julho): 975 bilhões de parâmetros totais, 41 bilhões ativos em inferência por mistura de especialistas, multimodal — texto, imagem e áudio na entrada, texto na saída —, 1.048.576 tokens de contexto. O catálogo de modelos listados hoje soma mais de 509, vindo de 65 criadores, com 36 lançamentos só nos últimos 30 dias. O Inkling entra nesse fluxo como o maior anúncio do dia em volume de marketing. Só que o índice de inteligência medido em snapshot coloca o modelo em 42,295, abaixo do piso de 45 que costuma balizar a lista de baratos com IQ razoável no catálogo. Em julho, a régua de entrada para essa turma é outra.
Pense assim: o Inkling é o prédio mais alto do quarteirão, mas, na hora de alugar, o apartamento do vizinho é mais barato e mais bem localizado. O lançamento da Thinking Machines Lab é grande — o ponto da compra, no entanto, mora em outro lugar.
Na API, a conta não fecha
O preço de saída do Inkling é US$ 4,05 por milhão de tokens. Na entrada, US$ 1 por milhão. O cache de leitura custa US$ 0,17 por milhão — esse é o número de infraestrutura que vale guardar. Agora olhe os concorrentes diretos, no recorte de modelos acima de IQ 45 mais baratos da lista: o GPT-5.6 Luna cobra US$ 1,20 de saída e marca IQ 52,318; o MiniMax M3 também sai a US$ 1,20 e fica em IQ 45,397; o DeepSeek V4 Pro sai a US$ 1,74 com IQ 45,268. Os três ficam acima do Inkling em inteligência e abaixo no preço de saída.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Inkling (o novo) | 42.3 | 1 | 4.05 | 1.05M |
| Claude Fable 5 | 62.1 | 10 | 50 | 1M |
| GPT-5.6 Sol | 60.9 | 2 | 10 | 1.05M |
| Kimi K3 | 59.7 | 3 | 15 | 1.05M |
| MiniMax M3 | 45.4 | 0.3 | 1.2 | 1.05M |
| GPT-5.6 Luna | 52.3 | 0.2 | 1.2 | 1.05M |
E se a régua for topo de mercado, o Inkling também não entra: o Claude Fable 5 lidera com IQ 62,073 a US$ 50 por milhão de saída, o GPT-5.6 Sol marca 60,93 a US$ 10, e o Kimi K3 chega a 59,699 a US$ 15. O Inkling está mais perto do chão da régua do que do teto. Para quem chama modelo via API pública e a métrica é custo por ponto de IQ, o Inkling entra em desvantagem hoje. O marketing de "modelo de peso aberto" não aparece na fatura do cartão de crédito.
Onde o Inkling faz sentido de verdade
A defesa real do Inkling mora em três números que não entram na régua de preço-por-IQ. O primeiro é open weights: dá para baixar, hospedar e ajustar. Em um catálogo de 509 modelos, isso separa "API de fornecedor" de "infraestrutura interna" — e tem implicação direta para quem lida com dados sensíveis, regulação ou latência de rede. O segundo é 1.048.576 tokens de contexto: para resumir uma base de código inteira, despejar transcrições longas de áudio ou carregar um repositório jurídico, é o playground. O terceiro é cache a US$ 0,17 por milhão — em workloads com muito reuso de prompt, esse é o multiplicador de economia que os rivais não oferecem nesse nível.
| Campo | Valor |
|---|---|
| Identificador | thinkingmachines/inkling |
| Criador | thinkingmachines |
| Preço de entrada | US$ 1.00 / M tokens |
| Preço de saída | US$ 4.05 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text+image+audio->text |
| Leitura de cache | US$ 0.170 / M (83% de desconto) |
| Índice de inteligência (AA) | 42.3 |
| Índice de código | 52.1 |
| Índice agêntico | 34.1 |
| Parâmetros | 975B (41B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 75 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
A multimodalidade também pesa. Texto, imagem e áudio como entrada num único modelo não é detalhe: a maioria dos concorrentes baratos do catálogo é só texto, e o Inkling processa os três formatos de uma vez. Para times que já trabalhavam com pipelines separados de transcrição e visão, a consolidação tem valor de arquitetura.
A família completa
A Thinking Machines Lab não soltou um modelo — soltou três.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Inkling (free) | 0 | 0 | 1.05M |
| Inkling (batch) | 1 | 4.05 | 524k |
O Inkling padrão é o carro-chefe. A versão :batch corta o contexto pela metade (524.288 tokens) e mantém o preço de US$ 4,05 por milhão de saída; foi feita para processamento em lote sem pressão de latência, onde o throughput importa mais que o tempo de primeira resposta. A :free zera o preço de entrada e saída, mantém 1M de contexto e serve como porta de entrada para quem quer experimentar antes de hospedar ou de colocar a versão completa em produção. É a primeira vez que esse desenho de três-trilhas aparece no catálogo com 975B por trás.
O que fazer com isso hoje
Se o seu cenário é "API barata para chamada geral", siga com o Luna ou o M3 — eles já estão no catálogo, custam menos e marcam IQ maior. Se o cenário é "preciso de multimodal, contexto grande e posso hospedar", abra a página do Inkling, baixe os pesos e faça a conta de TCO incluindo GPU, equipe de MLOps e manutenção. O lançamento da Thinking Machines Lab de hoje é um evento de infraestrutura, não de preço — e essa é a diferença que o release da empresa não escreve em lugar nenhum.
Se você consome via API, siga com Luna ou M3; o Inkling só compensa quando o caso é hospedar multimodal com 1M de contexto e reuso pesado de prompt.
Perguntas frequentes
O Inkling é melhor que o GPT-5.6 Luna em IQ?
Não. O Luna marca IQ 52,318 a US$ 1,20 por milhão de tokens de saída, contra IQ 42,295 e US$ 4,05 do Inkling — quase 10 pontos de IQ a menos e cerca de 3,4 vezes mais caro no Inkling.
O que é o Inkling (free) e vale a pena?
É a versão de preço zero, com 1M de contexto igual ao padrão, voltada para experimentar o modelo antes de hospedar ou migrar para a versão paga. Limites práticos de uso não foram publicados pela Thinking Machines Lab.
Quanto custa rodar o Inkling nos meus próprios servidores?
Depende do hardware, mas são 41 bilhões de parâmetros ativos por inferência, o que exige GPUs de data center. A Thinking Machines Lab não publicou estimativa oficial de TCO junto com o lançamento.