Thinking Machines lança Inkling com 975B; rivais entregam mais IQ por menos dinheiro
Modelo multimodal de pesos abertos da Thinking Machines chega com 975 bilhões de parâmetros e preço de US$ 4,05 por milhão de tokens de saída. Para a conta de API, há alternativas mais baratas que pontuam mais alto no índice de inteligência.
Thinking Machines jogou 975 bilhões de parâmetros na mesa hoje. O índice de inteligência respondeu com um número que incomoda.
Thinking Machines Lab, o criador mais recente a entrar na briga dos modelos grandes, soltou hoje três variantes do Inkling — a principal, a versão batch e a gratuita. O modelo principal é open-weight, multimodal (texto, imagem e áudio entram; só texto sai) e tem contexto de 1 milhão de tokens. Custo de API: US$ 1 por milhão de tokens de entrada e US$ 4,05 por milhão de tokens de saída. Em cima do papel, parece uma pancada. Na fatura do fim do mês, é outra conversa.
Mixture-of-experts em uma frase e a ficha completa
Inkling é um mixture-of-experts: imagine uma empresa com 975 funcionários, mas só 41 trabalham em qualquer projeto. Os outros 934 ficam de prontidão, especializados em outras tarefas, e o sistema escolhe quem chamar por requisição. É por isso que um modelo de 975B de parâmetros consegue rodar com o custo computacional de um modelo menor — só uma fração está ativa por vez, e é isso que aparece na conta.
| Campo | Valor |
|---|---|
| Identificador | thinkingmachines/inkling |
| Criador | thinkingmachines |
| Preço de entrada | US$ 1.00 / M tokens |
| Preço de saída | US$ 4.05 / M tokens |
| Janela de contexto | 1.05M |
| Modalidade | text+image+audio->text |
| Leitura de cache | US$ 0.170 / M (83% de desconto) |
| Índice de inteligência (AA) | 42.3 |
| Índice de código | 52.1 |
| Índice agêntico | 34.1 |
| Parâmetros | 975B (41B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 75 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O índice de inteligência não acompanhou o tamanho
O Inkling marca 42,295 no índice da Artificial Analysis. Não é ruim, mas também não é o que o volume de parâmetros sugeriria. Os três modelos no topo do mercado hoje — Claude Fable 5 (62,073), GPT-5.6 Sol (60,93) e Kimi K3 (59,699) — passam dos 55. O Inkling fica abaixo dos três e nem entra no top 5 do catálogo, que soma pelo menos 509 modelos listados de 65 criadores em 17 de julho de 2026.
E tem um detalhe pior para quem paga API. As alternativas mais baratas com IQ acima de 45 contam outra história: MiniMax M3 marca 45,397 por US$ 1,20 por milhão de saída, GPT-5.6 Luna marca 52,318 pelo mesmo US$ 1,20, e DeepSeek V4 Pro marca 45,268 por US$ 1,74. Traduzindo: o GPT-5.6 Luna custa um terço do Inkling e ainda pontua mais alto no índice. É o pior cenário para o Inkling no eixo "API pura".
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Inkling (o novo) | 42.3 | 1 | 4.05 | 1.05M |
| Claude Fable 5 | 62.1 | 10 | 50 | 1M |
| GPT-5.6 Sol | 60.9 | 2 | 10 | 1.05M |
| Kimi K3 | 59.7 | 3 | 15 | 1.05M |
| MiniMax M3 | 45.4 | 0.3 | 1.2 | 1.05M |
| GPT-5.6 Luna | 52.3 | 0.2 | 1.2 | 1.05M |
Onde o Inkling ainda faz sentido
Três coisas que os concorrentes não entregam no mesmo pacote. Primeiro, open weights: você baixa os 975B de parâmetros e roda onde quiser. Se você já tem cluster de GPU e a inferência própria sai por menos de US$ 4,05 por milhão, o cálculo inverte a favor do Inkling. Segundo, multimodal nativo de verdade: texto, imagem e áudio na mesma chamada. A maioria dos modelos desse preço aceita só texto, ou texto e imagem. Se o seu pipeline precisa ouvir áudio nativamente, a lista de opções encolhe rápido. Terceiro, contexto de 1 milhão de tokens, útil para livro inteiro, base de código grande ou conversa que não trunca no meio.
O lançamento veio em três sabores no mesmo dia: Inkling principal (US$ 1 / US$ 4,05, contexto de 1M), Inkling batch (mesmo preço por token, contexto de 524 mil, para jobs assíncronos que podem esperar horas em vez de segundos) e Inkling free (US$ 0 / US$ 0, contexto de 1M, com rate limit e fila).
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Inkling (free) | 0 | 0 | 1.05M |
| Inkling (batch) | 1 | 4.05 | 524k |
Para quem vale, para quem não muda nada, e o que fazer
Vale se: você quer self-hostar, precisa de áudio multimodal nativo, ou já tem infraestrutura que torna a inferência própria mais barata que a API. Nesse caso, é uma opção americana de pesos abertos, com janela enorme e multimodal completo — não é pouca coisa.
Não muda nada se: você consome via API, quer o melhor IQ por dólar e lida só com texto. Aí o GPT-5.6 Luna ou o MiniMax M3 resolvem por um terço do custo e com inteligência maior medida no índice.
O que fazer agora: se você roda cluster próprio e precisa de multimodal, baixe os pesos do Inkling e meça na sua tarefa — coding está em 52,059 e agentic em 34,128, então o seu caso pode pender para cima ou para baixo do índice geral. Se você está decidindo só pela API, deixa o Inkling no watchlist e testa o Luna primeiro: custa menos, pensa mais, e cobre o mesmo cenário enquanto seu input for texto.
Se você consome API com input de texto, siga com GPT-5.6 Luna ou MiniMax M3 — custam um terço e pontuam mais no índice. O Inkling só muda o jogo se você for self-hostar multimodal com áudio nativo.
Perguntas frequentes
O que é o Inkling da Thinking Machines?
É um modelo multimodal de pesos abertos (open-weight) lançado em 17 de julho de 2026, com 975 bilhões de parâmetros totais e 41 bilhões ativos por requisição em arquitetura mixture-of-experts. Aceita texto, imagem e áudio como entrada, devolve só texto e trabalha com até 1 milhão de tokens de contexto.
Quanto custa o Inkling via API?
US$ 1,00 por milhão de tokens de entrada e US$ 4,05 por milhão de tokens de saída, com cache de prompt a US$ 0,17 por milhão. O Thinking Machines também oferece a versão Inkling batch (mesmo preço, contexto de 524 mil tokens) e a versão Inkling free (US$ 0 / US$ 0).
Vale a pena trocar meu modelo atual pelo Inkling?
Depende. Para API pura com entrada de texto, não — GPT-5.6 Luna e MiniMax M3 custam um terço e têm índice de inteligência maior. O Inkling compensa se você precisa self-hostar, tem entrada de áudio nativa ou precisa de multimodal real com texto, imagem e áudio na mesma chamada.