FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Thinking Machines lança Inkling com 975B; rivais entregam mais IQ por menos dinheiro

Modelo multimodal de pesos abertos da Thinking Machines chega com 975 bilhões de parâmetros e preço de US$ 4,05 por milhão de tokens de saída. Para a conta de API, há alternativas mais baratas que pontuam mais alto no índice de inteligência.

Redação FalaVIP IA 3 min de leitura
US$ 4,05por milhão de tokens de saída
975 bilhõesparâmetros totais (41B ativos por requisição)
42,295índice de inteligência Artificial Analysis

Thinking Machines jogou 975 bilhões de parâmetros na mesa hoje. O índice de inteligência respondeu com um número que incomoda.

Thinking Machines Lab, o criador mais recente a entrar na briga dos modelos grandes, soltou hoje três variantes do Inkling — a principal, a versão batch e a gratuita. O modelo principal é open-weight, multimodal (texto, imagem e áudio entram; só texto sai) e tem contexto de 1 milhão de tokens. Custo de API: US$ 1 por milhão de tokens de entrada e US$ 4,05 por milhão de tokens de saída. Em cima do papel, parece uma pancada. Na fatura do fim do mês, é outra conversa.

Mixture-of-experts em uma frase e a ficha completa

Inkling é um mixture-of-experts: imagine uma empresa com 975 funcionários, mas só 41 trabalham em qualquer projeto. Os outros 934 ficam de prontidão, especializados em outras tarefas, e o sistema escolhe quem chamar por requisição. É por isso que um modelo de 975B de parâmetros consegue rodar com o custo computacional de um modelo menor — só uma fração está ativa por vez, e é isso que aparece na conta.

Ficha técnica — Inkling
CampoValor
Identificadorthinkingmachines/inkling
Criadorthinkingmachines
Preço de entradaUS$ 1.00 / M tokens
Preço de saídaUS$ 4.05 / M tokens
Janela de contexto1.05M
Modalidadetext+image+audio->text
Leitura de cacheUS$ 0.170 / M (83% de desconto)
Índice de inteligência (AA)42.3
Índice de código52.1
Índice agêntico34.1
Parâmetros975B (41B ativos por token)
Pesosabertos
Velocidade de saída75 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O índice de inteligência não acompanhou o tamanho

O Inkling marca 42,295 no índice da Artificial Analysis. Não é ruim, mas também não é o que o volume de parâmetros sugeriria. Os três modelos no topo do mercado hoje — Claude Fable 5 (62,073), GPT-5.6 Sol (60,93) e Kimi K3 (59,699) — passam dos 55. O Inkling fica abaixo dos três e nem entra no top 5 do catálogo, que soma pelo menos 509 modelos listados de 65 criadores em 17 de julho de 2026.

E tem um detalhe pior para quem paga API. As alternativas mais baratas com IQ acima de 45 contam outra história: MiniMax M3 marca 45,397 por US$ 1,20 por milhão de saída, GPT-5.6 Luna marca 52,318 pelo mesmo US$ 1,20, e DeepSeek V4 Pro marca 45,268 por US$ 1,74. Traduzindo: o GPT-5.6 Luna custa um terço do Inkling e ainda pontua mais alto no índice. É o pior cenário para o Inkling no eixo "API pura".

Inteligência × preço de saída
InklingClaude Fable 5GPT-5.6 SolKimi K3MiniMax M3GPT-5.6 LunaUS$ por milhão (saída, escala log)índice de inteligência
Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Inkling (o novo)42.314.051.05M
Claude Fable 562.110501M
GPT-5.6 Sol60.92101.05M
Kimi K359.73151.05M
MiniMax M345.40.31.21.05M
GPT-5.6 Luna52.30.21.21.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Onde o Inkling ainda faz sentido

Três coisas que os concorrentes não entregam no mesmo pacote. Primeiro, open weights: você baixa os 975B de parâmetros e roda onde quiser. Se você já tem cluster de GPU e a inferência própria sai por menos de US$ 4,05 por milhão, o cálculo inverte a favor do Inkling. Segundo, multimodal nativo de verdade: texto, imagem e áudio na mesma chamada. A maioria dos modelos desse preço aceita só texto, ou texto e imagem. Se o seu pipeline precisa ouvir áudio nativamente, a lista de opções encolhe rápido. Terceiro, contexto de 1 milhão de tokens, útil para livro inteiro, base de código grande ou conversa que não trunca no meio.

O lançamento veio em três sabores no mesmo dia: Inkling principal (US$ 1 / US$ 4,05, contexto de 1M), Inkling batch (mesmo preço por token, contexto de 524 mil, para jobs assíncronos que podem esperar horas em vez de segundos) e Inkling free (US$ 0 / US$ 0, contexto de 1M, com rate limit e fila).

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Inkling (free)001.05M
Inkling (batch)14.05524k

Para quem vale, para quem não muda nada, e o que fazer

Vale se: você quer self-hostar, precisa de áudio multimodal nativo, ou já tem infraestrutura que torna a inferência própria mais barata que a API. Nesse caso, é uma opção americana de pesos abertos, com janela enorme e multimodal completo — não é pouca coisa.

Não muda nada se: você consome via API, quer o melhor IQ por dólar e lida só com texto. Aí o GPT-5.6 Luna ou o MiniMax M3 resolvem por um terço do custo e com inteligência maior medida no índice.

O que fazer agora: se você roda cluster próprio e precisa de multimodal, baixe os pesos do Inkling e meça na sua tarefa — coding está em 52,059 e agentic em 34,128, então o seu caso pode pender para cima ou para baixo do índice geral. Se você está decidindo só pela API, deixa o Inkling no watchlist e testa o Luna primeiro: custa menos, pensa mais, e cobre o mesmo cenário enquanto seu input for texto.

Em uma frase

Se você consome API com input de texto, siga com GPT-5.6 Luna ou MiniMax M3 — custam um terço e pontuam mais no índice. O Inkling só muda o jogo se você for self-hostar multimodal com áudio nativo.

Perguntas frequentes

O que é o Inkling da Thinking Machines?

É um modelo multimodal de pesos abertos (open-weight) lançado em 17 de julho de 2026, com 975 bilhões de parâmetros totais e 41 bilhões ativos por requisição em arquitetura mixture-of-experts. Aceita texto, imagem e áudio como entrada, devolve só texto e trabalha com até 1 milhão de tokens de contexto.

Quanto custa o Inkling via API?

US$ 1,00 por milhão de tokens de entrada e US$ 4,05 por milhão de tokens de saída, com cache de prompt a US$ 0,17 por milhão. O Thinking Machines também oferece a versão Inkling batch (mesmo preço, contexto de 524 mil tokens) e a versão Inkling free (US$ 0 / US$ 0).

Vale a pena trocar meu modelo atual pelo Inkling?

Depende. Para API pura com entrada de texto, não — GPT-5.6 Luna e MiniMax M3 custam um terço e têm índice de inteligência maior. O Inkling compensa se você precisa self-hostar, tem entrada de áudio nativa ou precisa de multimodal real com texto, imagem e áudio na mesma chamada.

Leia também