1,2B de parâmetros e grátis: o que o LFM2.5 da LiquidAI resolve de verdade
Modelo de borda tem IQ 2,3 e fica longe do topo do catálogo. Faz sentido só se você roda IA no celular — não se paga API.
Lançado ontem pela LiquidAI, o LFM2.5-1.2B-Instruct tem 1,17 bilhão de parâmetros, preço zero e índice de inteligência de 2,299 — quase quinze vezes abaixo do topo do catálogo, que passa de 34. Antes de decidir se vale testar, a pergunta que importa é outra: faz sentido chamar isso via API, ou ele só serve para quem está colocando IA dentro de hardware?
O tamanho é a proposta, não o problema
Um modelo de 1,2 bilhão de parâmetros não é pequeno por acidente — é pequeno por design. A descrição oficial fala em "inferência eficiente em borda" e "suporte amplo de runtime". Traduzindo: ele foi feito para rodar em celular, em gateway IoT, em firmware com NPU de baixa potência. Não foi feito para você chamar de um servidor e pagar por token. O preço de entrada e saída sendo zero reforça isso: ele existe no catálogo como ponto de distribuição, não como competidor de API.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O topo do catálogo hoje é ocupado por Xiaomi MiMo-V2-Flash (IQ 34,024), OpenAI o3 (31,096), Claude Haiku 4.5 (29,892), gpt-oss-120b (24,126) e Mistral Devstral 2 (19,242). O LFM2.5 está em outra categoria — quase outra modalidade de uso.
Os pares de verdade
Se você está mesmo olhando para modelos pequenos, com peso aberto ou custo baixo, o LFM2.5 tem concorrentes mais fortes na mesma prateleira. A diferença entre eles está em três eixos: capacidade bruta, custo por token e abertura dos pesos.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| LFM2.5-1.2B-Instruct (free) (o novo) | 2.3 | 0 | 0 | 33k |
| LFM2.5-1.2B-Thinking (free) | 2.3 | 0 | 0 | 33k |
| Ministral 3 3B 2512 | 7.1 | 0.1 | 0.1 | 131k |
| Granite 4.0 Micro | 2.0 | 0.017 | 0.112 | 131k |
| Nova Micro 1.0 | 4.4 | 0.035 | 0.14 | 128k |
O Ministral 3B da Mistral tem 3 bilhões de parâmetros, custa US$ 0,10 por milhão de tokens em entrada e saída, tem visão e marca IQ 7,074 — mais que o triplo do LFM2.5. O Granite 4.0 Micro da IBM também tem 3B parâmetros, custa US$ 0,017 na entrada e US$ 0,112 na saída, e marca IQ 1,952 — parecido, mas com contexto de 131 mil tokens em vez de 32K. O Nova Micro 1.0 da Amazon, único do grupo com pesos fechados, fica em IQ 4,416 a US$ 0,035/US$ 0,140 — quase o dobro de inteligência por um custo trivial. O irmão "Thinking" da própria LiquidAI, o LFM2.5-1.2B-Thinking, também grátis e com 1,2B, marca IQ 2,341 — marginalmente acima, com foco em tarefas agenticas leves.
Quando vale testar
- Você está prototipando um agente ou chat que vai rodar on-device, não na nuvem.
- Você precisa de pesos abertos para redistribuir dentro do seu app, firmware ou appliance.
- Você quer comparar modelos sub-2B para inferência em CPU ou NPU de baixa potência.
- Você está montando um pipeline de RAG ou extração em que o modelo precisa rodar localmente por questão de privacidade ou latência.
Quando não vale
- Qualquer carga de API em que a qualidade da resposta importa — resumo executivo, código de produção, atendimento ao cliente final. Nesses casos, um modelo três vezes mais inteligente por US$ 0,10 por milhão de tokens já está barato demais para compensar o LFM2.5.
- Aplicações com contexto longo pesado: 32K tokens é pouco se você está acostumado com 128K ou 131K dos concorrentes diretos.
- Benchmark interno seu já mostrou que modelos sub-3B não fecham a sua tarefa. Não tem motivo para testar mais um.
No gráfico de custo-benefício, o LFM2.5-1.2B-Instruct aparece no canto esquerdo — preço zero, capacidade mínima. Isso não é problema; é a posição correta para um modelo que nasceu para rodar dentro de hardware, não para competir por chamadas de API.
A implicação prática é simples: se o seu gargalo é "onde eu rodo isso sem mandar dado para a nuvem", baixe os pesos e teste. Se o seu gargalo é "qual modelo eu chamo na minha API para responder melhor ao usuário", passe direto — economize seu tempo e vá de Ministral 3B, Haiku 4.5 ou qualquer coisa três andares acima nessa régua.
Baixe os pesos do LFM2.5 e teste só se o seu gargalo é rodar IA localmente em device; se o gargalo é qualidade de resposta via API, pule direto para Ministral 3B, Haiku 4.5 ou superior.
Perguntas frequentes
LFM2.5-1.2B-Instruct serve para que tipo de projeto?
Ele foi feito para inferência em borda: rodar localmente em celular, gateway IoT ou appliance com NPU de baixa potência. Os pesos são abertos e o preço é zero, o que combina com redistribuição em firmware ou apps sensíveis a latência e privacidade.
Qual a diferença entre o LFM2.5-1.2B-Instruct e a versão Thinking?
A versão Thinking é focada em raciocínio e tarefas agenticas leves, como RAG e extração de dados, também com 1,2B parâmetros e gratuita. O IQ dela é marginalmente maior (2,341 contra 2,299) e ela é a escolha dentro da família para quem precisa de cadeia de raciocínio simples em device.
Vale trocar o Haiku 4.5 ou o Ministral 3B pelo LFM2.5?
Não, se você chama esses modelos via API. O Haiku 4.5 tem IQ 29,892 e o Ministral 3B tem IQ 7,074 — ambos esmagam o LFM2.5 em capacidade bruta. O LFM2.5 só faz sentido quando rodar localmente é requisito, não opção.