Ling 3.0 Flash Fin chega grátis e focado em finanças: o que sobra na sua fatura
Modelo da InclusionAI é uma variante MoE de 124B parâmetros com 5,1B ativos, voltada para investimento — e não tem preço publicado porque não cobra.
O preço que não está no release
A InclusionAI colocou no ar hoje o Ling 3.0 Flash Fin (free) e o detalhe que importa para quem paga API está logo na ficha: tarifa de entrada e de saída em US$ 0 por milhão de tokens. Em outras palavras, é gratuito. Não é promoção por tempo limitado nem faixa promocional — o campo free veio marcado como verdadeiro no catálogo, e os valores de in_per_m e out_per_m saíram zerados. Quando um agregador zera os dois campos assim, costuma significar que o provedor está bancando o custo para distribuir o modelo. Para você, isso muda a conta do mês de um jeito direto: cada requisição que você migrar para ele deixa de gastar dólar.
O que é, afinal, esse modelo
A descrição oficial trata o Ling 3.0 Flash Fin como um modelo focado em finanças, construído em cima do Ling 3.0 Flash com arquitetura mixture-of-experts: 5,1 bilhões de parâmetros ativos dentro de um total de 124 bilhões. Pense em um escritório com 124 especialistas sentados à mesa, mas só cinco respondem a cada pergunta — você paga (em computação) como se tivesse contratado os cinco, e os outros 119 ficam quietos. É a mesma receita que DeepSeek, Mistral e Qwen vêm usando para entregar modelos grandes sem cobrar caro. A janela de contexto é de 262.144 tokens, o que dá folga para colar relatórios longos, balanços inteiros ou um trimestre de comunicados sem precisar fragmentar.
Onde ele se encaixa no tabuleiro de hoje
O catálogo tem 562 modelos listados, vindos de 70 creators diferentes, e nos últimos 30 dias foram lançados 40. É um mercado lotado. No topo por inteligência, o ranking de hoje tem Claude Opus 5 (IQ 63,053) da Anthropic na liderança, com Claude Fable 5 logo atrás (62,073) e GPT-5.6 Sol da OpenAI em terceiro (60,93). São modelos pagos, com tarifa de saída entre US$ 10 e US$ 50 por milhão de tokens. O Ling 3.0 Flash Fin entra nesse cenário sem nota de inteligência publicada no catálogo — iq veio nulo — então não dá para afirmar que compete em capacidade com o topo. O que dá para afirmar é que ele custa zero e foi desenhado para um nicho específico.
Para quem ele vale — e para quem não muda nada
Se o seu trabalho envolve ler prospectos, resumir fatos relevantes, classificar comunicados ou puxar métricas de balanços, vale testar. Modelos focados em domínio costumam ganhar do generalista em tarefas do próprio domínio, mesmo com IQ menor no agregado. Para quem está construindo um agente genérico, um copilot de código ou qualquer coisa que dependa de raciocínio amplo, o Fin não substitui o modelo principal — ele entra como ferramenta auxiliar, mais ou menos como um dicionário de finanças que não custa nada consultar.
| Campo | Valor |
|---|---|
| Identificador | inclusionai/ling-3.0-flash-fin:free |
| Criador | inclusionai |
| Preço de entrada | US$ 0.000 / M tokens |
| Preço de saída | US$ 0.000 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
Comparativo honesto com o que já existia
A alternativa mais barata acima de IQ 45 hoje é o DeepSeek V4 Flash 0731, a US$ 0,18 por milhão de tokens de saída, seguido pelo GLM 5.3 Flash da Z.ai a US$ 0,25 e pelo MiniMax M3 a US$ 1,20. São preços quase simbólicos, mas não são zero. O Ling 3.0 Flash Fin entra abaixo de todos eles — literalmente no piso do catálogo. A diferença prática: se você roda 10 milhões de tokens de saída por mês no DeepSeek V4 Flash, gasta US$ 1,80. No Ling Fin, gasta US$ 0. Em escala, some.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Ling 3.0 Flash Fin (free) (o novo) | — | 0 | 0 | 262k |
| Claude Opus 5 | 63.1 | 5 | 25 | 1M |
| Claude Fable 5 | 62.1 | 10 | 50 | 1M |
| GPT-5.6 Sol | 60.9 | 2 | 10 | 1.05M |
| DeepSeek V4 Flash 0731 | 51.8 | 0.065 | 0.18 | 1.31M |
| GLM 5.3 Flash | 57.5 | 0.075 | 0.25 | 1.31M |
O que falta saber antes de colocar em produção
Três campos vieram nulos na ficha e merecem atenção: país de origem, velocidade e corte de conhecimento. Sem country, não dá para cravar jurisdição dos dados — relevante se você está em ambiente regulado. Sem speed, não dá para comparar latência com o DeepSeek V4 Flash ou o GLM 5.3 Flash antes de medir. E sem knowledge_cutoff, você não sabe até que data o modelo conhece o mercado — em finanças, isso muda resultado. Antes de migrar carga real, peça esses números ao provider ou meça você mesmo com um conjunto de teste do seu próprio domínio.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Opus 5 | 63.1 | 25 |
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Grok 4.6 | 60.9 | 6 |
| Kimi K3 | 59.7 | 15 |
Implicação prática
Não troque seu modelo principal por este. Adote o Ling 3.0 Flash Fin como a primeira camada de tarefas financeiras repetitivas — triagem de documentos, extração de números, classificação de eventos — e mantenha o modelo de topo só para o que exige raciocínio pesado. É a forma de tirar proveito do preço zero sem descobrir, no meio do caminho, que o modelo não cobre o que você precisa.
Use o Ling 3.0 Flash Fin como camada gratuita para tarefas financeiras repetitivas e mantenha o modelo de topo só para o que exige raciocínio pesado.
Perguntas frequentes
O Ling 3.0 Flash Fin é mesmo gratuito?
Sim, segundo o catálogo o modelo tem `free: true` e tarifa de US$ 0 por milhão de tokens tanto na entrada quanto na saída. Não há faixa promocional registrada.
Qual a diferença entre os 5,1B ativos e os 124B totais?
É arquitetura mixture-of-experts: o modelo tem 124B parâmetros no total, mas só 5,1B são ativados por inferência. Você roda com o custo computacional dos 5,1B, não dos 124B.
Ele serve para tarefas fora de finanças?
Foi descrito como focado em finanças e construído sobre o Ling 3.0 Flash. Sem nota de inteligência publicada no catálogo, não dá para afirmar que compete com modelos generalistas de topo em outras tarefas.