FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Ling 3.0 Flash Fin chega grátis e focado em finanças: o que sobra na sua fatura

Modelo da InclusionAI é uma variante MoE de 124B parâmetros com 5,1B ativos, voltada para investimento — e não tem preço publicado porque não cobra.

Redação FalaVIP IA 3 min de leitura
0US$ por milhão de tokens (entrada e saída)
262.144tokens de contexto
5,1B / 124Bparâmetros ativos / total (MoE)

O preço que não está no release

A InclusionAI colocou no ar hoje o Ling 3.0 Flash Fin (free) e o detalhe que importa para quem paga API está logo na ficha: tarifa de entrada e de saída em US$ 0 por milhão de tokens. Em outras palavras, é gratuito. Não é promoção por tempo limitado nem faixa promocional — o campo free veio marcado como verdadeiro no catálogo, e os valores de in_per_m e out_per_m saíram zerados. Quando um agregador zera os dois campos assim, costuma significar que o provedor está bancando o custo para distribuir o modelo. Para você, isso muda a conta do mês de um jeito direto: cada requisição que você migrar para ele deixa de gastar dólar.

O que é, afinal, esse modelo

A descrição oficial trata o Ling 3.0 Flash Fin como um modelo focado em finanças, construído em cima do Ling 3.0 Flash com arquitetura mixture-of-experts: 5,1 bilhões de parâmetros ativos dentro de um total de 124 bilhões. Pense em um escritório com 124 especialistas sentados à mesa, mas só cinco respondem a cada pergunta — você paga (em computação) como se tivesse contratado os cinco, e os outros 119 ficam quietos. É a mesma receita que DeepSeek, Mistral e Qwen vêm usando para entregar modelos grandes sem cobrar caro. A janela de contexto é de 262.144 tokens, o que dá folga para colar relatórios longos, balanços inteiros ou um trimestre de comunicados sem precisar fragmentar.

Preço de saída (US$ por milhão de tokens)
Claude Opus 525Claude Fable 550GPT-5.6 Sol10DeepSeek V4 Flash 07310,18GLM 5.3 Flash0,25US$/M
Fonte: OpenRouter

Onde ele se encaixa no tabuleiro de hoje

O catálogo tem 562 modelos listados, vindos de 70 creators diferentes, e nos últimos 30 dias foram lançados 40. É um mercado lotado. No topo por inteligência, o ranking de hoje tem Claude Opus 5 (IQ 63,053) da Anthropic na liderança, com Claude Fable 5 logo atrás (62,073) e GPT-5.6 Sol da OpenAI em terceiro (60,93). São modelos pagos, com tarifa de saída entre US$ 10 e US$ 50 por milhão de tokens. O Ling 3.0 Flash Fin entra nesse cenário sem nota de inteligência publicada no catálogo — iq veio nulo — então não dá para afirmar que compete em capacidade com o topo. O que dá para afirmar é que ele custa zero e foi desenhado para um nicho específico.

Índice de inteligência (Artificial Analysis)
Claude Opus 563,1Claude Fable 562,1GPT-5.6 Sol60,9DeepSeek V4 Flash 073151,8GLM 5.3 Flash57,5índice
Fonte: Artificial Analysis

Para quem ele vale — e para quem não muda nada

Se o seu trabalho envolve ler prospectos, resumir fatos relevantes, classificar comunicados ou puxar métricas de balanços, vale testar. Modelos focados em domínio costumam ganhar do generalista em tarefas do próprio domínio, mesmo com IQ menor no agregado. Para quem está construindo um agente genérico, um copilot de código ou qualquer coisa que dependa de raciocínio amplo, o Fin não substitui o modelo principal — ele entra como ferramenta auxiliar, mais ou menos como um dicionário de finanças que não custa nada consultar.

Ficha técnica — Ling 3.0 Flash Fin (free)
CampoValor
Identificadorinclusionai/ling-3.0-flash-fin:free
Criadorinclusionai
Preço de entradaUS$ 0.000 / M tokens
Preço de saídaUS$ 0.000 / M tokens
Janela de contexto262k
Modalidadetext->text

Comparativo honesto com o que já existia

A alternativa mais barata acima de IQ 45 hoje é o DeepSeek V4 Flash 0731, a US$ 0,18 por milhão de tokens de saída, seguido pelo GLM 5.3 Flash da Z.ai a US$ 0,25 e pelo MiniMax M3 a US$ 1,20. São preços quase simbólicos, mas não são zero. O Ling 3.0 Flash Fin entra abaixo de todos eles — literalmente no piso do catálogo. A diferença prática: se você roda 10 milhões de tokens de saída por mês no DeepSeek V4 Flash, gasta US$ 1,80. No Ling Fin, gasta US$ 0. Em escala, some.

Inteligência × preço de saída
Claude Opus 5Claude Fable 5GPT-5.6 SolDeepSeek V4 Flash 0731GLM 5.3 FlashUS$ por milhão (saída, escala log)índice de inteligência
Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Ling 3.0 Flash Fin (free) (o novo)00262k
Claude Opus 563.15251M
Claude Fable 562.110501M
GPT-5.6 Sol60.92101.05M
DeepSeek V4 Flash 073151.80.0650.181.31M
GLM 5.3 Flash57.50.0750.251.31M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

O que falta saber antes de colocar em produção

Três campos vieram nulos na ficha e merecem atenção: país de origem, velocidade e corte de conhecimento. Sem country, não dá para cravar jurisdição dos dados — relevante se você está em ambiente regulado. Sem speed, não dá para comparar latência com o DeepSeek V4 Flash ou o GLM 5.3 Flash antes de medir. E sem knowledge_cutoff, você não sabe até que data o modelo conhece o mercado — em finanças, isso muda resultado. Antes de migrar carga real, peça esses números ao provider ou meça você mesmo com um conjunto de teste do seu próprio domínio.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Opus 563.125
Claude Fable 562.150
GPT-5.6 Sol60.910
Grok 4.660.96
Kimi K359.715
Entre os 562 modelos disponíveis no catálogo nesta data.

Implicação prática

Não troque seu modelo principal por este. Adote o Ling 3.0 Flash Fin como a primeira camada de tarefas financeiras repetitivas — triagem de documentos, extração de números, classificação de eventos — e mantenha o modelo de topo só para o que exige raciocínio pesado. É a forma de tirar proveito do preço zero sem descobrir, no meio do caminho, que o modelo não cobre o que você precisa.

Em uma frase

Use o Ling 3.0 Flash Fin como camada gratuita para tarefas financeiras repetitivas e mantenha o modelo de topo só para o que exige raciocínio pesado.

Perguntas frequentes

O Ling 3.0 Flash Fin é mesmo gratuito?

Sim, segundo o catálogo o modelo tem `free: true` e tarifa de US$ 0 por milhão de tokens tanto na entrada quanto na saída. Não há faixa promocional registrada.

Qual a diferença entre os 5,1B ativos e os 124B totais?

É arquitetura mixture-of-experts: o modelo tem 124B parâmetros no total, mas só 5,1B são ativados por inferência. Você roda com o custo computacional dos 5,1B, não dos 124B.

Ele serve para tarefas fora de finanças?

Foi descrito como focado em finanças e construído sobre o Ling 3.0 Flash. Sem nota de inteligência publicada no catálogo, não dá para afirmar que compete com modelos generalistas de topo em outras tarefas.

Leia também