FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Ling-3.0-flash é 19 vezes mais barato que o rival — e ninguém testou

Modelo MoE de 124B parâmetros da InclusionAI estreia a US$ 0,063 por milhão de tokens de saída, mas o catálogo não traz índice de inteligência nem benchmark publicado.

Redação FalaVIP IA 2 min de leitura
US$ 0,063por milhão de tokens de saída
124B / 5,1Bparâmetros totais vs. ativos por token
19xmais barato que a alternativa mais barata do catálogo

O preço que parece erro de digitação

US$ 0,063 por milhão de tokens de saída. Sessenta e três milésimos de dólar. É o que a InclusionAI está cobrando pelo Ling-3.0-flash, modelo que entrou no catálogo hoje.

Para você não se perder no zero: o modelo mais barato que já estava disponível — o MiniMax M3 — custava US$ 1,20 pelo mesmo milhão. O Ling-3.0-flash sai por 19 vezes menos. Contra o líder do ranking, Claude Fable 5, a diferença chega a quase 800 vezes.

Preço de saída (US$ por milhão de tokens)
Ling-3.0-flash0,063Claude Fable 550GPT-5.6 Sol10Kimi K315MiniMax M31,2GPT-5.6 Luna1,2US$/M
Fonte: OpenRouter

O que está por trás do número

A ficha técnica descreve um modelo Mixture-of-Experts de 124 bilhões de parâmetros, com cerca de 5,1 bilhões ativados por token. Pense num call center com 124 atendentes no quadro: para cada chamada, só uns 5 pegam o telefone. Os outros ficam de prontidão, sem gastar processamento. É assim que o modelo entrega capacidade grande sem cobrar caro por isso.

A janela de contexto é de 262 mil tokens. O preço de cache é ainda mais agressivo: US$ 0,0042 por milhão — quase 15 vezes mais barato que a entrada normal. Existe ainda uma versão gratuita (Ling-3.0-flash:free), mesma janela, mesmo modelo, zero na fatura.

Ficha técnica — Ling-3.0-flash
CampoValor
Identificadorinclusionai/ling-3.0-flash
Criadorinclusionai
Preço de entradaUS$ 0.021 / M tokens
Preço de saídaUS$ 0.063 / M tokens
Janela de contexto262k
Modalidadetext->text
Leitura de cacheUS$ 0.004 / M (80% de desconto)

O que não está na ficha

Aqui mora o problema. O catálogo não traz índice de inteligência para o Ling-3.0-flash. Não há nota de coding, agentic, raciocínio ou qualquer benchmark publicado. É um modelo que chega cobrando 19 vezes menos que a alternativa mais barata — sem entregar um número para você comparar.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
GPT-5.6 Terra56.612
Grok 4.555.86
Entre os 518 modelos disponíveis no catálogo nesta data.

O topo do mercado segue com Claude Fable 5 (IQ 62,073, US$ 50/M de saída), GPT-5.6 Sol (IQ 60,93, US$ 10/M) e Kimi K3 (IQ 59,699, US$ 15/M). Entre os baratos com IQ acima de 45, aparecem GPT-5.6 Luna (IQ 52,318, US$ 1,20), MiniMax M3 (IQ 45,397, US$ 1,20) e DeepSeek V4 Pro (IQ 45,268, US$ 1,74).

Inteligência × preço de saída
Claude Fable 5GPT-5.6 SolKimi K3MiniMax M3GPT-5.6 LunaUS$ por milhão (saída, escala log)índice de inteligência

O Ling-3.0-flash entra abaixo de todos em preço. Mas sem IQ, ele fica de fora do gráfico de custo-benefício — não há coordenada Y para plotar.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Ling-3.0-flash (o novo)0.0210.063262k
Claude Fable 562.110501M
GPT-5.6 Sol60.92101.05M
Kimi K359.73151.05M
MiniMax M345.40.31.21.05M
GPT-5.6 Luna52.30.21.21.05M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

Para quem faz sentido

Se você roda agente que queima muito token em tarefa de baixo risco — classificação, extração, formatação, resumo simples — o Ling-3.0-flash é uma aposta agressiva em custo. A versão gratuita elimina o risco do primeiro teste.

Se o que você precisa é qualidade comprovada em código, raciocínio ou tarefa agentic complexa, esse modelo não responde hoje. Não dá para saber se ele entrega 60 de IQ ou 35. A única saída é rodar sua própria avaliação antes de colocar em produção.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
Ling-3.0-flash (free)00262k

O que fazer na prática

A InclusionAI apostou em preço como argumento de entrada. Faz sentido: sem benchmark, preço é o único número que se compara sem rodar teste. Se você já tem pipeline de avaliação próprio, vale incluir o Ling-3.0-flash na próxima rodada. Se não tem, o mais seguro é esperar a primeira avaliação independente aparecer — ou começar pela versão gratuita e medir por conta própria.

Em uma frase

Preço 19x menor não é vantagem se você não consegue medir a qualidade: rode a versão gratuita do Ling-3.0-flash na sua própria avaliação antes de migrar qualquer carga.

Perguntas frequentes

O Ling-3.0-flash tem benchmark publicado?

Não. O catálogo não traz índice de inteligência nem notas de coding, agentic ou raciocínio para esse modelo. É preciso rodar avaliação própria para saber onde ele se posiciona.

Quanto custa o Ling-3.0-flash na API?

US$ 0,063 por milhão de tokens de saída, com entrada a US$ 0,021 e cache a US$ 0,0042 por milhão. Há também a versão Ling-3.0-flash:free, com a mesma janela de 262 mil tokens.

O que significa MoE na prática para quem paga a conta?

Mixture-of-Experts: o modelo tem 124 bilhões de parâmetros no total, mas ativa só cerca de 5,1 bilhões por token. Isso reduz o custo de inferência — e, portanto, o preço na API — sem necessariamente reduzir a capacidade do modelo.

Leia também