Ling-3.0-flash é 19 vezes mais barato que o rival — e ninguém testou
Modelo MoE de 124B parâmetros da InclusionAI estreia a US$ 0,063 por milhão de tokens de saída, mas o catálogo não traz índice de inteligência nem benchmark publicado.
O preço que parece erro de digitação
US$ 0,063 por milhão de tokens de saída. Sessenta e três milésimos de dólar. É o que a InclusionAI está cobrando pelo Ling-3.0-flash, modelo que entrou no catálogo hoje.
Para você não se perder no zero: o modelo mais barato que já estava disponível — o MiniMax M3 — custava US$ 1,20 pelo mesmo milhão. O Ling-3.0-flash sai por 19 vezes menos. Contra o líder do ranking, Claude Fable 5, a diferença chega a quase 800 vezes.
O que está por trás do número
A ficha técnica descreve um modelo Mixture-of-Experts de 124 bilhões de parâmetros, com cerca de 5,1 bilhões ativados por token. Pense num call center com 124 atendentes no quadro: para cada chamada, só uns 5 pegam o telefone. Os outros ficam de prontidão, sem gastar processamento. É assim que o modelo entrega capacidade grande sem cobrar caro por isso.
A janela de contexto é de 262 mil tokens. O preço de cache é ainda mais agressivo: US$ 0,0042 por milhão — quase 15 vezes mais barato que a entrada normal. Existe ainda uma versão gratuita (Ling-3.0-flash:free), mesma janela, mesmo modelo, zero na fatura.
| Campo | Valor |
|---|---|
| Identificador | inclusionai/ling-3.0-flash |
| Criador | inclusionai |
| Preço de entrada | US$ 0.021 / M tokens |
| Preço de saída | US$ 0.063 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.004 / M (80% de desconto) |
O que não está na ficha
Aqui mora o problema. O catálogo não traz índice de inteligência para o Ling-3.0-flash. Não há nota de coding, agentic, raciocínio ou qualquer benchmark publicado. É um modelo que chega cobrando 19 vezes menos que a alternativa mais barata — sem entregar um número para você comparar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Kimi K3 | 59.7 | 15 |
| GPT-5.6 Terra | 56.6 | 12 |
| Grok 4.5 | 55.8 | 6 |
O topo do mercado segue com Claude Fable 5 (IQ 62,073, US$ 50/M de saída), GPT-5.6 Sol (IQ 60,93, US$ 10/M) e Kimi K3 (IQ 59,699, US$ 15/M). Entre os baratos com IQ acima de 45, aparecem GPT-5.6 Luna (IQ 52,318, US$ 1,20), MiniMax M3 (IQ 45,397, US$ 1,20) e DeepSeek V4 Pro (IQ 45,268, US$ 1,74).
O Ling-3.0-flash entra abaixo de todos em preço. Mas sem IQ, ele fica de fora do gráfico de custo-benefício — não há coordenada Y para plotar.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Ling-3.0-flash (o novo) | — | 0.021 | 0.063 | 262k |
| Claude Fable 5 | 62.1 | 10 | 50 | 1M |
| GPT-5.6 Sol | 60.9 | 2 | 10 | 1.05M |
| Kimi K3 | 59.7 | 3 | 15 | 1.05M |
| MiniMax M3 | 45.4 | 0.3 | 1.2 | 1.05M |
| GPT-5.6 Luna | 52.3 | 0.2 | 1.2 | 1.05M |
Para quem faz sentido
Se você roda agente que queima muito token em tarefa de baixo risco — classificação, extração, formatação, resumo simples — o Ling-3.0-flash é uma aposta agressiva em custo. A versão gratuita elimina o risco do primeiro teste.
Se o que você precisa é qualidade comprovada em código, raciocínio ou tarefa agentic complexa, esse modelo não responde hoje. Não dá para saber se ele entrega 60 de IQ ou 35. A única saída é rodar sua própria avaliação antes de colocar em produção.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| Ling-3.0-flash (free) | 0 | 0 | 262k |
O que fazer na prática
A InclusionAI apostou em preço como argumento de entrada. Faz sentido: sem benchmark, preço é o único número que se compara sem rodar teste. Se você já tem pipeline de avaliação próprio, vale incluir o Ling-3.0-flash na próxima rodada. Se não tem, o mais seguro é esperar a primeira avaliação independente aparecer — ou começar pela versão gratuita e medir por conta própria.
Preço 19x menor não é vantagem se você não consegue medir a qualidade: rode a versão gratuita do Ling-3.0-flash na sua própria avaliação antes de migrar qualquer carga.
Perguntas frequentes
O Ling-3.0-flash tem benchmark publicado?
Não. O catálogo não traz índice de inteligência nem notas de coding, agentic ou raciocínio para esse modelo. É preciso rodar avaliação própria para saber onde ele se posiciona.
Quanto custa o Ling-3.0-flash na API?
US$ 0,063 por milhão de tokens de saída, com entrada a US$ 0,021 e cache a US$ 0,0042 por milhão. Há também a versão Ling-3.0-flash:free, com a mesma janela de 262 mil tokens.
O que significa MoE na prática para quem paga a conta?
Mixture-of-Experts: o modelo tem 124 bilhões de parâmetros no total, mas ativa só cerca de 5,1 bilhões por token. Isso reduz o custo de inferência — e, portanto, o preço na API — sem necessariamente reduzir a capacidade do modelo.