Ling-2.6-flash entra cobrando 400 vezes menos que o Gemini 3.1 Pro Preview
Modelo estreia a US$ 0,03 por milhão de tokens de saída e sem nota de inteligência publicada no catálogo
O preço que destoa do resto
Imagine abrir a fatura da API e ver que o próximo milhão de tokens de saída custa US$ 0,03. É o que o inclusionAI cobra pelo Ling-2.6-flash, modelo que entrou no catálogo hoje. O Gemini 3.1 Pro Preview, que lidera o ranking de inteligência, cobra US$ 12 pelo mesmo milhão. Estamos falando de 400 vezes mais barato — não é "mais barato", é outra ordem de grandeza.
Onde o Gemini custa US$ 12, o Ling entrega 400 vezes mais saída pelo mesmo dinheiro. Em um agente que dispara milhares de inferências por dia, isso redefine o que cabe no orçamento mensal.
O que está dentro da caixa
A ficha diz: 104 bilhões de parâmetros totais, 7,4 bilhões ativos, contexto de 262 mil tokens e arquitetura pensada para agentes que precisam de resposta rápida e eficiência de tokens. É a descrição oficial do criador — "instant" é a palavra que eles usam. Modalidade texto para texto, sem multimodalidade no lançamento. Cache de prompt a US$ 0,002 por milhão, outro número que não aparece no topo do catálogo.
Os 7,4 bilhões ativos explicam parte do preço. Quando só uma fração dos parâmetros é acionada por token, o custo de inferência cai — e o provedor repassa a economia. É a mesma mecânica por trás de modelos como o Qwen3.5 397B A17B, que também ativa uma fração pequena do total.
| Campo | Valor |
|---|---|
| Identificador | inclusionai/ling-2.6-flash |
| Criador | inclusionai |
| Preço de entrada | US$ 0.010 / M tokens |
| Preço de saída | US$ 0.030 / M tokens |
| Janela de contexto | 262k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.002 / M (80% de desconto) |
A conta que ninguém quer fazer
A conta é simples e, ao mesmo tempo, incompleta. O Ling-2.6-flash custa US$ 0,01 por milhão de tokens de entrada, US$ 0,03 por milhão de tokens de saída e US$ 0,002 por milhão em cache.
Compare: o MiMo-V2-Omni, da Xiaomi, cobra US$ 2 por milhão de saída — 67 vezes mais. O GPT-5.3-Codex, da OpenAI, cobra US$ 14 por milhão — quase 467 vezes mais. Em volume mensal, a diferença paga um engenheiro júnior.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Ling-2.6-flash (o novo) | — | 0.01 | 0.03 | 262k |
| Gemini 3.1 Pro Preview | 47.7 | 2 | 12 | 1.05M |
| GPT-5.3-Codex | 45.5 | 1.75 | 14 | 400k |
| MiMo-V2-Omni | 35.9 | 0.4 | 2 | 262k |
O asterisco que muda tudo
Nenhum desses números é a história completa. O Ling-2.6-flash não tem nota de inteligência, nem de codificação, nem agentic publicada no catálogo hoje. Isso significa que o 400x é real, mas a comparação justa ainda não é possível. Você está comprando velocidade e preço de prateleira — não uma posição no ranking de IQ, que é liderado pelo Gemini 3.1 Pro Preview com 47,7 pontos, seguido do GPT-5.3-Codex com 45,5 e do próprio MiMo-V2-Omni da Xiaomi com 35,8.
O cache a US$ 0,002 por milhão também merece atenção. Para workflows que repetem grandes blocos de system prompt, o custo de cache acaba pesando mais que o de entrada. Estar nesse nível, com contexto de 262 mil tokens, é o tipo de combinação que abre espaço para pipelines longos de agente sem inflar a fatura.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Quando o catálogo não publica benchmark, a responsabilidade volta para o usuário. Quem rodar Ling-2.6-flash em produção vai descobrir, no próprio produto, se o modelo aguenta o tipo de raciocínio que o Gemini 3.1 Pro Preview entrega a US$ 12. É um experimento com dinheiro de verdade, não com marketing — e é exatamente assim que a maioria dos modelos baratos entra no mercado.
Para quem vale e para quem não muda nada
Vale para você se roda agentes de alto volume, testes A/B, workflows onde latência e custo por chamada importam mais que o pico de inteligência, ou se está prototipando antes de subir para um modelo de fronteira. O preço torna viável o que antes não cabia — geração de rascunhos, classificação, extração e sumarização em massa.
Não muda nada se o gargalo do seu sistema é qualidade de raciocínio, codificação pesada, ou se você já usa Gemini 3.1 Pro Preview com prompt caching e o custo está sob controle. Também não muda nada se você exige benchmark antes de adotar — e deveria exigir.
O catálogo fechou o dia com 400 modelos, 56 criadores e 26 lançamentos nos últimos 30 dias. Um criador novo entra cobrando US$ 0,03 por milhão de saída. O Ling-2.6-flash não disputa o trono do Gemini, mas abre uma faixa de preço que não existia para esse tipo de workload. Para a fatura no fim do mês, isso é o que pesa.
Coloque o Ling-2.6-flash primeiro no seu workload de maior volume e menor criticidade: o preço justifica o teste, mas sem benchmark público a decisão final é medida em produto, não em planilha.
Perguntas frequentes
O que é o Ling-2.6-flash?
Modelo de texto da inclusionAI com 104 bilhões de parâmetros totais, 7,4 bilhões ativos por inferência e contexto de 262 mil tokens. Foi listado no catálogo em 21 de abril de 2026, focado em agentes que pedem resposta rápida e baixo custo por token.
Quanto custa usar o Ling-2.6-flash na API?
US$ 0,01 por milhão de tokens de entrada, US$ 0,03 por milhão de tokens de saída e US$ 0,002 por milhão em cache. É cerca de 400 vezes mais barato na saída que o Gemini 3.1 Pro Preview, que cobra US$ 12 pelo mesmo milhão.
O Ling-2.6-flash tem benchmark público?
Não. O catálogo não publicou nota de inteligência, codificação ou agentic para o modelo na data de lançamento. A avaliação de qualidade precisa ser feita no próprio produto, com seus casos de uso reais.