Mercury 2 da Inception sai por US$ 0,75 o milhão de saída e aposta em velocidade
É o primeiro LLM de raciocínio por difusão, mas o índice de inteligência de 21,9 coloca ele longe do topo do catálogo
A Inception colocou no catálogo hoje um modelo que não joga pelo mesmo jogo dos concorrentes. O Mercury 2 é anunciado como o primeiro LLM de raciocínio baseado em difusão (dLLM): em vez de gerar um token por vez, como todo mundo faz desde o GPT-2, ele produz e refina vários tokens em paralelo. É uma mudança de arquitetura, não de marketing — mas o que importa para quem paga a fatura é outra pergunta.
O que a Inception está cobrando
O preço de saída é US$ 0,75 por milhão de tokens. O de entrada, US$ 0,25. Tem cache por US$ 0,025. Não é grátis. Para colocar em perspectiva: o Gemini 3.1 Pro Preview, que lidera o índice de inteligência do catálogo, sai por US$ 12 o milhão de tokens de saída — 16 vezes mais caro que o Mercury 2. O GPT-5.3-Codex, segundo colocado, sai por US$ 14.
A conta, porém, tem outro lado.
O índice de inteligência não acompanha o preço baixo
O Mercury 2 marca 21,9 no índice de inteligência da Artificial Analysis. É um número honesto para um modelo de raciocínio pequeno, mas está bem abaixo do topo. O Gemini 3.1 Pro Preview está em 47,7. O GPT-5.3-Codex, em 45,5. O Claude Sonnet 4.6, em 35,1. Até o Qwen3.5 397B A17B, que custa US$ 2,34 o milhão de saída, está à frente com 34,3.
Em outras palavras: você está pagando barato, mas está levando um modelo que não está entre os mais capazes. A pergunta que você precisa responder antes de testar é para quê.
Velocidade é o argumento de venda — e aqui ele brilha
A Inception declara 669 tokens por segundo. Isso é alto. É o tipo de número que faz diferença em tarefas onde o tempo de resposta pesa mais que a profundidade da resposta: geração de código em autocomplete, sumarização em streaming, agentes que precisam iterar rápido. O Mercury 2 é um modelo de raciocínio, então não é um "burro rápido" — mas também não vai ganhar o Claude Sonnet 4.6 em qualidade de resposta.
| Campo | Valor |
|---|---|
| Identificador | inception/mercury-2 |
| Criador | inception |
| Preço de entrada | US$ 0.250 / M tokens |
| Preço de saída | US$ 0.750 / M tokens |
| Janela de contexto | 128k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.025 / M (90% de desconto) |
| Índice de inteligência (AA) | 21.9 |
| Índice de código | 31.1 |
| Índice agêntico | 9.5 |
| Pesos | fechados |
| Velocidade de saída | 669 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
A nota de raciocínio é a peça que separa ele dos modelos não-reasoning baratos que já existem no catálogo. É o que justifica pagar US$ 0,75 em vez de US$ 0,30, se você precisa que o modelo pense antes de responder.
Onde ele se encaixa no tabuleiro
O catálogo hoje tem mais de 353 modelos listados, 53 criadores, e 26 lançamentos nos últimos 30 dias. O Mercury 2 entra como uma curiosidade técnica vinda de uma empresa americana pouco conhecida e com nota de inteligência que não ameaça o topo. Não é o modelo que vai tirar o Gemini 3.1 Pro Preview da liderança.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Mercury 2 (o novo) | 21.9 | 0.25 | 0.75 | 128k |
| Gemini 3.1 Pro Preview | 47.7 | 2 | 12 | 1.05M |
| GPT-5.3-Codex | 45.5 | 1.75 | 14 | 400k |
| Claude Sonnet 4.6 | 35.1 | 3 | 15 | 1M |
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
Para quem vale e para quem não muda nada
Vale a pena testar se você roda pipelines onde latência e custo dominam — classificação em massa, geração de rascunhos, pré-processamento para um modelo maior, autocomplete de código. A combinação de raciocínio + velocidade + preço baixo é rara.
Não muda nada se você está usando o Gemini 3.1 Pro ou o GPT-5.3-Codex para tarefas onde a qualidade da resposta é o que importa. O salto de 21,9 para 47,7 de índice de inteligência não se compensa com velocidade em fluxo de trabalho que depende de acerto.
O que fazer com isso hoje
Se você já tem um workload rodando em modelo pequeno e barato, vale rodar o Mercury 2 no mesmo benchmark interno e comparar latência e qualidade. Se você está pagando caro por um modelo grande para tarefas simples, o Mercury 2 é candidato a substituir parte desse gasto — não pela inteligência, mas pelo preço e pela velocidade. A Inception acertou no ângulo técnico; agora é ver se o dLLM aguenta produção real.
Teste o Mercury 2 em workloads sensíveis a latência e custo; não substitua seu modelo principal por ele sem comparar qualidade no seu caso de uso.
Perguntas frequentes
O que é um LLM de difusão (dLLM)?
É um modelo que gera vários tokens em paralelo e refina a saída aos poucos, em vez de produzir um token por vez como os LLMs tradicionais. O Mercury 2 é o primeiro modelo de raciocínio a usar essa abordagem, segundo a Inception.
Quanto custa o Mercury 2 da Inception?
US$ 0,25 por milhão de tokens de entrada, US$ 0,75 por milhão de tokens de saída e US$ 0,025 por milhão de tokens em cache. É mais barato que o Gemini 3.1 Pro Preview (US$ 12) e o GPT-5.3-Codex (US$ 14), mas com índice de inteligência bem abaixo.
Mercury 2 é melhor que Gemini ou GPT?
Não. O índice de inteligência do Mercury 2 é 21,9 contra 47,7 do Gemini 3.1 Pro Preview e 45,5 do GPT-5.3-Codex. O diferencial dele é velocidade (669 tokens/s declarados) e preço, não capacidade bruta.