FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Mercury 2 da Inception sai por US$ 0,75 o milhão de saída e aposta em velocidade

É o primeiro LLM de raciocínio por difusão, mas o índice de inteligência de 21,9 coloca ele longe do topo do catálogo

Redação FalaVIP IA 3 min de leitura
US$ 0,75por milhão de tokens de saída
21,9índice de inteligência Artificial Analysis
669tokens por segundo declarados pela Inception

A Inception colocou no catálogo hoje um modelo que não joga pelo mesmo jogo dos concorrentes. O Mercury 2 é anunciado como o primeiro LLM de raciocínio baseado em difusão (dLLM): em vez de gerar um token por vez, como todo mundo faz desde o GPT-2, ele produz e refina vários tokens em paralelo. É uma mudança de arquitetura, não de marketing — mas o que importa para quem paga a fatura é outra pergunta.

O que a Inception está cobrando

O preço de saída é US$ 0,75 por milhão de tokens. O de entrada, US$ 0,25. Tem cache por US$ 0,025. Não é grátis. Para colocar em perspectiva: o Gemini 3.1 Pro Preview, que lidera o índice de inteligência do catálogo, sai por US$ 12 o milhão de tokens de saída — 16 vezes mais caro que o Mercury 2. O GPT-5.3-Codex, segundo colocado, sai por US$ 14.

Preço de saída (US$ por milhão de tokens)
Mercury 20,75Gemini 3.1 Pro Preview12GPT-5.3-Codex14Claude Sonnet 4.615US$/M
Fonte: OpenRouter

A conta, porém, tem outro lado.

O índice de inteligência não acompanha o preço baixo

O Mercury 2 marca 21,9 no índice de inteligência da Artificial Analysis. É um número honesto para um modelo de raciocínio pequeno, mas está bem abaixo do topo. O Gemini 3.1 Pro Preview está em 47,7. O GPT-5.3-Codex, em 45,5. O Claude Sonnet 4.6, em 35,1. Até o Qwen3.5 397B A17B, que custa US$ 2,34 o milhão de saída, está à frente com 34,3.

Índice de inteligência (Artificial Analysis)
Mercury 221,9Gemini 3.1 Pro Preview47,7GPT-5.3-Codex45,5Claude Sonnet 4.635,1índice
Fonte: Artificial Analysis

Em outras palavras: você está pagando barato, mas está levando um modelo que não está entre os mais capazes. A pergunta que você precisa responder antes de testar é para quê.

Inteligência × preço de saída
Mercury 2Gemini 3.1 Pro PreviewGPT-5.3-CodexClaude Sonnet 4.6US$ por milhão (saída, escala log)índice de inteligência

Velocidade é o argumento de venda — e aqui ele brilha

A Inception declara 669 tokens por segundo. Isso é alto. É o tipo de número que faz diferença em tarefas onde o tempo de resposta pesa mais que a profundidade da resposta: geração de código em autocomplete, sumarização em streaming, agentes que precisam iterar rápido. O Mercury 2 é um modelo de raciocínio, então não é um "burro rápido" — mas também não vai ganhar o Claude Sonnet 4.6 em qualidade de resposta.

Ficha técnica — Mercury 2
CampoValor
Identificadorinception/mercury-2
Criadorinception
Preço de entradaUS$ 0.250 / M tokens
Preço de saídaUS$ 0.750 / M tokens
Janela de contexto128k
Modalidadetext->text
Leitura de cacheUS$ 0.025 / M (90% de desconto)
Índice de inteligência (AA)21.9
Índice de código31.1
Índice agêntico9.5
Pesosfechados
Velocidade de saída669 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

A nota de raciocínio é a peça que separa ele dos modelos não-reasoning baratos que já existem no catálogo. É o que justifica pagar US$ 0,75 em vez de US$ 0,30, se você precisa que o modelo pense antes de responder.

Onde ele se encaixa no tabuleiro

O catálogo hoje tem mais de 353 modelos listados, 53 criadores, e 26 lançamentos nos últimos 30 dias. O Mercury 2 entra como uma curiosidade técnica vinda de uma empresa americana pouco conhecida e com nota de inteligência que não ameaça o topo. Não é o modelo que vai tirar o Gemini 3.1 Pro Preview da liderança.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Mercury 2 (o novo)21.90.250.75128k
Gemini 3.1 Pro Preview47.72121.05M
GPT-5.3-Codex45.51.7514400k
Claude Sonnet 4.635.13151M
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 353 modelos disponíveis no catálogo nesta data.

Para quem vale e para quem não muda nada

Vale a pena testar se você roda pipelines onde latência e custo dominam — classificação em massa, geração de rascunhos, pré-processamento para um modelo maior, autocomplete de código. A combinação de raciocínio + velocidade + preço baixo é rara.

Não muda nada se você está usando o Gemini 3.1 Pro ou o GPT-5.3-Codex para tarefas onde a qualidade da resposta é o que importa. O salto de 21,9 para 47,7 de índice de inteligência não se compensa com velocidade em fluxo de trabalho que depende de acerto.

O que fazer com isso hoje

Se você já tem um workload rodando em modelo pequeno e barato, vale rodar o Mercury 2 no mesmo benchmark interno e comparar latência e qualidade. Se você está pagando caro por um modelo grande para tarefas simples, o Mercury 2 é candidato a substituir parte desse gasto — não pela inteligência, mas pelo preço e pela velocidade. A Inception acertou no ângulo técnico; agora é ver se o dLLM aguenta produção real.

Em uma frase

Teste o Mercury 2 em workloads sensíveis a latência e custo; não substitua seu modelo principal por ele sem comparar qualidade no seu caso de uso.

Perguntas frequentes

O que é um LLM de difusão (dLLM)?

É um modelo que gera vários tokens em paralelo e refina a saída aos poucos, em vez de produzir um token por vez como os LLMs tradicionais. O Mercury 2 é o primeiro modelo de raciocínio a usar essa abordagem, segundo a Inception.

Quanto custa o Mercury 2 da Inception?

US$ 0,25 por milhão de tokens de entrada, US$ 0,75 por milhão de tokens de saída e US$ 0,025 por milhão de tokens em cache. É mais barato que o Gemini 3.1 Pro Preview (US$ 12) e o GPT-5.3-Codex (US$ 14), mas com índice de inteligência bem abaixo.

Mercury 2 é melhor que Gemini ou GPT?

Não. O índice de inteligência do Mercury 2 é 21,9 contra 47,7 do Gemini 3.1 Pro Preview e 45,5 do GPT-5.3-Codex. O diferencial dele é velocidade (669 tokens/s declarados) e preço, não capacidade bruta.

Leia também