FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Mercury 2 da Inception chega cobrando US$ 0,75 por milhão de saída

Modelo de difusão promete velocidade absurda, mas o índice de inteligência fica em 21,9 — abaixo de alternativas abertas bem mais baratas.

Redação FalaVIP IA 3 min de leitura
US$ 0,75por milhão de tokens de saída
669 tok/svelocidade reportada pelo catálogo
21,9índice de inteligência do Mercury 2

O que o Mercury 2 entrega que os outros não

Você viu o número de velocidade e ficou curioso: 669 tokens por segundo. É quase cinco vezes o ritmo do GPT-OSS-120B da OpenAI (155 tok/s) e mais que o triplo do Qwen3 Next 80B Thinking (197 tok/s). Em tarefas onde cada segundo conta — geração de log, varredura de código, respostas curtas em chat ao vivo — esse delta muda a sensação do produto.

A Inception chegou lá com uma escolha arquitetural incomum: em vez de gerar tokens um atrás do outro, o Mercury 2 refina vários tokens em paralelo. É um modelo de difusão aplicado a texto, e é o primeiro desse tipo com capacidade de raciocínio. O catálogo descreve como "reasoning diffusion LLM (dLLM)". Pense na diferença entre datilografar palavra por palavra e revisar uma página inteira de cada vez — o trabalho de revisão paralela é o que permite o salto de velocidade.

Preço de saída (US$ por milhão de tokens)
Mercury 20,75gpt-oss-120b0,17Qwen3 Coder Next0,8Qwen3 Next 80B A3B Thinking1,2Qwen3.5-35B-A3B1,25US$/M
Fonte: OpenRouter

Onde o marketing tropeça

Velocidade não é inteligência. O índice do Mercury 2 hoje é 21,896 — bem abaixo do GPT-OSS-120B (24,126), do Qwen3.5-35B-A3B (24,322) e distante do topo da tabela, onde Gemini 3.1 Pro Preview marca 47,738. Em coding, o Mercury 2 fica em 31,113; o Qwen3 Coder Next, lançado um mês antes, marca 36,232 com pesos abertos. Em agentic, a diferença é ainda mais dura: 9,458 contra 13,425 do GPT-OSS-120B.

Índice de inteligência (Artificial Analysis)
Mercury 221,9gpt-oss-120b24,1Qwen3 Coder Next21,3Qwen3 Next 80B A3B Thinking16,9Qwen3.5-35B-A3B24,3índice
Fonte: Artificial Analysis

Traduzindo o preço: US$ 0,25 de entrada e US$ 0,75 de saída por milhão de tokens. É mais barato que o Gemini 3.1 Pro Preview (US$ 12 de saída) e que o GPT-5.3-Codex (US$ 14), mas não é a opção mais barata da prateleira. O GPT-OSS-120B cobra US$ 0,17 de saída; o Qwen3 Coder Next, US$ 0,80. Em outras palavras, o Mercury 2 não é o bargain bin — é um produto intermediário com um diferencial de velocidade.

Inteligência × preço de saída
Mercury 2gpt-oss-120bQwen3 Coder NextQwen3 Next 80B A3B ThinkingQwen3.5-35B-A3BUS$ por milhão (saída, escala log)índice de inteligência

Para quem vale — e para quem não muda nada

Vale se você roda um workload onde latência é o gargalo: autocomplete em IDE, respostas em tempo real em atendimento, geração de rascunhos longos que precisam ser entregues rápido. Nesses cenários, pagar US$ 0,75 por milhão para ganhar 4x de velocidade pode compensar.

Não vale se o que importa é acerto bruto. O GPT-OSS-120B entrega índice mais alto (24,1), é mais barato na saída (US$ 0,17) e ainda vem com pesos abertos — você pode hospedar, fazer fine-tuning ou inspecionar. Para coding agentic sério, o Qwen3 Coder Next tem 36,2 de coding e custa US$ 0,80 de saída, com pesos abertos. O Mercury 2 só ganha quando a régua é velocidade.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Mercury 2 (o novo)21.90.250.75128k
gpt-oss-120b24.10.0370.17131k
Qwen3 Coder Next21.30.120.8262k
Qwen3 Next 80B A3B Thinking16.90.151.2262k
Qwen3.5-35B-A3B24.30.251.25262k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 353 modelos disponíveis no catálogo nesta data.

O tabuleiro hoje

O catálogo lista 353 modelos ativos de 53 criadores, com 26 lançamentos nos últimos 30 dias. O topo de inteligência segue concentrado em três casas: Google (47,7), OpenAI (45,5) e Anthropic (35,1). A Inception entra por uma porta lateral — não disputa o topo de IQ, disputa o topo de velocidade. É uma jogada de nicho, não uma ameaça frontal.

Ficha técnica — Mercury 2
CampoValor
Identificadorinception/mercury-2
Criadorinception
Preço de entradaUS$ 0.250 / M tokens
Preço de saídaUS$ 0.750 / M tokens
Janela de contexto128k
Modalidadetext->text
Leitura de cacheUS$ 0.025 / M (90% de desconto)
Índice de inteligência (AA)21.9
Índice de código31.1
Índice agêntico9.5
Pesosfechados
Velocidade de saída669 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O que fazer com essa informação

Se sua fatura de API tem linha de "latência" ou "tempo de resposta" como métrica, teste o Mercury 2 num workload curto antes de migrar. Se a métrica é qualidade da resposta por dólar, mantenha o GPT-OSS-120B ou o Qwen3 Coder Next como default. E se você está montando um stack novo, considere o Mercury 2 como uma peça específica — não como modelo principal.

Em uma frase

Use Mercury 2 quando velocidade é a métrica que aparece na fatura; para tudo o mais, o GPT-OSS-120B aberto e mais barato ainda entrega mais inteligência por dólar.

Perguntas frequentes

O que é um modelo de difusão para texto (dLLM)?

É um modelo que, em vez de gerar tokens um a um em sequência, produz e refina vários tokens em paralelo a cada passo. O Mercury 2 da Inception é o primeiro reasoning LLM a usar essa abordagem, o que explica a velocidade reportada de 669 tokens por segundo.

Mercury 2 é mais barato que GPT-5.3-Codex?

Sim, em preço de tabela: US$ 0,75 por milhão de tokens de saída contra US$ 14 do GPT-5.3-Codex. Mas o índice de inteligência do Mercury 2 é 21,9, enquanto o Codex marca 45,5 — então o barato sai caro em workloads que exigem raciocínio.

Mercury 2 tem pesos abertos?

Não. O catálogo lista open_weights como false. Se você precisa rodar localmente ou fazer fine-tuning, o GPT-OSS-120B (117B totais, 5,1B ativos) e o Qwen3 Coder Next (79,7B totais, 3B ativos) são as alternativas abertas no mesmo faixa de preço.

Leia também