Mercury 2 da Inception chega cobrando US$ 0,75 por milhão de saída
Modelo de difusão promete velocidade absurda, mas o índice de inteligência fica em 21,9 — abaixo de alternativas abertas bem mais baratas.
O que o Mercury 2 entrega que os outros não
Você viu o número de velocidade e ficou curioso: 669 tokens por segundo. É quase cinco vezes o ritmo do GPT-OSS-120B da OpenAI (155 tok/s) e mais que o triplo do Qwen3 Next 80B Thinking (197 tok/s). Em tarefas onde cada segundo conta — geração de log, varredura de código, respostas curtas em chat ao vivo — esse delta muda a sensação do produto.
A Inception chegou lá com uma escolha arquitetural incomum: em vez de gerar tokens um atrás do outro, o Mercury 2 refina vários tokens em paralelo. É um modelo de difusão aplicado a texto, e é o primeiro desse tipo com capacidade de raciocínio. O catálogo descreve como "reasoning diffusion LLM (dLLM)". Pense na diferença entre datilografar palavra por palavra e revisar uma página inteira de cada vez — o trabalho de revisão paralela é o que permite o salto de velocidade.
Onde o marketing tropeça
Velocidade não é inteligência. O índice do Mercury 2 hoje é 21,896 — bem abaixo do GPT-OSS-120B (24,126), do Qwen3.5-35B-A3B (24,322) e distante do topo da tabela, onde Gemini 3.1 Pro Preview marca 47,738. Em coding, o Mercury 2 fica em 31,113; o Qwen3 Coder Next, lançado um mês antes, marca 36,232 com pesos abertos. Em agentic, a diferença é ainda mais dura: 9,458 contra 13,425 do GPT-OSS-120B.
Traduzindo o preço: US$ 0,25 de entrada e US$ 0,75 de saída por milhão de tokens. É mais barato que o Gemini 3.1 Pro Preview (US$ 12 de saída) e que o GPT-5.3-Codex (US$ 14), mas não é a opção mais barata da prateleira. O GPT-OSS-120B cobra US$ 0,17 de saída; o Qwen3 Coder Next, US$ 0,80. Em outras palavras, o Mercury 2 não é o bargain bin — é um produto intermediário com um diferencial de velocidade.
Para quem vale — e para quem não muda nada
Vale se você roda um workload onde latência é o gargalo: autocomplete em IDE, respostas em tempo real em atendimento, geração de rascunhos longos que precisam ser entregues rápido. Nesses cenários, pagar US$ 0,75 por milhão para ganhar 4x de velocidade pode compensar.
Não vale se o que importa é acerto bruto. O GPT-OSS-120B entrega índice mais alto (24,1), é mais barato na saída (US$ 0,17) e ainda vem com pesos abertos — você pode hospedar, fazer fine-tuning ou inspecionar. Para coding agentic sério, o Qwen3 Coder Next tem 36,2 de coding e custa US$ 0,80 de saída, com pesos abertos. O Mercury 2 só ganha quando a régua é velocidade.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Mercury 2 (o novo) | 21.9 | 0.25 | 0.75 | 128k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| Qwen3 Coder Next | 21.3 | 0.12 | 0.8 | 262k |
| Qwen3 Next 80B A3B Thinking | 16.9 | 0.15 | 1.2 | 262k |
| Qwen3.5-35B-A3B | 24.3 | 0.25 | 1.25 | 262k |
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
O tabuleiro hoje
O catálogo lista 353 modelos ativos de 53 criadores, com 26 lançamentos nos últimos 30 dias. O topo de inteligência segue concentrado em três casas: Google (47,7), OpenAI (45,5) e Anthropic (35,1). A Inception entra por uma porta lateral — não disputa o topo de IQ, disputa o topo de velocidade. É uma jogada de nicho, não uma ameaça frontal.
| Campo | Valor |
|---|---|
| Identificador | inception/mercury-2 |
| Criador | inception |
| Preço de entrada | US$ 0.250 / M tokens |
| Preço de saída | US$ 0.750 / M tokens |
| Janela de contexto | 128k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.025 / M (90% de desconto) |
| Índice de inteligência (AA) | 21.9 |
| Índice de código | 31.1 |
| Índice agêntico | 9.5 |
| Pesos | fechados |
| Velocidade de saída | 669 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O que fazer com essa informação
Se sua fatura de API tem linha de "latência" ou "tempo de resposta" como métrica, teste o Mercury 2 num workload curto antes de migrar. Se a métrica é qualidade da resposta por dólar, mantenha o GPT-OSS-120B ou o Qwen3 Coder Next como default. E se você está montando um stack novo, considere o Mercury 2 como uma peça específica — não como modelo principal.
Use Mercury 2 quando velocidade é a métrica que aparece na fatura; para tudo o mais, o GPT-OSS-120B aberto e mais barato ainda entrega mais inteligência por dólar.
Perguntas frequentes
O que é um modelo de difusão para texto (dLLM)?
É um modelo que, em vez de gerar tokens um a um em sequência, produz e refina vários tokens em paralelo a cada passo. O Mercury 2 da Inception é o primeiro reasoning LLM a usar essa abordagem, o que explica a velocidade reportada de 669 tokens por segundo.
Mercury 2 é mais barato que GPT-5.3-Codex?
Sim, em preço de tabela: US$ 0,75 por milhão de tokens de saída contra US$ 14 do GPT-5.3-Codex. Mas o índice de inteligência do Mercury 2 é 21,9, enquanto o Codex marca 45,5 — então o barato sai caro em workloads que exigem raciocínio.
Mercury 2 tem pesos abertos?
Não. O catálogo lista open_weights como false. Se você precisa rodar localmente ou fazer fine-tuning, o GPT-OSS-120B (117B totais, 5,1B ativos) e o Qwen3 Coder Next (79,7B totais, 3B ativos) são as alternativas abertas no mesmo faixa de preço.