Mercury 2 é 4× mais rápido e mais barato que o Qwen 3.5 35B-A3B
O modelo da Inception entrega 669 tokens por segundo e cache 10× mais barato. O Qwen responde com multimodal, pesos abertos e um índice de inteligência 11% maior.
Mercury 2 chegou ao catálogo no começo de março cobrando US$ 0,75 por milhão de tokens de saída. O Qwen3.5-35B-A3B, da Qwen, cobra US$ 1,25 pela mesma janela. Olhando só a tabela de preços, o veredito parece óbvio. Mas a conta tem mais colunas do que isso, e em duas delas o Qwen abre vantagem que o release da Inception não destaca.
O que cada modelo é, de verdade
Antes de preço, vale separar o que cada um faz — e onde cada um deixa de fora o que você precisa.
O Mercury 2 é um modelo de texto que se anuncia como o primeiro LLM de difusão para raciocínio. Em vez de gerar tokens um a um, ele refina vários em paralelo — a mesma família de técnica que move geradores de imagem, agora adaptada para texto. Resultado prático é bruto: 669 tokens por segundo, contra 167,5 do Qwen. Quatro vezes mais rápido. É um modelo fechado, vindo dos Estados Unidos.
O Qwen3.5-35B-A3B faz o movimento oposto. É multimodal — aceita texto, imagem e vídeo na entrada e devolve texto —, tem 36 bilhões de parâmetros totais com apenas 3 bilhões ativos por inferência (sparse MoE com atenção linear híbrida) e é open weights. Você baixa, roda, ajusta. Vem da China.
No índice de inteligência medido nesta data, o Qwen marca 24,322 contra 21,896 do Mercury 2. Em coding a diferença é maior: 36,977 contra 31,113 — quase 19% a mais. Em agentic, 11,823 contra 9,458, uma vantagem de 25%. Nas três dimensões o Qwen está na frente.
A conta por milhão de tokens
Vamos ao que dói no cartão.
Entrada é igual nos dois: US$ 0,25 por milhão. Onde eles divergem é na saída e no cache.
Saída do Mercury 2: US$ 0,75. Do Qwen: US$ 1,25. Diferença de 40% a favor da Inception. Cache do Mercury 2: US$ 0,025 por milhão. Do Qwen: US$ 0,25. São dez vezes mais barato. Preço blended publicado (50% entrada, 50% saída): US$ 0,375 do Mercury 2 contra US$ 0,6875 do Qwen — quase metade.
Se você tem um pipeline que martela o mesmo prompt repetidamente e a maior parte do tráfego é saída, Mercury 2 ganha na ponta do lápis. Se a entrada é multimodal, a conversa muda — porque esse terreno o Mercury 2 nem entra.
Velocidade e arquitetura: onde os números mentem
Quatro vezes mais rápido não é marketing — é mensurável. Em workflows onde a latência individual pesa (chat ao vivo, agentes que encadeiam dezenas de chamadas, geração em tempo real) o Mercury 2 entrega uma rodada inteira onde o Qwen ainda está na primeira metade.
Mas velocidade bruta esconde uma armadilha: o Mercury 2 é texto-only. Tudo que envolve processar uma imagem, um frame de vídeo ou um PDF com layout é território que o Qwen cobre e o Mercury 2 não. E o Qwen entrega contexto de 262.144 tokens, mais que o dobro dos 128.000 do Mercury 2. Para documentos longos, bases de código extensas ou sessões de agente que acumulam histórico, isso muda o jogo.
| Critério | Qwen3.5-35B-A3B | Mercury 2 |
|---|---|---|
| Índice de inteligência | 24.3 | 21.9 |
| Entrada US$/M | 0.25 | 0.25 |
| Saída US$/M | 1.25 | 0.75 |
| Contexto | 262k | 128k |
| Pesos abertos | sim | não |
| Velocidade (tok/s) | 168 | 669 |
| Índice de código | 37.0 | 31.1 |
| Índice agêntico | 11.8 | 9.5 |
Onde eles se encaixam no catálogo
Os dois vivem numa faixa de IQ abaixo dos 35. O topo do catálogo nesta data é Gemini 3.1 Pro Preview em 47,738 e GPT-5.3-Codex em 45,512 — ambos acima de US$ 12 por milhão de tokens de saída. Comparar Mercury 2 e Qwen com eles não é justo nem útil. O ponto é outro: dentro da faixa econômica, qual estratégia paga melhor.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
Para quem cada um ganha
Mercury 2 vence quando você precisa de:
- alta vazão de texto puro com latência baixa — batch de classificação, enriquecimento de dados, resumos longos em pipeline;
- cache de prompt agressivo — caches dez vezes mais baratos transformam prompts longos em economia real;
- experimentação com arquitetura de difusão para texto, área nova que vale testar antes que vire padrão.
Qwen3.5-35B-A3B vence quando você precisa de:
- entrada multimodal (imagem, vídeo) sem trocar de modelo na pipeline;
- auto-hospedagem ou fine-tune, já que os pesos são abertos e os 3 bilhões de parâmetros ativos rodam em hardware modesto;
- tarefas onde coding e raciocínio agentic pesam mais que latência pura;
- contexto de 262 mil tokens, mais que o dobro do concorrente.
Se você roda multimodal, quer open weights ou tem um caso de contexto longo, escolha Qwen e pare de olhar preço de saída. Se você queima texto puro em alto volume e latência é gargalo real, escolha Mercury 2 — é a melhor combinação de velocidade e preço abaixo de IQ 30 que o catálogo oferece hoje.
Para multimodal, contexto longo ou self-hosting, vá de Qwen 3.5 35B-A3B. Para texto puro em alto volume com latência apertada, vá de Mercury 2 — é a melhor relação velocidade/preço abaixo de IQ 30 que o catálogo oferece hoje.
Perguntas frequentes
Mercury 2 ou Qwen 3.5 35B-A3B para resumir documentos com imagem?
Qwen 3.5 35B-A3B. Ele é multimodal e aceita texto, imagem e vídeo como entrada. O Mercury 2 só processa texto, então qualquer PDF com layout, captura de tela ou foto precisa de outro modelo na pipeline antes.
Quanto custa rodar 1 milhão de tokens no Mercury 2?
US$ 0,375 no preço blended publicado pela Inception (50% entrada, 50% saída). Detalhado: US$ 0,25 por milhão de entrada, US$ 0,75 por milhão de saída, e US$ 0,025 por milhão para cache de prompt — dez vezes mais barato que o cache do Qwen.
Mercury 2 é open source?
Não. Mercury 2 é modelo fechado, sem pesos publicados. O Qwen 3.5 35B-A3B é open weights: você baixa, roda localmente e pode fazer fine-tune. São 36 bilhões de parâmetros totais com apenas 3 bilhões ativos — administrável em hardware de consumidor.