FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Mercury 2 é 4× mais rápido e mais barato que o Qwen 3.5 35B-A3B

O modelo da Inception entrega 669 tokens por segundo e cache 10× mais barato. O Qwen responde com multimodal, pesos abertos e um índice de inteligência 11% maior.

Redação FalaVIP IA 4 min de leitura
US$ 0,75por milhão de tokens de saída do Mercury 2
669 t/svelocidade do Mercury 2, quase 4× o Qwen
US$ 0,025/Mcache do Mercury 2, 10× mais barato que o Qwen

Mercury 2 chegou ao catálogo no começo de março cobrando US$ 0,75 por milhão de tokens de saída. O Qwen3.5-35B-A3B, da Qwen, cobra US$ 1,25 pela mesma janela. Olhando só a tabela de preços, o veredito parece óbvio. Mas a conta tem mais colunas do que isso, e em duas delas o Qwen abre vantagem que o release da Inception não destaca.

O que cada modelo é, de verdade

Antes de preço, vale separar o que cada um faz — e onde cada um deixa de fora o que você precisa.

O Mercury 2 é um modelo de texto que se anuncia como o primeiro LLM de difusão para raciocínio. Em vez de gerar tokens um a um, ele refina vários em paralelo — a mesma família de técnica que move geradores de imagem, agora adaptada para texto. Resultado prático é bruto: 669 tokens por segundo, contra 167,5 do Qwen. Quatro vezes mais rápido. É um modelo fechado, vindo dos Estados Unidos.

O Qwen3.5-35B-A3B faz o movimento oposto. É multimodal — aceita texto, imagem e vídeo na entrada e devolve texto —, tem 36 bilhões de parâmetros totais com apenas 3 bilhões ativos por inferência (sparse MoE com atenção linear híbrida) e é open weights. Você baixa, roda, ajusta. Vem da China.

Índice de inteligência (Artificial Analysis)
Qwen3.5-35B-A3B24,3Mercury 221,9índice
Fonte: Artificial Analysis

No índice de inteligência medido nesta data, o Qwen marca 24,322 contra 21,896 do Mercury 2. Em coding a diferença é maior: 36,977 contra 31,113 — quase 19% a mais. Em agentic, 11,823 contra 9,458, uma vantagem de 25%. Nas três dimensões o Qwen está na frente.

A conta por milhão de tokens

Vamos ao que dói no cartão.

Preço de saída (US$ por milhão de tokens)
Qwen3.5-35B-A3B1,25Mercury 20,75US$/M
Fonte: OpenRouter

Entrada é igual nos dois: US$ 0,25 por milhão. Onde eles divergem é na saída e no cache.

Saída do Mercury 2: US$ 0,75. Do Qwen: US$ 1,25. Diferença de 40% a favor da Inception. Cache do Mercury 2: US$ 0,025 por milhão. Do Qwen: US$ 0,25. São dez vezes mais barato. Preço blended publicado (50% entrada, 50% saída): US$ 0,375 do Mercury 2 contra US$ 0,6875 do Qwen — quase metade.

Se você tem um pipeline que martela o mesmo prompt repetidamente e a maior parte do tráfego é saída, Mercury 2 ganha na ponta do lápis. Se a entrada é multimodal, a conversa muda — porque esse terreno o Mercury 2 nem entra.

Velocidade e arquitetura: onde os números mentem

Quatro vezes mais rápido não é marketing — é mensurável. Em workflows onde a latência individual pesa (chat ao vivo, agentes que encadeiam dezenas de chamadas, geração em tempo real) o Mercury 2 entrega uma rodada inteira onde o Qwen ainda está na primeira metade.

Mas velocidade bruta esconde uma armadilha: o Mercury 2 é texto-only. Tudo que envolve processar uma imagem, um frame de vídeo ou um PDF com layout é território que o Qwen cobre e o Mercury 2 não. E o Qwen entrega contexto de 262.144 tokens, mais que o dobro dos 128.000 do Mercury 2. Para documentos longos, bases de código extensas ou sessões de agente que acumulam histórico, isso muda o jogo.

Qwen3.5-35B-A3B × Mercury 2
CritérioQwen3.5-35B-A3BMercury 2
Índice de inteligência24.321.9
Entrada US$/M0.250.25
Saída US$/M1.250.75
Contexto262k128k
Pesos abertossimnão
Velocidade (tok/s)168669
Índice de código37.031.1
Índice agêntico11.89.5

Onde eles se encaixam no catálogo

Os dois vivem numa faixa de IQ abaixo dos 35. O topo do catálogo nesta data é Gemini 3.1 Pro Preview em 47,738 e GPT-5.3-Codex em 45,512 — ambos acima de US$ 12 por milhão de tokens de saída. Comparar Mercury 2 e Qwen com eles não é justo nem útil. O ponto é outro: dentro da faixa econômica, qual estratégia paga melhor.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 375 modelos disponíveis no catálogo nesta data.

Para quem cada um ganha

Mercury 2 vence quando você precisa de:

  • alta vazão de texto puro com latência baixa — batch de classificação, enriquecimento de dados, resumos longos em pipeline;
  • cache de prompt agressivo — caches dez vezes mais baratos transformam prompts longos em economia real;
  • experimentação com arquitetura de difusão para texto, área nova que vale testar antes que vire padrão.

Qwen3.5-35B-A3B vence quando você precisa de:

  • entrada multimodal (imagem, vídeo) sem trocar de modelo na pipeline;
  • auto-hospedagem ou fine-tune, já que os pesos são abertos e os 3 bilhões de parâmetros ativos rodam em hardware modesto;
  • tarefas onde coding e raciocínio agentic pesam mais que latência pura;
  • contexto de 262 mil tokens, mais que o dobro do concorrente.

Se você roda multimodal, quer open weights ou tem um caso de contexto longo, escolha Qwen e pare de olhar preço de saída. Se você queima texto puro em alto volume e latência é gargalo real, escolha Mercury 2 — é a melhor combinação de velocidade e preço abaixo de IQ 30 que o catálogo oferece hoje.

Em uma frase

Para multimodal, contexto longo ou self-hosting, vá de Qwen 3.5 35B-A3B. Para texto puro em alto volume com latência apertada, vá de Mercury 2 — é a melhor relação velocidade/preço abaixo de IQ 30 que o catálogo oferece hoje.

Perguntas frequentes

Mercury 2 ou Qwen 3.5 35B-A3B para resumir documentos com imagem?

Qwen 3.5 35B-A3B. Ele é multimodal e aceita texto, imagem e vídeo como entrada. O Mercury 2 só processa texto, então qualquer PDF com layout, captura de tela ou foto precisa de outro modelo na pipeline antes.

Quanto custa rodar 1 milhão de tokens no Mercury 2?

US$ 0,375 no preço blended publicado pela Inception (50% entrada, 50% saída). Detalhado: US$ 0,25 por milhão de entrada, US$ 0,75 por milhão de saída, e US$ 0,025 por milhão para cache de prompt — dez vezes mais barato que o cache do Qwen.

Mercury 2 é open source?

Não. Mercury 2 é modelo fechado, sem pesos publicados. O Qwen 3.5 35B-A3B é open weights: você baixa, roda localmente e pode fazer fine-tune. São 36 bilhões de parâmetros totais com apenas 3 bilhões ativos — administrável em hardware de consumidor.

Leia também