Haiku 4.5 custa US$ 5 por milhão de saída; Mercury 2 cobra US$ 0,75
Comparativo frente a frente entre o modelo eficiente da Anthropic e a primeira dLLM de raciocínio da Inception, lançada dez dias atrás.
O contraste que a conta mostra
Você viu o lançamento do Mercury 2 no fim de fevereiro, leu que era uma "dLLM de raciocínio" e provavelmente passou direto. Faz sentido: num catálogo com 362 modelos, mais 28 lançados nos últimos 30 dias, um item a mais não chama atenção. Mas quando você coloca a régua do custo lado a lado com o Claude Haiku 4.5, a história muda.
O Mercury 2 cobra US$ 0,75 por milhão de tokens de saída. O Haiku 4.5 cobra US$ 5 pelo mesmo volume. Em volumes típicos de uma aplicação rodando o mês inteiro, a diferença entre esses dois números dita se a sua fatura termina em quatro dígitos ou em cinco. E o Mercury 2 não é apenas mais barato: ele foi lançado em 4 de março de 2026, dez dias antes desta comparação, enquanto o Haiku 4.5 já tem quase cinco meses de mercado.
Inteligência, sem confundir capacidade com preço
Aqui mora a armadilha que o marketing não desarma sozinho. Pelo índice de inteligência da Artificial Analysis medido hoje, o Haiku 4.5 marca 29,892 contra 21,896 do Mercury 2. O Haiku também lidera em raciocínio aplicado a código (43,892 contra 31,113) e em tarefas agentic (16,472 contra 9,458). Esses números existem, são reais e vêm da mesma régua. Não é opinião.
Mas existe uma leitura menos cômoda: o topo do mercado hoje é Gemini 3.1 Pro Preview (47,738) e GPT-5.3-Codex (45,512). Os dois modelos que estamos comparando estão bem abaixo desse teto, e isso muda o que cada um é. Nenhum dos dois é o modelo que você chama para resolver o problema difícil. O que está em jogo aqui é outra decisão: qual deles faz a tarefa mediana pagando menos e respondendo mais rápido.
A conta da latência e o que "rápido" realmente significa
Olha o número de velocidade e compara com tudo que você já viu: 90,21 do Haiku contra 669 do Mercury 2. Em termos relativos dentro do Artificial Analysis, o Mercury 2 está numa categoria que não admite comparação direta com modelos de geração sequencial. A Inception posiciona o Mercury 2 como uma dLLM — em vez de gerar token por token, o modelo produz e refina vários tokens em paralelo. É uma abordagem nova, e a velocidade é a consequência direta.
Para você, isso significa que o Mercury 2 entrega a primeira sílaba útil antes de você piscar. Em fluxos onde a percepção de tempo de resposta importa — chat com usuário final, agente que itera em loop curto, autocomplete de código — essa diferença pesa. Em fluxos onde o gargalo é qualidade de resposta e você espera 30 segundos sem problema, ela some.
| Critério | Claude Haiku 4.5 | Mercury 2 |
|---|---|---|
| Índice de inteligência | 29.9 | 21.9 |
| Entrada US$/M | 1 | 0.25 |
| Saída US$/M | 5 | 0.75 |
| Contexto | 200k | 128k |
| Pesos abertos | não | não |
| Velocidade (tok/s) | 90 | 669 |
| Índice de código | 43.9 | 31.1 |
| Índice agêntico | 16.5 | 9.5 |
Onde cada um ganha, sem a palavra proíbida
Você não está comprando um modelo. Está comprando duas coisas diferentes disfarçadas do mesmo nome.
Mercury 2 ganha quando o trabalho é texto puro (não entra imagem nem arquivo), a janela de 128 mil tokens é suficiente, e o volume de tokens é alto o bastante para que US$ 0,75 de saída frente a US$ 5 mude a conta no fim do mês. Pense em classificação, extração, agentes curtos, qualquer fluxo em que a velocidade percebida seja produto.
Haiku 4.5 ganha quando você precisa de multimodal (texto, imagem e arquivo de entrada), precisa de contexto maior que 128 mil tokens, ou quando o trabalho depende da régua de raciocínio mais alta do Haiku em código e tarefas agentic. Pague US$ 5 a mais por milhão quando esses três fatores existirem simultaneamente.
Onde nenhum dos dois te serve
Se você está tentando substituir o Gemini 3.1 Pro Preview ou o GPT-5.3-Codex por economia, pare. Tanto Haiku 4.5 quanto Mercury 2 estão a 8 a 16 pontos de inteligência abaixo do topo, em média. Para o trabalho que exige fronteira, esse delta aparece.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
O que fazer com isso hoje
Abra o painel de billing e separe as chamadas em dois baldes: multimodal/contra-agente longo e texto puro/alto volume. Mande o primeiro balde para Haiku 4.5 e teste o segundo no Mercury 2 por uma semana. Se a percepção de velocidade e a queda na fatura não compensarem a diferença de 8 pontos no índice de inteligência, você volta. Se compensarem, você redesenha os prompts e economiza.
Texto puro e alto volume vão para Mercury 2; multimodal e raciocínio pesado vão para Haiku 4.5 — e nem um dos dois substitui o topo do mercado.
Perguntas frequentes
Claude Haiku 4.5 ou Mercury 2 é mais barato?
Mercury 2 é mais barato em todas as direções: US$ 0,25 contra US$ 1,00 por milhão de entrada, US$ 0,75 contra US$ 5,00 por milhão de saída, e US$ 0,025 contra US$ 0,10 por milhão em cache.
O Mercury 2 aceita imagem e arquivo como entrada?
Não. A modalidade declarada é apenas texto -> texto. Para multimodal, a alternativa neste comparativo é o Haiku 4.5, que aceita texto, imagem e arquivo.
Qual dos dois é mais rápido?
Mercury 2 aparece com velocidade 669 contra 90,21 do Haiku 4.5 no índice do Artificial Analysis, diferença explicada pela arquitetura de difusão que produz tokens em paralelo.