FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Haiku 4.5 custa US$ 5 por milhão de saída; Mercury 2 cobra US$ 0,75

Comparativo frente a frente entre o modelo eficiente da Anthropic e a primeira dLLM de raciocínio da Inception, lançada dez dias atrás.

Redação FalaVIP IA 3 min de leitura
US$ 5,00custo de saída por milhão de tokens do Claude Haiku 4.5
US$ 0,75custo de saída por milhão de tokens do Mercury 2
90,21 vs 669velocidade relativa dos dois modelos

O contraste que a conta mostra

Você viu o lançamento do Mercury 2 no fim de fevereiro, leu que era uma "dLLM de raciocínio" e provavelmente passou direto. Faz sentido: num catálogo com 362 modelos, mais 28 lançados nos últimos 30 dias, um item a mais não chama atenção. Mas quando você coloca a régua do custo lado a lado com o Claude Haiku 4.5, a história muda.

O Mercury 2 cobra US$ 0,75 por milhão de tokens de saída. O Haiku 4.5 cobra US$ 5 pelo mesmo volume. Em volumes típicos de uma aplicação rodando o mês inteiro, a diferença entre esses dois números dita se a sua fatura termina em quatro dígitos ou em cinco. E o Mercury 2 não é apenas mais barato: ele foi lançado em 4 de março de 2026, dez dias antes desta comparação, enquanto o Haiku 4.5 já tem quase cinco meses de mercado.

Preço de saída (US$ por milhão de tokens)
Claude Haiku 4.55Mercury 20,75US$/M
Fonte: OpenRouter

Inteligência, sem confundir capacidade com preço

Aqui mora a armadilha que o marketing não desarma sozinho. Pelo índice de inteligência da Artificial Analysis medido hoje, o Haiku 4.5 marca 29,892 contra 21,896 do Mercury 2. O Haiku também lidera em raciocínio aplicado a código (43,892 contra 31,113) e em tarefas agentic (16,472 contra 9,458). Esses números existem, são reais e vêm da mesma régua. Não é opinião.

Índice de inteligência (Artificial Analysis)
Claude Haiku 4.529,9Mercury 221,9índice
Fonte: Artificial Analysis

Mas existe uma leitura menos cômoda: o topo do mercado hoje é Gemini 3.1 Pro Preview (47,738) e GPT-5.3-Codex (45,512). Os dois modelos que estamos comparando estão bem abaixo desse teto, e isso muda o que cada um é. Nenhum dos dois é o modelo que você chama para resolver o problema difícil. O que está em jogo aqui é outra decisão: qual deles faz a tarefa mediana pagando menos e respondendo mais rápido.

A conta da latência e o que "rápido" realmente significa

Olha o número de velocidade e compara com tudo que você já viu: 90,21 do Haiku contra 669 do Mercury 2. Em termos relativos dentro do Artificial Analysis, o Mercury 2 está numa categoria que não admite comparação direta com modelos de geração sequencial. A Inception posiciona o Mercury 2 como uma dLLM — em vez de gerar token por token, o modelo produz e refina vários tokens em paralelo. É uma abordagem nova, e a velocidade é a consequência direta.

Para você, isso significa que o Mercury 2 entrega a primeira sílaba útil antes de você piscar. Em fluxos onde a percepção de tempo de resposta importa — chat com usuário final, agente que itera em loop curto, autocomplete de código — essa diferença pesa. Em fluxos onde o gargalo é qualidade de resposta e você espera 30 segundos sem problema, ela some.

Claude Haiku 4.5 × Mercury 2
CritérioClaude Haiku 4.5Mercury 2
Índice de inteligência29.921.9
Entrada US$/M10.25
Saída US$/M50.75
Contexto200k128k
Pesos abertosnãonão
Velocidade (tok/s)90669
Índice de código43.931.1
Índice agêntico16.59.5

Onde cada um ganha, sem a palavra proíbida

Você não está comprando um modelo. Está comprando duas coisas diferentes disfarçadas do mesmo nome.

Mercury 2 ganha quando o trabalho é texto puro (não entra imagem nem arquivo), a janela de 128 mil tokens é suficiente, e o volume de tokens é alto o bastante para que US$ 0,75 de saída frente a US$ 5 mude a conta no fim do mês. Pense em classificação, extração, agentes curtos, qualquer fluxo em que a velocidade percebida seja produto.

Haiku 4.5 ganha quando você precisa de multimodal (texto, imagem e arquivo de entrada), precisa de contexto maior que 128 mil tokens, ou quando o trabalho depende da régua de raciocínio mais alta do Haiku em código e tarefas agentic. Pague US$ 5 a mais por milhão quando esses três fatores existirem simultaneamente.

Onde nenhum dos dois te serve

Se você está tentando substituir o Gemini 3.1 Pro Preview ou o GPT-5.3-Codex por economia, pare. Tanto Haiku 4.5 quanto Mercury 2 estão a 8 a 16 pontos de inteligência abaixo do topo, em média. Para o trabalho que exige fronteira, esse delta aparece.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 362 modelos disponíveis no catálogo nesta data.

O que fazer com isso hoje

Abra o painel de billing e separe as chamadas em dois baldes: multimodal/contra-agente longo e texto puro/alto volume. Mande o primeiro balde para Haiku 4.5 e teste o segundo no Mercury 2 por uma semana. Se a percepção de velocidade e a queda na fatura não compensarem a diferença de 8 pontos no índice de inteligência, você volta. Se compensarem, você redesenha os prompts e economiza.

Em uma frase

Texto puro e alto volume vão para Mercury 2; multimodal e raciocínio pesado vão para Haiku 4.5 — e nem um dos dois substitui o topo do mercado.

Perguntas frequentes

Claude Haiku 4.5 ou Mercury 2 é mais barato?

Mercury 2 é mais barato em todas as direções: US$ 0,25 contra US$ 1,00 por milhão de entrada, US$ 0,75 contra US$ 5,00 por milhão de saída, e US$ 0,025 contra US$ 0,10 por milhão em cache.

O Mercury 2 aceita imagem e arquivo como entrada?

Não. A modalidade declarada é apenas texto -> texto. Para multimodal, a alternativa neste comparativo é o Haiku 4.5, que aceita texto, imagem e arquivo.

Qual dos dois é mais rápido?

Mercury 2 aparece com velocidade 669 contra 90,21 do Haiku 4.5 no índice do Artificial Analysis, diferença explicada pela arquitetura de difusão que produz tokens em paralelo.

Leia também

Análise

Gemini 3.1 Pro custa 14 vezes mais que o MiMo da Xiaomi — vale a diferença?

Comparativo frente a frente entre o modelo mais inteligente do catálogo e o chinês de código aberto que promete fazer 90% do trabalho por uma fração do preço.

Preços

Haiku 4.5 custa quase 7× mais caro que Mercury 2 no token de saída

Quase seis meses separam os dois lançamentos da Anthropic e da Inception — e a conta de API mostra quem paga pelo silêncio do raciocínio.

Benchmarks

Quatro modelos do catálogo tiveram a nota de benchmark revisada; um deles caiu quase 26%,Quatro notas de benchmark foram revisadas em um dia: o que muda na sua escolha,Quatro modelos reavaliados: Trinity Large Thinking perdeu 6,3 pontos de IQ,Reavaliação do dia derruba nota do Trinity Large Thinking em quase 26%,Quatro modelos reavaliados pelo Artificial Analysis em 22 de julho de 2026,Trinity Large Thinking cai de 24,5 para 18,2 na reavaliação do Artificial Analysis,Quatro notas de benchmark revisadas: Trinity Large Thinking foi o que mais caiu,Reavaliação do Artificial Analysis mexe em quatro modelos do catálogo,Quatro modelos tiveram a régua de benchmark movida pelo Artificial Analysis,Quatro reavaliações do Artificial Analysis em um só dia: o que muda na sua pilha

Trinity Large Thinking perdeu quase 26% da nota em uma só revisão; Gemma 4 E4B e DeepSeek V4 Flash também foram recalibrados.

Preços

Cinco modelos mexeram no preço hoje; três ficaram mais baratos

Tencent Hy3, Kimi K2.7 Code e Trinity Large Thinking lideram os cortes do dia — e revelam quem está brigando por volume.