FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Haiku 4.5 custa quase 7× mais caro que Mercury 2 no token de saída

Quase seis meses separam os dois lançamentos da Anthropic e da Inception — e a conta de API mostra quem paga pelo silêncio do raciocínio.

Redação FalaVIP IA 3 min de leitura
US$ 5,00preço de saída do Haiku 4.5 por milhão de tokens
US$ 0,75preço de saída do Mercury 2 por milhão de tokens
669 tok/svelocidade medida do Mercury 2

O preço que você paga pelo "quase"

A Anthropic lançou o Haiku 4.5 em outubro de 2025 dizendo que entregava "inteligência quase de fronteira a uma fração do custo" do Sonnet. Em março de 2026, esse argumento ainda vale — se você comparar Haiku com Sonnet. O problema aparece quando alguém coloca o Haiku 4.5 lado a lado com um modelo que ninguém estava olhando: o Mercury 2, da Inception, lançado em 4 de março e que cobra US$ 0,75 por milhão de tokens de saída. O Haiku pede US$ 5,00 pelo mesmo milhão. São 6,67 vezes mais caro no output — e essa é a métrica que explode a fatura.

Preço de saída (US$ por milhão de tokens)
Claude Haiku 4.55Mercury 20,75US$/M
Fonte: OpenRouter

Inteligência: Haiku lidera, mas não por onde você imagina

No índice de inteligência da Artificial Analysis, o Haiku 4.5 marca 29.892 e o Mercury 2 fica em 21.896. Em coding, a diferença é de 43.892 contra 31.113 — perto de 41% a mais para o modelo da Anthropic. Em agentic, o Haiku também ganha (16.472 vs 9.458). Se o seu trabalho exige o melhor desses dois no raciocínio estruturado, o Haiku é o escolhido.

Índice de inteligência (Artificial Analysis)
Claude Haiku 4.529,9Mercury 221,9índice
Fonte: Artificial Analysis

Mas existe uma métrica em que o Mercury 2 não só empata: ele aplica um atropelo. A velocidade medida é de 669 tokens por segundo contra 90,21 do Haiku — ou seja, 7,4 vezes mais rápido. É o tipo de diferença que aparece quando o usuário espera uma resposta e o sistema engole o tempo de raciocínio.

Claude Haiku 4.5 × Mercury 2
CritérioClaude Haiku 4.5Mercury 2
Índice de inteligência29.921.9
Entrada US$/M10.25
Saída US$/M50.75
Contexto200k128k
Pesos abertosnãonão
Velocidade (tok/s)90669
Índice de código43.931.1
Índice agêntico16.59.5

Por que o Mercury 2 é tão rápido (e por que isso importa na fatura)

O Mercury 2 é anunciado como o primeiro "reasoning diffusion LLM", um dLLM. Em vez de gerar tokens um atrás do outro como todo LLM desde 2017, ele produz e refina vários tokens em paralelo. Pense na diferença entre digitar uma redação inteira palavra por palavra e reescrever o parágrafo inteiro de uma vez: a segunda abordagem termina antes, mesmo que o texto final tenha o mesmo tamanho. É a razão da velocidade de 669 tok/s, e é a razão de o cache de leitura custar apenas US$ 0,025 por milhão — outra economia que some se você fica no Haiku, onde o cache é de US$ 0,10.

Quando cada um ganha (sem "depende")

Use Claude Haiku 4.5 quando a tarefa exige raciocínio, agentic ou coding pesado, e o orçamento permite pagar US$ 5 por milhão de saída. Em fluxos onde cada token precisa carregar peso de verdade — agentes que tomam decisões em cadeia, refatoração de código, análise de documentos longos — os 8 pontos de índice de inteligência e os quase 13 pontos em coding fazem diferença visível na qualidade entregue.

Use Mercury 2 quando o gargalo é tempo e volume. Chatbots em tempo real, autocompletar avançado, pipelines que processam milhares de chamadas curtas, geração em massa onde latência mata a UX: a 669 tok/s transforma a experiência do usuário final, e os US$ 0,75 por milhão permitem gastar 6,67 vezes menos para entregar a mesma quantidade de texto. O preço blended (input + output ponderados) do Mercury 2 é de US$ 0,375 — exatamente um quarto do US$ 2,00 do Haiku.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 362 modelos disponíveis no catálogo nesta data.

O tabuleiro em 14 de março de 2026

O catálogo de modelos listados passa de 362, com 53 criadores. No topo por inteligência, Gemini 3.1 Pro Preview lidera com 47.738, seguido de GPT-5.3-Codex (45.512) e Claude Sonnet 4.6 (35.108). Os dois da pauta vivem na faixa abaixo: Haiku em 29.892 e Mercury 2 em 21.896. Quem precisa de IQ acima de 45 hoje tem exatamente duas opções com preço publicado — e Mercury 2 não está nessa lista. A disputa aqui é outra: é sobre o melhor custo-benefício dentro da faixa intermediária, e aí o Mercury 2 muda a régua do que é barato.

Em uma frase

Se a sua conta de API vive dominada por volume e latência, migrar de Haiku 4.5 para Mercury 2 corta o gasto com saída em mais de 85% — e você só perde 8 pontos de inteligência quando a tarefa realmente exigir raciocínio denso.

Perguntas frequentes

Mercury 2 é realmente mais barato que Claude Haiku 4.5?

Sim. O Mercury 2 cobra US$ 0,25 por milhão de tokens de entrada e US$ 0,75 por milhão de saída, contra US$ 1,00 e US$ 5,00 do Haiku 4.5. No preço blended (ponderado), o Mercury 2 fica em US$ 0,375 — quatro vezes mais barato.

Por que o Mercury 2 é tão mais rápido?

Ele usa geração por difusão (dLLM): em vez de produzir tokens um a um, gera e refina vários em paralelo. O resultado medido é 669 tokens por segundo, contra 90 do Haiku 4.5.

Qual escolher para coding?

Para coding pesado, Haiku 4.5 (nota 43.892) ainda entrega cerca de 41% mais desempenho que Mercury 2 (31.113). Para autocompletar e tarefas rápidas em volume, Mercury 2 vence pelo preço e pela velocidade.

Leia também