Haiku 4.5 custa quase 7× mais caro que Mercury 2 no token de saída
Quase seis meses separam os dois lançamentos da Anthropic e da Inception — e a conta de API mostra quem paga pelo silêncio do raciocínio.
O preço que você paga pelo "quase"
A Anthropic lançou o Haiku 4.5 em outubro de 2025 dizendo que entregava "inteligência quase de fronteira a uma fração do custo" do Sonnet. Em março de 2026, esse argumento ainda vale — se você comparar Haiku com Sonnet. O problema aparece quando alguém coloca o Haiku 4.5 lado a lado com um modelo que ninguém estava olhando: o Mercury 2, da Inception, lançado em 4 de março e que cobra US$ 0,75 por milhão de tokens de saída. O Haiku pede US$ 5,00 pelo mesmo milhão. São 6,67 vezes mais caro no output — e essa é a métrica que explode a fatura.
Inteligência: Haiku lidera, mas não por onde você imagina
No índice de inteligência da Artificial Analysis, o Haiku 4.5 marca 29.892 e o Mercury 2 fica em 21.896. Em coding, a diferença é de 43.892 contra 31.113 — perto de 41% a mais para o modelo da Anthropic. Em agentic, o Haiku também ganha (16.472 vs 9.458). Se o seu trabalho exige o melhor desses dois no raciocínio estruturado, o Haiku é o escolhido.
Mas existe uma métrica em que o Mercury 2 não só empata: ele aplica um atropelo. A velocidade medida é de 669 tokens por segundo contra 90,21 do Haiku — ou seja, 7,4 vezes mais rápido. É o tipo de diferença que aparece quando o usuário espera uma resposta e o sistema engole o tempo de raciocínio.
| Critério | Claude Haiku 4.5 | Mercury 2 |
|---|---|---|
| Índice de inteligência | 29.9 | 21.9 |
| Entrada US$/M | 1 | 0.25 |
| Saída US$/M | 5 | 0.75 |
| Contexto | 200k | 128k |
| Pesos abertos | não | não |
| Velocidade (tok/s) | 90 | 669 |
| Índice de código | 43.9 | 31.1 |
| Índice agêntico | 16.5 | 9.5 |
Por que o Mercury 2 é tão rápido (e por que isso importa na fatura)
O Mercury 2 é anunciado como o primeiro "reasoning diffusion LLM", um dLLM. Em vez de gerar tokens um atrás do outro como todo LLM desde 2017, ele produz e refina vários tokens em paralelo. Pense na diferença entre digitar uma redação inteira palavra por palavra e reescrever o parágrafo inteiro de uma vez: a segunda abordagem termina antes, mesmo que o texto final tenha o mesmo tamanho. É a razão da velocidade de 669 tok/s, e é a razão de o cache de leitura custar apenas US$ 0,025 por milhão — outra economia que some se você fica no Haiku, onde o cache é de US$ 0,10.
Quando cada um ganha (sem "depende")
Use Claude Haiku 4.5 quando a tarefa exige raciocínio, agentic ou coding pesado, e o orçamento permite pagar US$ 5 por milhão de saída. Em fluxos onde cada token precisa carregar peso de verdade — agentes que tomam decisões em cadeia, refatoração de código, análise de documentos longos — os 8 pontos de índice de inteligência e os quase 13 pontos em coding fazem diferença visível na qualidade entregue.
Use Mercury 2 quando o gargalo é tempo e volume. Chatbots em tempo real, autocompletar avançado, pipelines que processam milhares de chamadas curtas, geração em massa onde latência mata a UX: a 669 tok/s transforma a experiência do usuário final, e os US$ 0,75 por milhão permitem gastar 6,67 vezes menos para entregar a mesma quantidade de texto. O preço blended (input + output ponderados) do Mercury 2 é de US$ 0,375 — exatamente um quarto do US$ 2,00 do Haiku.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
O tabuleiro em 14 de março de 2026
O catálogo de modelos listados passa de 362, com 53 criadores. No topo por inteligência, Gemini 3.1 Pro Preview lidera com 47.738, seguido de GPT-5.3-Codex (45.512) e Claude Sonnet 4.6 (35.108). Os dois da pauta vivem na faixa abaixo: Haiku em 29.892 e Mercury 2 em 21.896. Quem precisa de IQ acima de 45 hoje tem exatamente duas opções com preço publicado — e Mercury 2 não está nessa lista. A disputa aqui é outra: é sobre o melhor custo-benefício dentro da faixa intermediária, e aí o Mercury 2 muda a régua do que é barato.
Se a sua conta de API vive dominada por volume e latência, migrar de Haiku 4.5 para Mercury 2 corta o gasto com saída em mais de 85% — e você só perde 8 pontos de inteligência quando a tarefa realmente exigir raciocínio denso.
Perguntas frequentes
Mercury 2 é realmente mais barato que Claude Haiku 4.5?
Sim. O Mercury 2 cobra US$ 0,25 por milhão de tokens de entrada e US$ 0,75 por milhão de saída, contra US$ 1,00 e US$ 5,00 do Haiku 4.5. No preço blended (ponderado), o Mercury 2 fica em US$ 0,375 — quatro vezes mais barato.
Por que o Mercury 2 é tão mais rápido?
Ele usa geração por difusão (dLLM): em vez de produzir tokens um a um, gera e refina vários em paralelo. O resultado medido é 669 tokens por segundo, contra 90 do Haiku 4.5.
Qual escolher para coding?
Para coding pesado, Haiku 4.5 (nota 43.892) ainda entrega cerca de 41% mais desempenho que Mercury 2 (31.113). Para autocompletar e tarefas rápidas em volume, Mercury 2 vence pelo preço e pela velocidade.