Haiku 4.5 cobra US$ 5 por milhão e entrega 96% da inteligência do o3
O modelo pequeno da Anthropic estreia em 15 de outubro com raciocínio, multimodalidade e preço que muda a conta de produção — mas não ganha de ninguém em tudo.
A conta que ninguém quer ler
A Anthropic colocou o Claude Haiku 4.5 no catálogo em 15 de outubro cobrando US$ 5 por milhão de tokens de saída. Parece caro até você comparar com o que está logo acima dele na tabela de inteligência: o o3, da OpenAI, cobra US$ 8 pela mesma unidade. São 60% a mais por uma diferença de 1,2 ponto num índice que vai até 100. Em produção, esse delta de inteligência quase nunca se traduz em receita — mas o delta de preço se traduz em prejuízo.
O ponto central do Haiku 4.5 não é ser o mais inteligente. É entregar quase a inteligência do o3 a um custo que cabe em produtos com margem apertada: chatbots de suporte, classificação de tickets, agentes internos, pipelines de RAG com muito volume. Para esses casos, pagar US$ 8 por milhão era um impeditivo; pagar US$ 5 ainda aperta, mas entra na planilha.
Onde ele ganha e onde não ganha
O Haiku 4.5 marca 29,9 no índice geral e 43,9 em coding — números altos para um modelo da família "pequena". Em agentic, fica em 16,5, distante dos 31,1 do o3 no agregado. A leitura honesta: ele é um Sonnet 4 com menos músculo, não um o3 com menos conta. Serve para fluxos onde o raciocínio precisa estar presente, mas o pico de capacidade não precisa ser o estado da arte.
A velocidade reportada de 90 tokens por segundo coloca ele atrás do gpt-oss-120b (155 t/s), que é open-weight e custa US$ 0,17 por milhão de saída. Se o seu gargalo é latência pura e o orçamento é curto, o gpt-oss-120b ainda vence no papel. A diferença é que o Haiku 4.5 é multimodal — aceita imagem e arquivo — e o gpt-oss só lê texto. Para extrair dados de PDFs, screenshots e diagramas, o Haiku 4.5 não tem substituto direto na faixa de preço.
| Campo | Valor |
|---|---|
| Identificador | anthropic/claude-haiku-4.5 |
| Criador | anthropic |
| Preço de entrada | US$ 1.00 / M tokens |
| Preço de saída | US$ 5.00 / M tokens |
| Janela de contexto | 200k |
| Modalidade | text+image+file->text |
| Leitura de cache | US$ 0.100 / M (90% de desconto) |
| Índice de inteligência (AA) | 29.9 |
| Índice de código | 43.9 |
| Índice agêntico | 16.5 |
| Pesos | fechados |
| Velocidade de saída | 90 tokens/s |
| Raciocínio | sim (gasta tokens de saída pensando) |
O tabuleiro em 15 de outubro
O catálogo tem 258 modelos hoje e 40 criadores. Nos últimos 30 dias, 31 modelos foram lançados — o ritmo não diminuiu. No topo da inteligência, a ordem é o3 (31,1), Haiku 4.5 (29,9), gpt-oss-120b (24,1), Qwen3 Next 80B Thinking (16,9) e gpt-oss-20b (15,2). Repare: o Haiku 4.5 entra em segundo lugar absoluto, à frente de qualquer modelo aberto e de qualquer coisa da Qwen.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O detalhe que muda a conta de verdade é o cache de leitura: US$ 0,10 por milhão de tokens. Quem repete system prompts longos, quem encadeia agentes que relêm o mesmo contexto, quem faz RAG com retrieval recorrente — esse preço derruba o custo efetivo para uma fração do nominal. É o tipo de detalhe que não aparece no headline e aparece na fatura.
Para quem vale e para quem não vale
Vale para você se: roda volume alto de texto+imagem, precisa de raciocínio consistente, quer Anthropic na stack e o o3 estoura o orçamento. Vale especialmente se você já usava Sonnet e quer migrar chamadas de baixa criticidade para baratear a fatura sem perder o ecossistema.
Não vale se: o gargalo é latência (vá de gpt-oss-120b), o caso de uso é puramente texto e o orçamento é apertado (vá de gpt-oss-20b a US$ 0,13 por milhão), ou você precisa do teto de capacidade em coding/agentic — aí o o3 ainda é o3.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Claude Haiku 4.5 (o novo) | 29.9 | 1 | 5 | 200k |
| gpt-oss-120b | 24.1 | 0.037 | 0.17 | 131k |
| o3 | 31.1 | 2 | 8 | 200k |
A implicação prática é direta: revise os prompts do seu produto que hoje vão para o o3 ou para Sonnet 4, separe os que não precisam do pico, e redirecione para o Haiku 4.5. Em muitos produtos, isso é 40 a 60% do volume de chamadas — e é exatamente onde mora a economia.
Mande para o Haiku 4.5 o que hoje vai para o o3 mas não precisa do pico de capacidade: a economia aparece na fatura sem perder raciocínio nem multimodalidade.
Perguntas frequentes
Claude Haiku 4.5 é melhor que o o3?
Não. No índice geral, o Haiku 4.5 marca 29,9 contra 31,1 do o3 — uma diferença pequena. Em agentic, o o3 lidera com folga. O Haiku 4.5 compete em custo por inteligência entregue, não em capacidade absoluta.
Quanto custa usar o Claude Haiku 4.5 na API?
US$ 1 por milhão de tokens de entrada e US$ 5 por milhão de tokens de saída. O cache de leitura sai por US$ 0,10 por milhão, o que reduz muito o custo em fluxos com system prompt repetido.
Haiku 4.5 substitui o gpt-oss-120b?
Depende do caso. O gpt-oss-120b é open-weight, mais rápido (155 t/s contra 90) e custa US$ 0,17 por milhão de saída — imbatível em texto puro e baixo orçamento. O Haiku 4.5 vence quando a tarefa envolve imagem ou arquivo, ou quando você precisa do ecossistema Anthropic.