FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Haiku 4.5 cobra US$ 5 por milhão e entrega 96% da inteligência do o3

O modelo pequeno da Anthropic estreia em 15 de outubro com raciocínio, multimodalidade e preço que muda a conta de produção — mas não ganha de ninguém em tudo.

Redação FalaVIP IA 3 min de leitura
US$ 5por milhão de tokens de saída no Haiku 4.5
29,9de índice de inteligência, contra 31,1 do o3
US$ 0,10por milhão de tokens em cache de leitura

A conta que ninguém quer ler

A Anthropic colocou o Claude Haiku 4.5 no catálogo em 15 de outubro cobrando US$ 5 por milhão de tokens de saída. Parece caro até você comparar com o que está logo acima dele na tabela de inteligência: o o3, da OpenAI, cobra US$ 8 pela mesma unidade. São 60% a mais por uma diferença de 1,2 ponto num índice que vai até 100. Em produção, esse delta de inteligência quase nunca se traduz em receita — mas o delta de preço se traduz em prejuízo.

Preço de saída (US$ por milhão de tokens)
Claude Haiku 4.55gpt-oss-120b0,17o38US$/M
Fonte: OpenRouter

O ponto central do Haiku 4.5 não é ser o mais inteligente. É entregar quase a inteligência do o3 a um custo que cabe em produtos com margem apertada: chatbots de suporte, classificação de tickets, agentes internos, pipelines de RAG com muito volume. Para esses casos, pagar US$ 8 por milhão era um impeditivo; pagar US$ 5 ainda aperta, mas entra na planilha.

Onde ele ganha e onde não ganha

O Haiku 4.5 marca 29,9 no índice geral e 43,9 em coding — números altos para um modelo da família "pequena". Em agentic, fica em 16,5, distante dos 31,1 do o3 no agregado. A leitura honesta: ele é um Sonnet 4 com menos músculo, não um o3 com menos conta. Serve para fluxos onde o raciocínio precisa estar presente, mas o pico de capacidade não precisa ser o estado da arte.

Índice de inteligência (Artificial Analysis)
Claude Haiku 4.529,9gpt-oss-120b24,1o331,1índice
Fonte: Artificial Analysis

A velocidade reportada de 90 tokens por segundo coloca ele atrás do gpt-oss-120b (155 t/s), que é open-weight e custa US$ 0,17 por milhão de saída. Se o seu gargalo é latência pura e o orçamento é curto, o gpt-oss-120b ainda vence no papel. A diferença é que o Haiku 4.5 é multimodal — aceita imagem e arquivo — e o gpt-oss só lê texto. Para extrair dados de PDFs, screenshots e diagramas, o Haiku 4.5 não tem substituto direto na faixa de preço.

Ficha técnica — Claude Haiku 4.5
CampoValor
Identificadoranthropic/claude-haiku-4.5
Criadoranthropic
Preço de entradaUS$ 1.00 / M tokens
Preço de saídaUS$ 5.00 / M tokens
Janela de contexto200k
Modalidadetext+image+file->text
Leitura de cacheUS$ 0.100 / M (90% de desconto)
Índice de inteligência (AA)29.9
Índice de código43.9
Índice agêntico16.5
Pesosfechados
Velocidade de saída90 tokens/s
Raciocíniosim (gasta tokens de saída pensando)

O tabuleiro em 15 de outubro

O catálogo tem 258 modelos hoje e 40 criadores. Nos últimos 30 dias, 31 modelos foram lançados — o ritmo não diminuiu. No topo da inteligência, a ordem é o3 (31,1), Haiku 4.5 (29,9), gpt-oss-120b (24,1), Qwen3 Next 80B Thinking (16,9) e gpt-oss-20b (15,2). Repare: o Haiku 4.5 entra em segundo lugar absoluto, à frente de qualquer modelo aberto e de qualquer coisa da Qwen.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 258 modelos disponíveis no catálogo nesta data.
Inteligência × preço de saída
Claude Haiku 4.5gpt-oss-120bo3US$ por milhão (saída, escala log)índice de inteligência

O detalhe que muda a conta de verdade é o cache de leitura: US$ 0,10 por milhão de tokens. Quem repete system prompts longos, quem encadeia agentes que relêm o mesmo contexto, quem faz RAG com retrieval recorrente — esse preço derruba o custo efetivo para uma fração do nominal. É o tipo de detalhe que não aparece no headline e aparece na fatura.

Para quem vale e para quem não vale

Vale para você se: roda volume alto de texto+imagem, precisa de raciocínio consistente, quer Anthropic na stack e o o3 estoura o orçamento. Vale especialmente se você já usava Sonnet e quer migrar chamadas de baixa criticidade para baratear a fatura sem perder o ecossistema.

Não vale se: o gargalo é latência (vá de gpt-oss-120b), o caso de uso é puramente texto e o orçamento é apertado (vá de gpt-oss-20b a US$ 0,13 por milhão), ou você precisa do teto de capacidade em coding/agentic — aí o o3 ainda é o3.

Como se compara com o que já estava disponível
ModeloInteligênciaEntrada US$/MSaída US$/MContexto
Claude Haiku 4.5 (o novo)29.915200k
gpt-oss-120b24.10.0370.17131k
o331.128200k
Preços do catálogo do OpenRouter na data. Inteligência pelo Artificial Analysis.

A implicação prática é direta: revise os prompts do seu produto que hoje vão para o o3 ou para Sonnet 4, separe os que não precisam do pico, e redirecione para o Haiku 4.5. Em muitos produtos, isso é 40 a 60% do volume de chamadas — e é exatamente onde mora a economia.

Em uma frase

Mande para o Haiku 4.5 o que hoje vai para o o3 mas não precisa do pico de capacidade: a economia aparece na fatura sem perder raciocínio nem multimodalidade.

Perguntas frequentes

Claude Haiku 4.5 é melhor que o o3?

Não. No índice geral, o Haiku 4.5 marca 29,9 contra 31,1 do o3 — uma diferença pequena. Em agentic, o o3 lidera com folga. O Haiku 4.5 compete em custo por inteligência entregue, não em capacidade absoluta.

Quanto custa usar o Claude Haiku 4.5 na API?

US$ 1 por milhão de tokens de entrada e US$ 5 por milhão de tokens de saída. O cache de leitura sai por US$ 0,10 por milhão, o que reduz muito o custo em fluxos com system prompt repetido.

Haiku 4.5 substitui o gpt-oss-120b?

Depende do caso. O gpt-oss-120b é open-weight, mais rápido (155 t/s contra 90) e custa US$ 0,17 por milhão de saída — imbatível em texto puro e baixo orçamento. O Haiku 4.5 vence quando a tarefa envolve imagem ou arquivo, ou quando você precisa do ecossistema Anthropic.

Leia também