FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Claude Haiku 4.5 em modo batch custa um quinto do Sonnet; vale migrar?

A Anthropic lançou a versão assíncrona do Haiku 4.5 há nove dias. O preço é agressivo — mas o que entrega de inteligência?

Redação FalaVIP IA 3 min de leitura
US$ 0,50por milhão de tokens de entrada
US$ 2,50por milhão de tokens de saída
9 diasdesde o lançamento (15 de outubro)

O que mudou em nove dias

Você já viu tabela de preço em que a diferença entre duas linhas é um dígito? O Claude Haiku 4.5 em modo batch cobra US$ 0,50 por milhão de tokens de entrada e US$ 2,50 por milhão de tokens de saída. Some isso ao cache de leitura a US$ 0,05 e você tem um dos menores preços por token do catálogo de modelos norte-americanos. A pergunta que paga a conta é direta: o que se ganha em troca?

O que a Anthropic chama de "modo batch" é o processamento assíncrono: você empilha requisições em um arquivo, envia, e recebe as respostas depois — pode levar até 24 horas. Em troca, a empresa cobra metade do preço da versão síncrona do mesmo modelo. Para workloads que não precisam de resposta em tempo real, é um trade-off clássico de tempo por dinheiro. E, ao contrário do que o nome sugere, "batch" aqui não é um modelo diferente — é o Haiku 4.5 de sempre, só com fila e relógio mais lento.

Para que serve, de verdade

O Haiku 4.5 foi vendido pela Anthropic como "near-frontier intelligence" — inteligência quase de fronteira — a um custo baixo. Em uso prático, isso se traduz em três casos onde o modelo brilha:

  • Classificação, extração e sumarização em massa, onde o volume de tokens engolido é o que dói no orçamento.
  • Pré-processamento de prompts grandes (200k de contexto) que vão depois para um modelo maior — o cache de US$ 0,05 torna releituras quase de graça.
  • Pipelines de avaliação e geração de dados sintéticos, que toleram bem a latência de 24 horas do batch.

Onde ele não te serve: qualquer coisa que precise de resposta na hora. Chatbot no site, agente conversacional, ferramenta interativa — para isso, existe a versão síncrona do Haiku 4.5 ou concorrentes diretos como o GPT-4o mini e o Gemini Flash.

Onde ele está no tabuleiro

O catálogo tem hoje 263 modelos listados e 41 criadores diferentes. Lançamentos nos últimos 30 dias somam 26 — é um mercado que não para. Entre os modelos com nota de inteligência mais alta neste recorte, o topo pertence à OpenAI, com o o3 marcando 31,1 e o gpt-oss-120b aparecendo em terceiro com 24,1. O Haiku 4.5, na versão síncrona, figura em segundo com 29,9. A versão batch é o mesmo modelo, só com outra fila — então espere desempenho equivalente, não superior.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 263 modelos disponíveis no catálogo nesta data.

Para situar pelo preço: enquanto o o3 cobra US$ 8 por milhão de tokens de saída, o Haiku 4.5 batch cobra US$ 2,50. São 3,2 vezes mais barato na saída. O GPT-OSS-120B, por sua vez, cobra US$ 0,17 de saída, mas é um modelo de pesos abertos com proposta diferente — você roda onde quiser, não no servidor da OpenAI.

Ficha técnica — Claude Haiku 4.5 (batch)
CampoValor
Identificadoranthropic/claude-haiku-4.5:batch
Criadoranthropic
Preço de entradaUS$ 0.500 / M tokens
Preço de saídaUS$ 2.50 / M tokens
Janela de contexto200k
Modalidadetext+image+file->text
Leitura de cacheUS$ 0.050 / M (90% de desconto)

Quem ganha e quem nem nota diferença

Vale migrar para você se: você já roda Haiku 4.5 síncrono em tarefas que tolerariam esperar algumas horas, ou se sua fatura de API da Anthropic está com peso grande de tokens de saída em jobs de classificação e extração. Para esses casos, a economia de 50% sobre o preço padrão é direta.

Não muda nada para você se: seu uso é conversacional, interativo, ou depende de baixa latência — o batch vai te atrasar. Também não vale trocar de provedor só por isso: o o3 e o GPT-OSS entregam níveis diferentes de capacidade, e o salto de capacidade pode compensar o salto de preço dependendo do workload.

O que fazer com essa informação

Se você roda jobs noturnos de sumarização, classificação de tickets, extração de entidades em milhares de documentos, ou geração de dataset sintético para fine-tuning, teste o Haiku 4.5 batch. Meça latência aceitável, meça qualidade contra o que você usa hoje, e calcule o custo por documento processado — não por token, que distorce. Se o número fechar, migre. Se não fechar, espere: a fila de lançamentos dos últimos 30 dias sugere que algo mais barato ainda está a caminho.

Em uma frase

Roteirize jobs tolerantes a latência para o Haiku 4.5 batch e meça custo por documento, não por token; para uso interativo, o modo síncrono ou outro modelo continua sendo o caminho.

Perguntas frequentes

Qual a diferença entre Claude Haiku 4.5 e a versão batch?

É o mesmo modelo, com a mesma capacidade. A diferença é operacional: o batch processa requisições de forma assíncrona, com retorno em até 24 horas, e cobra metade do preço da versão síncrona.

Quanto custa o Claude Haiku 4.5 batch por token?

US$ 0,50 por milhão de tokens de entrada, US$ 2,50 por milhão de tokens de saída e US$ 0,05 por milhão de tokens em cache de leitura. É metade do preço do Haiku 4.5 síncrono.

Vale a pena trocar do Haiku 4.5 síncrono para o batch?

Só se o seu caso de uso tolerar esperar horas pela resposta — classificação em massa, geração de dados sintéticos, pré-processamento de prompts. Para chatbots e agentes interativos, o batch piora a experiência sem ganho real.

Leia também