FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Sonnet 4.6 batch: o mesmo modelo por 40% menos, com uma fila no meio

A Anthropic cortou o preço do Claude Sonnet 4.6 na fila batch três dias após o lançamento. O que muda no seu pipeline e o que continua igual.

Redação FalaVIP IA 3 min de leitura
US$ 1,50por milhão de tokens de entrada
US$ 7,50por milhão de tokens de saída
US$ 0,15por milhão de tokens em cache

Três dias depois de colocar o Claude Sonnet 4.6 no catálogo, a Anthropic fez o movimento que costuma confundir quem está olhando a fatura: criou a variante :batch e jogou o preço para baixo. A pergunta que você precisa responder antes de migrar qualquer coisa é simples — vale trocar velocidade por economia no seu caso?

O que mudou de verdade no preço

O Sonnet 4.6 em modo batch custa US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída. O cache de prompts sai por US$ 0,15 por milhão. Esses são os números que importam quando você roda um pipeline que cospe JSON o dia inteiro. Para uma chamada média de mil tokens de entrada e 400 de saída, cada requisição sai por algo em torno de US$ 0,0045 — quatro milésimos de dólar por execução. Em volume, é o tipo de diferença que aparece no fim do mês.

Ficha técnica — Claude Sonnet 4.6 (batch)
CampoValor
Identificadoranthropic/claude-sonnet-4.6:batch
Criadoranthropic
Preço de entradaUS$ 1.50 / M tokens
Preço de saídaUS$ 7.50 / M tokens
Janela de contexto1M
Modalidadetext+image+file->text
Leitura de cacheUS$ 0.150 / M (90% de desconto)

O que NÃO mudou

O modelo é o mesmo Sonnet 4.6. Mesma janela de contexto de 1 milhão de tokens, mesma multimodalidade texto+imagem+arquivo gerando texto. A descrição oficial segue sendo a mesma do lançamento: foco em coding, agents e trabalho profissional, com destaque para desenvolvimento iterativo e navegação em codebases grandes. O que entra na fila batch é literalmente a mesma inferência, só que com SLA diferente.

E aqui está o ponto que o marketing da Anthropic não grita: batch significa fila. Você submete um lote de requisições e o provedor promete devolver em até 24 horas, normalmente bem antes. Não é para chat em tempo real, não é para um agente que está esperando o próximo passo do usuário. É para jobs que rodam em background — reescrita de documentação, classificação de tickets, geração de embeddings semânticos, sumarização de logs, pipelines de extração.

Quem está na frente hoje

Olhando o topo do catálogo nesta data, o cenário é claro. O Gemini 3.1 Pro Preview da Google lidera o índice de inteligência com 47,7 e cobra US$ 12 por milhão de tokens de saída. O Sonnet 4.6, na versão síncrona, aparece em segundo com IQ 35,1 e US$ 15 por milhão de saída — mais caro que o Gemini e atrás no índice. A versão batch muda a equação de preço, não a de capacidade.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
o331.18
Entre os 340 modelos disponíveis no catálogo nesta data.

Atrás dele aparecem o Qwen3.5 397B A17B (IQ 34,3, US$ 2,34 de saída), o Xiaomi MiMo-V2-Flash (IQ 34,0, US$ 0,30 de saída) e o OpenAI o3 (IQ 31,1, US$ 8 de saída). Ou seja: para a tarefa certa, o batch do Sonnet 4.6 não é a opção mais barata do mercado — o MiMo da Xiaomi custa 25 vezes menos por token de saída. É a opção mais barata entre os modelos de fronteira com capacidade agentic decente e 1 milhão de contexto.

Para quem vale a troca

Se você já roda jobs assíncronos no Sonnet 4.6 síncrono e está pagando US$ 15 por milhão de saída, a migração para :batch é quase automática — você troca o endpoint, aceita a latência de fila e corta a conta. Para extração em massa de documentos, geração de datasets sintéticos, varredura de repositórios para indexação ou qualquer coisa que não tem usuário esperando do outro lado, é dinheiro na mesa.

Se o seu caso é agente conversacional, ferramenta que responde em tempo real ou qualquer fluxo onde o usuário trava a tela esperando o token, batch não é a ferramenta certa. A variante síncrona continua sendo a única opção.

O que ninguém te conta sobre a fila

A Anthropic não publica SLA rígido para batch além da janela de 24 horas. Na prática, em horários de pico a fila enche e o job pode demorar mais do que o esperado. Para pipelines críticos com deadline, isso vira variável de risco. Para jobs noturnos, é uma não-questão.

E tem mais um detalhe que o catálogo não entrega: o índice de inteligência do :batch não foi publicado separadamente. Como é o mesmo modelo servindo requisições, a capacidade cognitiva é idêntica — mas vale você rodar seu próprio eval antes de mover produção inteira, porque latência e throughput afetam throughput agregado mesmo quando a qualidade do token é a mesma.

Em uma frase

Se o seu pipeline já roda em background, trocar o endpoint para `:batch` é a forma mais rápida de cortar a conta do Claude sem perder capacidade — basta aceitar a fila de até 24 horas.

Perguntas frequentes

Claude Sonnet 4.6 batch é mais barato que a versão normal?

Sim. A versão batch custa US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de saída, contra os preços mais altos da variante síncrona. A diferença é a latência: batch devolve em até 24 horas, dentro de uma fila.

Quando NÃO vale usar a versão batch?

Em qualquer fluxo onde o usuário está esperando resposta em tempo real — chat, agentes interativos, ferramentas com UI bloqueada. Batch serve para jobs assíncronos: classificação, sumarização, extração, geração de datasets.

O Sonnet 4.6 batch é o mesmo modelo que o Sonnet 4.6 normal?

Sim, é o mesmo modelo com a mesma janela de 1 milhão de tokens e a mesma multimodalidade. O que muda é apenas o SLA: a versão batch roda em fila com janela de 24 horas, a síncrona atende em tempo real.

Leia também