Sonnet 4.6 batch: o mesmo modelo por 40% menos, com uma fila no meio
A Anthropic cortou o preço do Claude Sonnet 4.6 na fila batch três dias após o lançamento. O que muda no seu pipeline e o que continua igual.
Três dias depois de colocar o Claude Sonnet 4.6 no catálogo, a Anthropic fez o movimento que costuma confundir quem está olhando a fatura: criou a variante :batch e jogou o preço para baixo. A pergunta que você precisa responder antes de migrar qualquer coisa é simples — vale trocar velocidade por economia no seu caso?
O que mudou de verdade no preço
O Sonnet 4.6 em modo batch custa US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída. O cache de prompts sai por US$ 0,15 por milhão. Esses são os números que importam quando você roda um pipeline que cospe JSON o dia inteiro. Para uma chamada média de mil tokens de entrada e 400 de saída, cada requisição sai por algo em torno de US$ 0,0045 — quatro milésimos de dólar por execução. Em volume, é o tipo de diferença que aparece no fim do mês.
| Campo | Valor |
|---|---|
| Identificador | anthropic/claude-sonnet-4.6:batch |
| Criador | anthropic |
| Preço de entrada | US$ 1.50 / M tokens |
| Preço de saída | US$ 7.50 / M tokens |
| Janela de contexto | 1M |
| Modalidade | text+image+file->text |
| Leitura de cache | US$ 0.150 / M (90% de desconto) |
O que NÃO mudou
O modelo é o mesmo Sonnet 4.6. Mesma janela de contexto de 1 milhão de tokens, mesma multimodalidade texto+imagem+arquivo gerando texto. A descrição oficial segue sendo a mesma do lançamento: foco em coding, agents e trabalho profissional, com destaque para desenvolvimento iterativo e navegação em codebases grandes. O que entra na fila batch é literalmente a mesma inferência, só que com SLA diferente.
E aqui está o ponto que o marketing da Anthropic não grita: batch significa fila. Você submete um lote de requisições e o provedor promete devolver em até 24 horas, normalmente bem antes. Não é para chat em tempo real, não é para um agente que está esperando o próximo passo do usuário. É para jobs que rodam em background — reescrita de documentação, classificação de tickets, geração de embeddings semânticos, sumarização de logs, pipelines de extração.
Quem está na frente hoje
Olhando o topo do catálogo nesta data, o cenário é claro. O Gemini 3.1 Pro Preview da Google lidera o índice de inteligência com 47,7 e cobra US$ 12 por milhão de tokens de saída. O Sonnet 4.6, na versão síncrona, aparece em segundo com IQ 35,1 e US$ 15 por milhão de saída — mais caro que o Gemini e atrás no índice. A versão batch muda a equação de preço, não a de capacidade.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
Atrás dele aparecem o Qwen3.5 397B A17B (IQ 34,3, US$ 2,34 de saída), o Xiaomi MiMo-V2-Flash (IQ 34,0, US$ 0,30 de saída) e o OpenAI o3 (IQ 31,1, US$ 8 de saída). Ou seja: para a tarefa certa, o batch do Sonnet 4.6 não é a opção mais barata do mercado — o MiMo da Xiaomi custa 25 vezes menos por token de saída. É a opção mais barata entre os modelos de fronteira com capacidade agentic decente e 1 milhão de contexto.
Para quem vale a troca
Se você já roda jobs assíncronos no Sonnet 4.6 síncrono e está pagando US$ 15 por milhão de saída, a migração para :batch é quase automática — você troca o endpoint, aceita a latência de fila e corta a conta. Para extração em massa de documentos, geração de datasets sintéticos, varredura de repositórios para indexação ou qualquer coisa que não tem usuário esperando do outro lado, é dinheiro na mesa.
Se o seu caso é agente conversacional, ferramenta que responde em tempo real ou qualquer fluxo onde o usuário trava a tela esperando o token, batch não é a ferramenta certa. A variante síncrona continua sendo a única opção.
O que ninguém te conta sobre a fila
A Anthropic não publica SLA rígido para batch além da janela de 24 horas. Na prática, em horários de pico a fila enche e o job pode demorar mais do que o esperado. Para pipelines críticos com deadline, isso vira variável de risco. Para jobs noturnos, é uma não-questão.
E tem mais um detalhe que o catálogo não entrega: o índice de inteligência do :batch não foi publicado separadamente. Como é o mesmo modelo servindo requisições, a capacidade cognitiva é idêntica — mas vale você rodar seu próprio eval antes de mover produção inteira, porque latência e throughput afetam throughput agregado mesmo quando a qualidade do token é a mesma.
Se o seu pipeline já roda em background, trocar o endpoint para `:batch` é a forma mais rápida de cortar a conta do Claude sem perder capacidade — basta aceitar a fila de até 24 horas.
Perguntas frequentes
Claude Sonnet 4.6 batch é mais barato que a versão normal?
Sim. A versão batch custa US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de saída, contra os preços mais altos da variante síncrona. A diferença é a latência: batch devolve em até 24 horas, dentro de uma fila.
Quando NÃO vale usar a versão batch?
Em qualquer fluxo onde o usuário está esperando resposta em tempo real — chat, agentes interativos, ferramentas com UI bloqueada. Batch serve para jobs assíncronos: classificação, sumarização, extração, geração de datasets.
O Sonnet 4.6 batch é o mesmo modelo que o Sonnet 4.6 normal?
Sim, é o mesmo modelo com a mesma janela de 1 milhão de tokens e a mesma multimodalidade. O que muda é apenas o SLA: a versão batch roda em fila com janela de 24 horas, a síncrona atende em tempo real.