FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Cache de LLM: 10x mais barato, exceto em um modelo da OpenAI

Dos 141 modelos do catálogo que publicam preço de cache, quase todos dão 10% do input. Um deles cobra o mesmo valor — e é justamente o open-weight mais barato da casa.

Redação FalaVIP IA 3 min de leitura
US$ 0,01por milhão de tokens — cache do MiMo da Xiaomi
US$ 0,50por milhão de tokens — cache do o3 da OpenAI
141 de 313modelos do catálogo publicam preço de cache

A conta que ninguém mostra no card de preço

Você compara o input, escolhe o modelo "barato" e a conta no fim do mês não fecha. O culpado quase nunca é o input — é o cache. Dos 313 modelos no catálogo hoje, 141 publicam preço de leitura em cache, e é nessa coluna que mora a distância entre "barato" e "barato de verdade".

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 313 modelos disponíveis no catálogo nesta data.

A regra dos 10x

Quando o provedor separa o preço de cache, o padrão é simples: custa um décimo do input. No recorte atual, isso vale para quatro modelos entre os mais capazes:

  • Xiaomi MiMo-V2-Flash: input US$ 0,10, cache US$ 0,01 por milhão de tokens
  • Anthropic Claude Haiku 4.5: input US$ 1,00, cache US$ 0,10
  • Mistral Devstral 2 2512: input US$ 0,40, cache US$ 0,04
  • Mistral Large 3 2512 (lançado em 1º de dezembro): input US$ 0,50, cache US$ 0,05

A leitura em cache reaproveita o prefixo já processado em chamadas anteriores. Pense num system prompt de 5 mil tokens que se repete em toda chamada de um agente. Sem cache, você paga o input cheio 100% das vezes. Com cache, esse trecho vira 10% do custo. Em workloads com contexto longo e prefixo estável — RAG, agentes, code review repetitivo, sumarização em cima de documento fixo — isso é a diferença entre uma API viável e uma que estoura a fatura.

Frameworks como LangChain e LlamaIndex já emitem o mesmo prefixo de sistema por padrão; basta o backend do provedor marcar a porção cacheável. O que muda é quem paga menos por isso — e, no recorte, quase todo mundo paga 10% do input.

Inteligência × preço no recorte
MiMo-V2-Flasho3Claude Haiku 4.5Devstral 2 2512Mistral Large 3 2512gpt-oss-20bNemotron 3 Nano 30B A3BQwen3 Next 80B A3B InstructUS$ por milhão (saída, escala log)índice de inteligência

A exceção que ninguém comenta

Entre os modelos destacados do recorte, o gpt-oss-20b da OpenAI quebra o padrão: input US$ 0,03 por milhão, cache US$ 0,03 por milhão. Desconto zero. O modelo aberto mais barato da casa não oferece economia em cache. O NVIDIA Nemotron 3 Nano 30B A3B também escapa, mas com desconto menor: 2x (US$ 0,05 input, US$ 0,025 cache). O Qwen3 Next 80B Instruct cobra US$ 0,07 de cache sobre input de US$ 0,10 — fator 1,4x, quase irrelevante.

O detalhe pesa porque a escolha de "modelo barato" costuma olhar só o input. Em produção, se sua carga repete prefixo, o modelo com input maior mas cache agressivo ganha fácil — mesmo que o header de preço pareça pior. Pegue o MiMo: input 3,3x mais caro que o gpt-oss-20b, mas cache 3x mais barato. Em workload com prefixo longo, a conta final pende para o lado chinês.

Para quem isso muda a conta — e para quem é indiferente

Importa repensar se você roda agente, RAG com prompt fixo ou qualquer workload que bate no mesmo contexto dezenas de vezes por minuto. Os 21 modelos lançados nos últimos 30 dias do catálogo tendem a ser justamente os voltados para esse perfil — vale olhar a coluna de cache antes de decidir.

Não muda nada se você faz 50 chamadas curtas por dia sem prefixo repetido — paga input e pronto. Quem faz chamada única com contexto variável, ou usa batch off-line sem repetição, não se beneficia.

A regra prática é direta: para cada modelo candidato, pegue o preço de cache, multiplique pelo tamanho típico do prefixo estável e pelo volume de chamadas. Some com o input restante. Compare o total — não o header.

Destaques do recorte: o preço do cache
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
Devstral 2 2512mistralai19.22262k
Mistral Large 3 2512mistralai15.91.5262k
gpt-oss-20bopenai15.20.13131k
Nemotron 3 Nano 30B A3Bnvidia14.50.2262k
Qwen3 Next 80B A3B Instructqwen13.81.1262k

O scatter mostra o que a tabela esconde em uma olhada: o MiMo da Xiaomi lidera o recorte em IQ (34,024) com cache de US$ 0,01 — o menor do recorte. O o3 da OpenAI cobra US$ 0,50 de cache, o mais caro entre os modelos com índice acima de 30. Mas US$ 0,50 ainda é 4x menos que o input de US$ 2,00 do próprio o3 — o desconto existe, só não é tão agressivo quanto a média. O Claude Haiku 4.5 fecha o pódio de inteligência do recorte com cache em US$ 0,10: input dez vezes o cache, exatamente o padrão que o gpt-oss-20b ignora.

Em uma frase

Se seu workload repete prefixo, ignore o header de input e olhe a coluna de cache: ela decide a maior parte da conta.

Perguntas frequentes

O que é cache de tokens em uma API de LLM?

Cache é a cobrança separada por tokens já lidos em chamadas anteriores. O provedor reaproveita o prefixo processado e cobra uma fração do preço de input — em geral 10x menos — porque não precisa recomputar a parte repetida do prompt.

Por que o gpt-oss-20b não tem desconto de cache?

No recorte desta data, a OpenAI cobra US$ 0,03 por milhão tanto no input quanto no cache do gpt-oss-20b. É a exceção entre os modelos com preço de cache publicado e quebra o padrão de 10x mais barato que domina o recorte.

Quando o cache realmente economiza dinheiro?

Quando o prefixo é estável entre chamadas — agentes, RAG com system prompt fixo, code review em cima do mesmo repositório. Em chamadas únicas ou com contexto sempre diferente, cache não muda a conta.

Leia também