Cache de LLM: 10x mais barato, exceto em um modelo da OpenAI
Dos 141 modelos do catálogo que publicam preço de cache, quase todos dão 10% do input. Um deles cobra o mesmo valor — e é justamente o open-weight mais barato da casa.
A conta que ninguém mostra no card de preço
Você compara o input, escolhe o modelo "barato" e a conta no fim do mês não fecha. O culpado quase nunca é o input — é o cache. Dos 313 modelos no catálogo hoje, 141 publicam preço de leitura em cache, e é nessa coluna que mora a distância entre "barato" e "barato de verdade".
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
A regra dos 10x
Quando o provedor separa o preço de cache, o padrão é simples: custa um décimo do input. No recorte atual, isso vale para quatro modelos entre os mais capazes:
- Xiaomi MiMo-V2-Flash: input US$ 0,10, cache US$ 0,01 por milhão de tokens
- Anthropic Claude Haiku 4.5: input US$ 1,00, cache US$ 0,10
- Mistral Devstral 2 2512: input US$ 0,40, cache US$ 0,04
- Mistral Large 3 2512 (lançado em 1º de dezembro): input US$ 0,50, cache US$ 0,05
A leitura em cache reaproveita o prefixo já processado em chamadas anteriores. Pense num system prompt de 5 mil tokens que se repete em toda chamada de um agente. Sem cache, você paga o input cheio 100% das vezes. Com cache, esse trecho vira 10% do custo. Em workloads com contexto longo e prefixo estável — RAG, agentes, code review repetitivo, sumarização em cima de documento fixo — isso é a diferença entre uma API viável e uma que estoura a fatura.
Frameworks como LangChain e LlamaIndex já emitem o mesmo prefixo de sistema por padrão; basta o backend do provedor marcar a porção cacheável. O que muda é quem paga menos por isso — e, no recorte, quase todo mundo paga 10% do input.
A exceção que ninguém comenta
Entre os modelos destacados do recorte, o gpt-oss-20b da OpenAI quebra o padrão: input US$ 0,03 por milhão, cache US$ 0,03 por milhão. Desconto zero. O modelo aberto mais barato da casa não oferece economia em cache. O NVIDIA Nemotron 3 Nano 30B A3B também escapa, mas com desconto menor: 2x (US$ 0,05 input, US$ 0,025 cache). O Qwen3 Next 80B Instruct cobra US$ 0,07 de cache sobre input de US$ 0,10 — fator 1,4x, quase irrelevante.
O detalhe pesa porque a escolha de "modelo barato" costuma olhar só o input. Em produção, se sua carga repete prefixo, o modelo com input maior mas cache agressivo ganha fácil — mesmo que o header de preço pareça pior. Pegue o MiMo: input 3,3x mais caro que o gpt-oss-20b, mas cache 3x mais barato. Em workload com prefixo longo, a conta final pende para o lado chinês.
Para quem isso muda a conta — e para quem é indiferente
Importa repensar se você roda agente, RAG com prompt fixo ou qualquer workload que bate no mesmo contexto dezenas de vezes por minuto. Os 21 modelos lançados nos últimos 30 dias do catálogo tendem a ser justamente os voltados para esse perfil — vale olhar a coluna de cache antes de decidir.
Não muda nada se você faz 50 chamadas curtas por dia sem prefixo repetido — paga input e pronto. Quem faz chamada única com contexto variável, ou usa batch off-line sem repetição, não se beneficia.
A regra prática é direta: para cada modelo candidato, pegue o preço de cache, multiplique pelo tamanho típico do prefixo estável e pelo volume de chamadas. Some com o input restante. Compare o total — não o header.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| o3 | openai | 31.1 | 8 | 200k |
| Claude Haiku 4.5 | anthropic | 29.9 | 5 | 200k |
| Devstral 2 2512 | mistralai | 19.2 | 2 | 262k |
| Mistral Large 3 2512 | mistralai | 15.9 | 1.5 | 262k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Nemotron 3 Nano 30B A3B | nvidia | 14.5 | 0.2 | 262k |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
O scatter mostra o que a tabela esconde em uma olhada: o MiMo da Xiaomi lidera o recorte em IQ (34,024) com cache de US$ 0,01 — o menor do recorte. O o3 da OpenAI cobra US$ 0,50 de cache, o mais caro entre os modelos com índice acima de 30. Mas US$ 0,50 ainda é 4x menos que o input de US$ 2,00 do próprio o3 — o desconto existe, só não é tão agressivo quanto a média. O Claude Haiku 4.5 fecha o pódio de inteligência do recorte com cache em US$ 0,10: input dez vezes o cache, exatamente o padrão que o gpt-oss-20b ignora.
Se seu workload repete prefixo, ignore o header de input e olhe a coluna de cache: ela decide a maior parte da conta.
Perguntas frequentes
O que é cache de tokens em uma API de LLM?
Cache é a cobrança separada por tokens já lidos em chamadas anteriores. O provedor reaproveita o prefixo processado e cobra uma fração do preço de input — em geral 10x menos — porque não precisa recomputar a parte repetida do prompt.
Por que o gpt-oss-20b não tem desconto de cache?
No recorte desta data, a OpenAI cobra US$ 0,03 por milhão tanto no input quanto no cache do gpt-oss-20b. É a exceção entre os modelos com preço de cache publicado e quebra o padrão de 10x mais barato que domina o recorte.
Quando o cache realmente economiza dinheiro?
Quando o prefixo é estável entre chamadas — agentes, RAG com system prompt fixo, code review em cima do mesmo repositório. Em chamadas únicas ou com contexto sempre diferente, cache não muda a conta.