Cache de prompt custa 10% do preço de entrada em 141 modelos
Dois em cada três modelos do catálogo cobram cache a um décimo do token de input — e isso muda a conta de quem repete contexto.
A diferença que ninguém comenta no release
Você olha a tabela de preços, vê o valor de entrada e o de saída, e ignora a terceira coluna. Ela existe, está ali, e pode ser a linha que decide se um agente entra em produção ou fica no notebook. Dos 314 modelos listados hoje, 141 publicam preço de cache de prompt — e o padrão que aparece quando se olha o recorte inteiro é claro: cache custa, em média, 10% do token de entrada.
Traduzindo o que isso significa na prática: se você paga US$ 1 por milhão de tokens de input, paga US$ 0,10 por milhão de tokens cacheados. A diferença não é cosmético. Em qualquer workload que repete contexto — RAG com base estável, system prompt longo, ferramenta que reenvia o mesmo trecho de código a cada chamada — o cache é onde mora a economia.
Os números que importam hoje
O catálogo tem 314 modelos ativos, vindos de 48 criadores. O topo de inteligência atual, medido pelo índice da casa, é o Xiaomi MiMo-V2-Flash (IQ 34,024), seguido por OpenAI o3 (31,096) e Anthropic Claude Haiku 4.5 (29,892). Os três publicam cache — e os três cobram de forma bem diferente pelo mesmo conceito.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| o3 | openai | 31.1 | 8 | 200k |
| Claude Haiku 4.5 | anthropic | 29.9 | 5 | 200k |
| Devstral 2 2512 | mistralai | 19.2 | 2 | 262k |
| Mistral Large 3 2512 | mistralai | 15.9 | 1.5 | 262k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Nemotron 3 Nano 30B A3B | nvidia | 14.5 | 0.2 | 262k |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
Olha o MiMo-V2-Flash: entra a US$ 0,10 por milhão, sai a US$ 0,30, e o cache sai a US$ 0,01 por milhão. É o cache mais barato do recorte, num modelo aberto (309B totais, 15B ativos), lançado em 14 de dezembro. Já o o3 cobra US$ 0,50 por milhão de cache — cinco centavos a mais que o cache do MiMo, com entrada dez vezes mais cara. O Claude Haiku 4.5 fica no meio: US$ 0,10 por milhão de cache, contra US$ 1 de entrada.
A leitura prática: a razão cache/entrada varia de 10% (MiMo, Haiku, Devstral) a 25% (o3). Não é uma constante da indústria — é decisão de cada laboratório.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem isso muda a conta — e para quem não muda nada
Se você roda um agente que reenvia o mesmo trecho a cada turno, ou um pipeline de RAG com base documental grande, cache vale ouro. Em workloads com prompts curtos e únicos — geração one-shot, sumarização de texto curto — cache não entra na conta e a coluna é só ruído.
Vale para: times que rodam agentes em loop, sistemas de RAG com contexto repetido, qualquer produto que envia system prompt de milhares de tokens a cada chamada. Não muda nada para: quem usa modelo só para geração pontual, ou quem roda local sem passar por API com cache.
O detalhe técnico, sem jargão
Pensa no cache de prompt como uma estante de marmitas: o restaurante (a API) já preparou aquele prompt antes, então te cobra só para reaquecer — não para cozinhar de novo. Por isso o desconto. O detalhe é que o cache só vale se a API conseguir reconhecer o trecho exato que você mandou antes; mudar uma vírgula invalida o hit e você paga o preço cheio. Não é mágica, é reaproveitamento literal de bytes.
O tabuleiro em janeiro de 2026
Dos dez modelos lançados nos últimos 30 dias, vários já publicam preço de cache — entre eles o MiMo-V2-Flash (Xiaomi, China), o Devstral 2 2512 (Mistral, França) e o Nemotron 3 Nano 30B A3B (NVIDIA, EUA). O recorte mostra que modelos abertos não são mais sinônimo de preço de cache mais alto: o MiMo aberto da Xiaomi cobra US$ 0,01 por milhão de cache, enquanto o o3 fechado da OpenAI cobra US$ 0,50.
A escolha prática: se cache é variável relevante para o seu workload, o MiMo-V2-Flash é o piso do mercado hoje. Se você precisa do reasoning do o3 ou do equilíbrio do Haiku 4.5, paga mais — mas ainda paga menos do que pagaria sem cache. E se está rodando Devstral 2 2512 para código agêntico, o cache a US$ 0,04 por milhão entra como linha de planilha, não como decisão de arquitetura.
Antes de comparar modelos só pelo preço de entrada, calcule quanto do seu prompt é repetido a cada chamada — é ali que o cache decide se o projeto cabe no orçamento.
Perguntas frequentes
O que é cache de prompt?
É um desconto que a API aplica quando você repete o mesmo trecho de texto em chamadas consecutivas. Em vez de processar o prompt de novo, o provedor reaproveita o que já calculou — e cobra uma fração do preço normal, tipicamente 10% do token de entrada.
Cache de prompt funciona em qualquer modelo?
Não. Dos 314 modelos ativos no catálogo hoje, 141 publicam preço de cache. Os demais ou não oferecem o recurso, ou não divulgaram a tarifa. Antes de montar arquitetura em cima de cache, confirme que o modelo escolhido tem a coluna preenchida.
Qual modelo tem o cache mais barato em janeiro de 2026?
O Xiaomi MiMo-V2-Flash lidera o recorte: US$ 0,01 por milhão de tokens de cache, contra US$ 0,10 de entrada. É modelo aberto, lançado em 14 de dezembro de 2025, e responde a US$ 0,30 por milhão de tokens de saída.