FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Cache de prompt custa 10% do preço de entrada em 141 modelos

Dois em cada três modelos do catálogo cobram cache a um décimo do token de input — e isso muda a conta de quem repete contexto.

Redação FalaVIP IA 3 min de leitura
141modelos no recorte de cache
US$ 0,01por milhão de tokens de cache no MiMo-V2-Flash
10%razão típica entre cache e preço de entrada

A diferença que ninguém comenta no release

Você olha a tabela de preços, vê o valor de entrada e o de saída, e ignora a terceira coluna. Ela existe, está ali, e pode ser a linha que decide se um agente entra em produção ou fica no notebook. Dos 314 modelos listados hoje, 141 publicam preço de cache de prompt — e o padrão que aparece quando se olha o recorte inteiro é claro: cache custa, em média, 10% do token de entrada.

Traduzindo o que isso significa na prática: se você paga US$ 1 por milhão de tokens de input, paga US$ 0,10 por milhão de tokens cacheados. A diferença não é cosmético. Em qualquer workload que repete contexto — RAG com base estável, system prompt longo, ferramenta que reenvia o mesmo trecho de código a cada chamada — o cache é onde mora a economia.

Inteligência × preço no recorte
MiMo-V2-Flasho3Claude Haiku 4.5Devstral 2 2512Mistral Large 3 2512gpt-oss-20bNemotron 3 Nano 30B A3BQwen3 Next 80B A3B InstructUS$ por milhão (saída, escala log)índice de inteligência

Os números que importam hoje

O catálogo tem 314 modelos ativos, vindos de 48 criadores. O topo de inteligência atual, medido pelo índice da casa, é o Xiaomi MiMo-V2-Flash (IQ 34,024), seguido por OpenAI o3 (31,096) e Anthropic Claude Haiku 4.5 (29,892). Os três publicam cache — e os três cobram de forma bem diferente pelo mesmo conceito.

Destaques do recorte: o preço do cache
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
Devstral 2 2512mistralai19.22262k
Mistral Large 3 2512mistralai15.91.5262k
gpt-oss-20bopenai15.20.13131k
Nemotron 3 Nano 30B A3Bnvidia14.50.2262k
Qwen3 Next 80B A3B Instructqwen13.81.1262k

Olha o MiMo-V2-Flash: entra a US$ 0,10 por milhão, sai a US$ 0,30, e o cache sai a US$ 0,01 por milhão. É o cache mais barato do recorte, num modelo aberto (309B totais, 15B ativos), lançado em 14 de dezembro. Já o o3 cobra US$ 0,50 por milhão de cache — cinco centavos a mais que o cache do MiMo, com entrada dez vezes mais cara. O Claude Haiku 4.5 fica no meio: US$ 0,10 por milhão de cache, contra US$ 1 de entrada.

A leitura prática: a razão cache/entrada varia de 10% (MiMo, Haiku, Devstral) a 25% (o3). Não é uma constante da indústria — é decisão de cada laboratório.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 314 modelos disponíveis no catálogo nesta data.

Para quem isso muda a conta — e para quem não muda nada

Se você roda um agente que reenvia o mesmo trecho a cada turno, ou um pipeline de RAG com base documental grande, cache vale ouro. Em workloads com prompts curtos e únicos — geração one-shot, sumarização de texto curto — cache não entra na conta e a coluna é só ruído.

Vale para: times que rodam agentes em loop, sistemas de RAG com contexto repetido, qualquer produto que envia system prompt de milhares de tokens a cada chamada. Não muda nada para: quem usa modelo só para geração pontual, ou quem roda local sem passar por API com cache.

O detalhe técnico, sem jargão

Pensa no cache de prompt como uma estante de marmitas: o restaurante (a API) já preparou aquele prompt antes, então te cobra só para reaquecer — não para cozinhar de novo. Por isso o desconto. O detalhe é que o cache só vale se a API conseguir reconhecer o trecho exato que você mandou antes; mudar uma vírgula invalida o hit e você paga o preço cheio. Não é mágica, é reaproveitamento literal de bytes.

O tabuleiro em janeiro de 2026

Dos dez modelos lançados nos últimos 30 dias, vários já publicam preço de cache — entre eles o MiMo-V2-Flash (Xiaomi, China), o Devstral 2 2512 (Mistral, França) e o Nemotron 3 Nano 30B A3B (NVIDIA, EUA). O recorte mostra que modelos abertos não são mais sinônimo de preço de cache mais alto: o MiMo aberto da Xiaomi cobra US$ 0,01 por milhão de cache, enquanto o o3 fechado da OpenAI cobra US$ 0,50.

A escolha prática: se cache é variável relevante para o seu workload, o MiMo-V2-Flash é o piso do mercado hoje. Se você precisa do reasoning do o3 ou do equilíbrio do Haiku 4.5, paga mais — mas ainda paga menos do que pagaria sem cache. E se está rodando Devstral 2 2512 para código agêntico, o cache a US$ 0,04 por milhão entra como linha de planilha, não como decisão de arquitetura.

Em uma frase

Antes de comparar modelos só pelo preço de entrada, calcule quanto do seu prompt é repetido a cada chamada — é ali que o cache decide se o projeto cabe no orçamento.

Perguntas frequentes

O que é cache de prompt?

É um desconto que a API aplica quando você repete o mesmo trecho de texto em chamadas consecutivas. Em vez de processar o prompt de novo, o provedor reaproveita o que já calculou — e cobra uma fração do preço normal, tipicamente 10% do token de entrada.

Cache de prompt funciona em qualquer modelo?

Não. Dos 314 modelos ativos no catálogo hoje, 141 publicam preço de cache. Os demais ou não oferecem o recurso, ou não divulgaram a tarifa. Antes de montar arquitetura em cima de cache, confirme que o modelo escolhido tem a coluna preenchida.

Qual modelo tem o cache mais barato em janeiro de 2026?

O Xiaomi MiMo-V2-Flash lidera o recorte: US$ 0,01 por milhão de tokens de cache, contra US$ 0,10 de entrada. É modelo aberto, lançado em 14 de dezembro de 2025, e responde a US$ 0,30 por milhão de tokens de saída.

Leia também