Cache do OpenAI o3 custa 50 vezes o do Xiaomi MiMo
Mesmo serviço para reusar um prompt já processado: a diferença vai de zero desconto a US$ 0,01 por milhão de tokens. Quase metade do catálogo está nesse jogo.
O abismo de 50x entre dois vizinhos de tabela
Pega dois modelos quase vizinhos em capacidade no catálogo de hoje. O Xiaomi MiMo-V2-Flash, no topo do índice de IQ com 34,024, cobra US$ 0,01 por milhão de tokens de cache. O OpenAI o3, logo abaixo com IQ 31,096, cobra US$ 0,50. Mesmo serviço, mesma função — a economia de reusar um prompt já processado. Cinquenta vezes mais caro.
O que é cache, em uma frase
Cache é o desconto de quem já leu o prompt antes. O provedor processou aquele bloco de texto uma vez; cobrar preço cheio de novo é cobrar em duplicidade. Em workloads que repetem contexto — RAG, agentes, ferramentas com system prompt longo — o cache vira a maior parte da conta. E aqui o tamanho do contexto importa: todos os modelos do recorte têm entre 131 mil e 262 mil tokens de janela. É o tipo de janela em que o cache deixa de ser opcional.
O padrão que aparece quando você olha 146 modelos juntos
O recorte deste tema soma 146 modelos, quase metade dos 327 listados hoje. Olhando todos de uma vez, um padrão fica evidente: a maioria dos provedores aplica desconto de 10x no cache sobre o input. Xiaomi MiMo (10x), Claude Haiku 4.5 (10x), Mistral Devstral 2 (10x), Mistral Large 3 (10x) — todos na mesma casa. O desconto agressivo virou commodity entre modelos abertos e provedores asiáticos.
O OpenAI o3 foge do padrão com desconto de só 4x. Não é má vontade: o input dele já é caro (US$ 2 por milhão), então mesmo com 4x o cache sai a US$ 0,50. Quando o preço de entrada é alto, o desconto relativo tende a ser menor, mas o valor absoluto continua salgado — equivale ao dobro do input do MiMo.
Tem caso ainda mais estranho. O OpenAI gpt-oss-20b lista US$ 0,03 de input e US$ 0,03 de cache — o mesmo número. Para quem repete o mesmo prompt em loop, é como se o cache não existisse. O Qwen3 Next 80B A3B Instruct também foge da média: cache de US$ 0,07 contra input de US$ 0,10, desconto de só 1,4x. Modelo aberto não garante cache agressivo.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| o3 | openai | 31.1 | 8 | 200k |
| Claude Haiku 4.5 | anthropic | 29.9 | 5 | 200k |
| Devstral 2 2512 | mistralai | 19.2 | 2 | 262k |
| Mistral Large 3 2512 | mistralai | 15.9 | 1.5 | 262k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Nemotron 3 Nano 30B A3B | nvidia | 14.5 | 0.2 | 262k |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
Topo do jogo, em números
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Xiaomi, chinesa, modelo aberto, MoE com 309B parâmetros totais e 15B ativos, lidera o índice de IQ (34,024) e oferece o cache mais barato entre modelos relevantes do recorte. O o3 da OpenAI, americano e fechado, segura a segunda posição pagando caro pelo mesmo recurso. O Claude Haiku 4.5 da Anthropic fica no meio termo: US$ 0,10 de cache, IQ 29,892, velocidade de 90 tokens por segundo.
A Mistral aparece em dobro no recorte com perfis diferentes. O Devstral 2 2512, focado em código agentic, cobra US$ 0,04 de cache com IQ 19,242. O Mistral Large 3 2512, sparse MoE com 675B totais e 41B ativos, cobra US$ 0,05 — mesmo modelo de negócio, mesma origem francesa, ambos abertos sob Apache 2.0.
A geografia pesa: o cache mais barato do recorte vem da China (Xiaomi) e de modelos abertos americanos como o NVIDIA Nemotron 3 Nano 30B A3B (US$ 0,025, velocidade de 247 tokens por segundo — o mais rápido do recorte). Os provedores americanos fechados operam na faixa dos US$ 0,10 a US$ 0,50. A Mistral, francesa, fica num meio termo entre US$ 0,04 e US$ 0,05.
Para quem isso muda a conta
Se você roda RAG com a mesma base repetida em toda chamada, agente que reenvia instruções longas a cada step, ou qualquer workload onde 80% dos tokens são reenvio, a linha de cache é onde a economia mora. Antes de escolher pelo benchmark, vale conferir a tabela de cache do modelo — e, se possível, rodar uma semana com cache habilitado para medir o impacto real na fatura.
Para quem faz uma chamada curta por hora, cache é detalhe — input e output dominam a conta e o desconto passa despercebido.
Antes de escolher pelo IQ, olhe a linha de cache da tabela — é onde workloads com contexto repetido ganham ou perdem a economia.
Perguntas frequentes
O que é cache em API de LLM?
É o desconto que o provedor dá quando você reenvia o mesmo bloco de texto que ele já processou. Em vez de cobrar input cheio, cobra uma fração — em geral 10x menor entre os modelos do recorte.
Vale trocar de modelo só pelo preço do cache?
Só se o seu workload repete muito contexto. RAG, agentes e sistemas com system prompt longo se beneficiam; chamadas curtas e únicas não veem diferença na fatura porque input e output dominam a conta.
Por que o gpt-oss-20b não dá desconto de cache?
O catálogo lista input e cache no mesmo valor (US$ 0,03 por milhão de tokens). Para quem repete prompt em loop, é como se o cache não existisse — o desconto aparece só de nome.