FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Cache do OpenAI o3 custa 50 vezes o do Xiaomi MiMo

Mesmo serviço para reusar um prompt já processado: a diferença vai de zero desconto a US$ 0,01 por milhão de tokens. Quase metade do catálogo está nesse jogo.

Redação FalaVIP IA 3 min de leitura
US$ 0,01por milhão de tokens de cache no Xiaomi MiMo-V2-Flash
US$ 0,50por milhão de tokens de cache no OpenAI o3 (50x mais)
146 de 327modelos do recorte de cache hoje

O abismo de 50x entre dois vizinhos de tabela

Pega dois modelos quase vizinhos em capacidade no catálogo de hoje. O Xiaomi MiMo-V2-Flash, no topo do índice de IQ com 34,024, cobra US$ 0,01 por milhão de tokens de cache. O OpenAI o3, logo abaixo com IQ 31,096, cobra US$ 0,50. Mesmo serviço, mesma função — a economia de reusar um prompt já processado. Cinquenta vezes mais caro.

Inteligência × preço no recorte
MiMo-V2-Flasho3Claude Haiku 4.5Devstral 2 2512Mistral Large 3 2512gpt-oss-20bNemotron 3 Nano 30B A3BQwen3 Next 80B A3B InstructUS$ por milhão (saída, escala log)índice de inteligência

O que é cache, em uma frase

Cache é o desconto de quem já leu o prompt antes. O provedor processou aquele bloco de texto uma vez; cobrar preço cheio de novo é cobrar em duplicidade. Em workloads que repetem contexto — RAG, agentes, ferramentas com system prompt longo — o cache vira a maior parte da conta. E aqui o tamanho do contexto importa: todos os modelos do recorte têm entre 131 mil e 262 mil tokens de janela. É o tipo de janela em que o cache deixa de ser opcional.

O padrão que aparece quando você olha 146 modelos juntos

O recorte deste tema soma 146 modelos, quase metade dos 327 listados hoje. Olhando todos de uma vez, um padrão fica evidente: a maioria dos provedores aplica desconto de 10x no cache sobre o input. Xiaomi MiMo (10x), Claude Haiku 4.5 (10x), Mistral Devstral 2 (10x), Mistral Large 3 (10x) — todos na mesma casa. O desconto agressivo virou commodity entre modelos abertos e provedores asiáticos.

O OpenAI o3 foge do padrão com desconto de só 4x. Não é má vontade: o input dele já é caro (US$ 2 por milhão), então mesmo com 4x o cache sai a US$ 0,50. Quando o preço de entrada é alto, o desconto relativo tende a ser menor, mas o valor absoluto continua salgado — equivale ao dobro do input do MiMo.

Tem caso ainda mais estranho. O OpenAI gpt-oss-20b lista US$ 0,03 de input e US$ 0,03 de cache — o mesmo número. Para quem repete o mesmo prompt em loop, é como se o cache não existisse. O Qwen3 Next 80B A3B Instruct também foge da média: cache de US$ 0,07 contra input de US$ 0,10, desconto de só 1,4x. Modelo aberto não garante cache agressivo.

Destaques do recorte: o preço do cache
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
Devstral 2 2512mistralai19.22262k
Mistral Large 3 2512mistralai15.91.5262k
gpt-oss-20bopenai15.20.13131k
Nemotron 3 Nano 30B A3Bnvidia14.50.2262k
Qwen3 Next 80B A3B Instructqwen13.81.1262k

Topo do jogo, em números

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 327 modelos disponíveis no catálogo nesta data.

Xiaomi, chinesa, modelo aberto, MoE com 309B parâmetros totais e 15B ativos, lidera o índice de IQ (34,024) e oferece o cache mais barato entre modelos relevantes do recorte. O o3 da OpenAI, americano e fechado, segura a segunda posição pagando caro pelo mesmo recurso. O Claude Haiku 4.5 da Anthropic fica no meio termo: US$ 0,10 de cache, IQ 29,892, velocidade de 90 tokens por segundo.

A Mistral aparece em dobro no recorte com perfis diferentes. O Devstral 2 2512, focado em código agentic, cobra US$ 0,04 de cache com IQ 19,242. O Mistral Large 3 2512, sparse MoE com 675B totais e 41B ativos, cobra US$ 0,05 — mesmo modelo de negócio, mesma origem francesa, ambos abertos sob Apache 2.0.

A geografia pesa: o cache mais barato do recorte vem da China (Xiaomi) e de modelos abertos americanos como o NVIDIA Nemotron 3 Nano 30B A3B (US$ 0,025, velocidade de 247 tokens por segundo — o mais rápido do recorte). Os provedores americanos fechados operam na faixa dos US$ 0,10 a US$ 0,50. A Mistral, francesa, fica num meio termo entre US$ 0,04 e US$ 0,05.

Para quem isso muda a conta

Se você roda RAG com a mesma base repetida em toda chamada, agente que reenvia instruções longas a cada step, ou qualquer workload onde 80% dos tokens são reenvio, a linha de cache é onde a economia mora. Antes de escolher pelo benchmark, vale conferir a tabela de cache do modelo — e, se possível, rodar uma semana com cache habilitado para medir o impacto real na fatura.

Para quem faz uma chamada curta por hora, cache é detalhe — input e output dominam a conta e o desconto passa despercebido.

Em uma frase

Antes de escolher pelo IQ, olhe a linha de cache da tabela — é onde workloads com contexto repetido ganham ou perdem a economia.

Perguntas frequentes

O que é cache em API de LLM?

É o desconto que o provedor dá quando você reenvia o mesmo bloco de texto que ele já processou. Em vez de cobrar input cheio, cobra uma fração — em geral 10x menor entre os modelos do recorte.

Vale trocar de modelo só pelo preço do cache?

Só se o seu workload repete muito contexto. RAG, agentes e sistemas com system prompt longo se beneficiam; chamadas curtas e únicas não veem diferença na fatura porque input e output dominam a conta.

Por que o gpt-oss-20b não dá desconto de cache?

O catálogo lista input e cache no mesmo valor (US$ 0,03 por milhão de tokens). Para quem repete prompt em loop, é como se o cache não existisse — o desconto aparece só de nome.

Leia também