FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Raciocínio custa caro: Xiaomi cobra US$ 0,30 e OpenAI cobra US$ 8 por milhão de tokens

Oito modelos de raciocínio no catálogo e a conta da API varia em 26 vezes entre o mais barato e o mais caro do recorte.

Redação FalaVIP IA 4 min de leitura
26xdiferença entre o modelo de raciocínio mais barato e o mais caro do recorte
US$ 0,30preço de saída por milhão de tokens do Xiaomi MiMo-V2-Flash
US$ 8,00preço de saída por milhão de tokens do OpenAI o3

Você olha o catálogo e vê 13 modelos marcados como de raciocínio. Aí abre a fatura da API e descobre que pagar por "pensar" pode custar 26 vezes mais dependendo de qual modelo você escolheu. É essa a distância que separa, hoje, o Xiaomi MiMo-V2-Flash (US$ 0,30 por milhão de tokens de saída) do OpenAI o3 (US$ 0,30 vs US$ 8,00 por milhão de tokens de saída). Mesmo nicho, mesma etiqueta de "reasoning", conta completamente diferente.

O topo do recorte não é o que o marketing sugere

Quando alguém diz "modelo de raciocínio", a cabeça vai para OpenAI o3 ou Claude. Mas o índice de inteligência medido hoje no catálogo coloca o Xiaomi MiMo-V2-Flash na frente do recorte, com IQ 34,024, à frente do OpenAI o3 (31,096) e do Claude Haiku 4.5 (29,892). E o MiMo cobra US$ 0,30 de saída. O o3 cobra US$ 8,00. A diferença não é só de preço: é de proposta.

Inteligência × preço no recorte
MiMo-V2-Flasho3Claude Haiku 4.5gpt-oss-120bNova 2 LiteQwen3 Next 80B A3B ThinkingINTELLECT-3gpt-oss-20bUS$ por milhão (saída, escala log)índice de inteligência

O MiMo é um modelo aberto, da Xiaomi, com 309B de parâmetros totais e 15B ativos por passagem. É MoE com atenção híbrida, contexto de 262 mil tokens, e foi lançado em dezembro de 2025. Em outras palavras: o chinês que lidera o recorte de raciocínio em inteligência por real é também o mais barato do recorte. Vale para quem? Para workloads de produção que precisam de cadeia de pensamento sem estourar a fatura. Não vale para quem precisa de conhecimento de corte atualizado — o catálogo não publicou knowledge_cutoff para o MiMo, então não dá para cravar até onde ele "sabe" coisas do mundo.

O segundo pelotão tem nome e preço conhecido

Logo abaixo do MiMo vem o o3, da OpenAI. É o modelo de raciocínio mais caro do recorte: US$ 2,00 de entrada e US$ 8,00 de saída por milhão de tokens. Em troca, entrega multimodalidade (texto, imagem e arquivo), contexto de 200 mil tokens e velocidade medida em 108,93 tokens por segundo. É o típico "pago caro, mas sei o que estou levando" — útil quando você precisa de raciocínio visual ou técnico e não quer improvisar com modelo aberto.

Na sequência, o Claude Haiku 4.5, da Anthropic, cobra US$ 1,00 de entrada e US$ 5,00 de saída. É o modelo mais "barato" da Anthropic para raciocínio e tem a vantagem de trazer números de coding (43,892) e agentic (16,472) preenchidos no catálogo, coisa que o3 e MiMo não têm. Para quem vai usar em agente ou automação de código, é a referência mais segura do recorte.

A faixa intermediária é onde mora a escolha difícil

Aí aparece o gpt-oss-120b, da própria OpenAI, com IQ 24,126 e preço de US$ 0,17 de saída por milhão de tokens. É 47 vezes mais barato que o o3 na saída, e ainda é modelo aberto, com 117B de parâmetros totais e 5,1B ativos. A OmniScience dele é a pior do recorte (-49,25), o que sugere que ele "alucina" mundo com mais frequência. Para raciocínio puro em tarefas fechadas, é um candidato forte. Para qualquer coisa que precise de fato atualizado, é pedir para sofrer.

Logo depois, o Amazon Nova 2 Lite (US$ 2,50 de saída) traz um diferencial que nenhum outro do recorte oferece: contexto de 1 milhão de tokens e entrada multimodal com vídeo. É o único que ingere vídeo. O custo é médio, a inteligência medida é 19,24 — fica abaixo da metade do MiMo. Vale para quem precisa processar vídeos longos e não se importa em perder metade da "pontuação" de IQ.

Destaques do recorte: modelos de raciocínio
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
gpt-oss-120bopenai24.10.17131k
Nova 2 Liteamazon19.22.51M
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
INTELLECT-3prime-intellect15.71.1131k
gpt-oss-20bopenai15.20.13131k

Mais abaixo, o Qwen3 Next 80B A3B Thinking (US$ 1,20 de saída, IQ 16,867) e o Prime Intellect INTELLECT-3 (US$ 1,10 de saída, IQ 15,718) brigam pelo título de melhor custo-benefício na faixa dos US$ 1. O INTELLECT-3 é curioso: é um modelo de 106B parâmetros, pós-treinado a partir do GLM-4.5-Air-Base com RL pesado, e vem de uma criadora pequena (Prime Intellect). Para quem gosta de apostar em modelos de laboratório fora do eixo EUA-China, é uma porta de entrada.

Para quem cada um faz sentido

Se você está rodando agente ou pipeline de código em produção e a fatura da API importa: MiMo-V2-Flash, gpt-oss-120b ou gpt-oss-20b (US$ 0,13 de saída, o mais barato do recorte). Se você precisa de multimodalidade visual e não pode errar: o3 ou Claude Haiku 4.5, e aceite pagar. Se o seu problema é vídeo: Nova 2 Lite é o único do recorte que resolve. Se você quer raciocínio puro, fechado, e não se importa com knowledge cutoff: qualquer um dos abertos da faixa dos US$ 1.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Coder Next21.30.8
Entre os 334 modelos disponíveis no catálogo nesta data.

O padrão que aparece quando se olha o recorte inteiro é claro: o melhor IQ por dólar está na China, em modelo aberto. O melhor IQ "de marca" está nos EUA, em modelo fechado, e custa caro. E no meio, há um vale-tudo de opções que cobrem do vídeo ao agente, cada uma com um trade-off específico.

A implicação prática: se você ainda está pagando preço de raciocínio de 2024, vale rodar o MiMo ou o gpt-oss-120b no mesmo prompt e comparar. A diferença na fatura pode pagar um estagiário.

Em uma frase

Antes de pagar US$ 8 por milhão de tokens no o3, teste MiMo-V2-Flash ou gpt-oss-120b no mesmo workload — você pode manter 90% da qualidade por 4% do preço.

Perguntas frequentes

Qual é o modelo de raciocínio mais barato do catálogo hoje?

O Xiaomi MiMo-V2-Flash lidera o recorte de raciocínio em inteligência medida (IQ 34,024) e cobra US$ 0,30 por milhão de tokens de saída. O mais barato em preço absoluto é o gpt-oss-20b, da OpenAI, a US$ 0,13 por milhão de tokens de saída.

Modelos de raciocínio são sempre mais caros que os demais?

Não necessariamente. No recorte atual, o MiMo-V2-Flash cobra US$ 0,30 de saída e o gpt-oss-120b cobra US$ 0,17 — valores compatíveis com modelos não-raciocínio do catálogo. O que encarece é o o3, da OpenAI, a US$ 8,00 de saída, que é exceção, não regra.

Vale a pena trocar o OpenAI o3 por um modelo aberto de raciocínio?

Depende do workload. Para tarefas fechadas de raciocínio, o MiMo-V2-Flash ou o gpt-oss-120b entregam IQ próximo com fração do custo. Para multimodalidade visual ou tarefas que exigem conhecimento atualizado, o o3 ainda justifica o preço.

Leia também