Raciocínio custa caro: Xiaomi cobra US$ 0,30 e OpenAI cobra US$ 8 por milhão de tokens
Oito modelos de raciocínio no catálogo e a conta da API varia em 26 vezes entre o mais barato e o mais caro do recorte.
Você olha o catálogo e vê 13 modelos marcados como de raciocínio. Aí abre a fatura da API e descobre que pagar por "pensar" pode custar 26 vezes mais dependendo de qual modelo você escolheu. É essa a distância que separa, hoje, o Xiaomi MiMo-V2-Flash (US$ 0,30 por milhão de tokens de saída) do OpenAI o3 (US$ 0,30 vs US$ 8,00 por milhão de tokens de saída). Mesmo nicho, mesma etiqueta de "reasoning", conta completamente diferente.
O topo do recorte não é o que o marketing sugere
Quando alguém diz "modelo de raciocínio", a cabeça vai para OpenAI o3 ou Claude. Mas o índice de inteligência medido hoje no catálogo coloca o Xiaomi MiMo-V2-Flash na frente do recorte, com IQ 34,024, à frente do OpenAI o3 (31,096) e do Claude Haiku 4.5 (29,892). E o MiMo cobra US$ 0,30 de saída. O o3 cobra US$ 8,00. A diferença não é só de preço: é de proposta.
O MiMo é um modelo aberto, da Xiaomi, com 309B de parâmetros totais e 15B ativos por passagem. É MoE com atenção híbrida, contexto de 262 mil tokens, e foi lançado em dezembro de 2025. Em outras palavras: o chinês que lidera o recorte de raciocínio em inteligência por real é também o mais barato do recorte. Vale para quem? Para workloads de produção que precisam de cadeia de pensamento sem estourar a fatura. Não vale para quem precisa de conhecimento de corte atualizado — o catálogo não publicou knowledge_cutoff para o MiMo, então não dá para cravar até onde ele "sabe" coisas do mundo.
O segundo pelotão tem nome e preço conhecido
Logo abaixo do MiMo vem o o3, da OpenAI. É o modelo de raciocínio mais caro do recorte: US$ 2,00 de entrada e US$ 8,00 de saída por milhão de tokens. Em troca, entrega multimodalidade (texto, imagem e arquivo), contexto de 200 mil tokens e velocidade medida em 108,93 tokens por segundo. É o típico "pago caro, mas sei o que estou levando" — útil quando você precisa de raciocínio visual ou técnico e não quer improvisar com modelo aberto.
Na sequência, o Claude Haiku 4.5, da Anthropic, cobra US$ 1,00 de entrada e US$ 5,00 de saída. É o modelo mais "barato" da Anthropic para raciocínio e tem a vantagem de trazer números de coding (43,892) e agentic (16,472) preenchidos no catálogo, coisa que o3 e MiMo não têm. Para quem vai usar em agente ou automação de código, é a referência mais segura do recorte.
A faixa intermediária é onde mora a escolha difícil
Aí aparece o gpt-oss-120b, da própria OpenAI, com IQ 24,126 e preço de US$ 0,17 de saída por milhão de tokens. É 47 vezes mais barato que o o3 na saída, e ainda é modelo aberto, com 117B de parâmetros totais e 5,1B ativos. A OmniScience dele é a pior do recorte (-49,25), o que sugere que ele "alucina" mundo com mais frequência. Para raciocínio puro em tarefas fechadas, é um candidato forte. Para qualquer coisa que precise de fato atualizado, é pedir para sofrer.
Logo depois, o Amazon Nova 2 Lite (US$ 2,50 de saída) traz um diferencial que nenhum outro do recorte oferece: contexto de 1 milhão de tokens e entrada multimodal com vídeo. É o único que ingere vídeo. O custo é médio, a inteligência medida é 19,24 — fica abaixo da metade do MiMo. Vale para quem precisa processar vídeos longos e não se importa em perder metade da "pontuação" de IQ.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| o3 | openai | 31.1 | 8 | 200k |
| Claude Haiku 4.5 | anthropic | 29.9 | 5 | 200k |
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Nova 2 Lite | amazon | 19.2 | 2.5 | 1M |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| INTELLECT-3 | prime-intellect | 15.7 | 1.1 | 131k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
Mais abaixo, o Qwen3 Next 80B A3B Thinking (US$ 1,20 de saída, IQ 16,867) e o Prime Intellect INTELLECT-3 (US$ 1,10 de saída, IQ 15,718) brigam pelo título de melhor custo-benefício na faixa dos US$ 1. O INTELLECT-3 é curioso: é um modelo de 106B parâmetros, pós-treinado a partir do GLM-4.5-Air-Base com RL pesado, e vem de uma criadora pequena (Prime Intellect). Para quem gosta de apostar em modelos de laboratório fora do eixo EUA-China, é uma porta de entrada.
Para quem cada um faz sentido
Se você está rodando agente ou pipeline de código em produção e a fatura da API importa: MiMo-V2-Flash, gpt-oss-120b ou gpt-oss-20b (US$ 0,13 de saída, o mais barato do recorte). Se você precisa de multimodalidade visual e não pode errar: o3 ou Claude Haiku 4.5, e aceite pagar. Se o seu problema é vídeo: Nova 2 Lite é o único do recorte que resolve. Se você quer raciocínio puro, fechado, e não se importa com knowledge cutoff: qualquer um dos abertos da faixa dos US$ 1.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Coder Next | 21.3 | 0.8 |
O padrão que aparece quando se olha o recorte inteiro é claro: o melhor IQ por dólar está na China, em modelo aberto. O melhor IQ "de marca" está nos EUA, em modelo fechado, e custa caro. E no meio, há um vale-tudo de opções que cobrem do vídeo ao agente, cada uma com um trade-off específico.
A implicação prática: se você ainda está pagando preço de raciocínio de 2024, vale rodar o MiMo ou o gpt-oss-120b no mesmo prompt e comparar. A diferença na fatura pode pagar um estagiário.
Antes de pagar US$ 8 por milhão de tokens no o3, teste MiMo-V2-Flash ou gpt-oss-120b no mesmo workload — você pode manter 90% da qualidade por 4% do preço.
Perguntas frequentes
Qual é o modelo de raciocínio mais barato do catálogo hoje?
O Xiaomi MiMo-V2-Flash lidera o recorte de raciocínio em inteligência medida (IQ 34,024) e cobra US$ 0,30 por milhão de tokens de saída. O mais barato em preço absoluto é o gpt-oss-20b, da OpenAI, a US$ 0,13 por milhão de tokens de saída.
Modelos de raciocínio são sempre mais caros que os demais?
Não necessariamente. No recorte atual, o MiMo-V2-Flash cobra US$ 0,30 de saída e o gpt-oss-120b cobra US$ 0,17 — valores compatíveis com modelos não-raciocínio do catálogo. O que encarece é o o3, da OpenAI, a US$ 8,00 de saída, que é exceção, não regra.
Vale a pena trocar o OpenAI o3 por um modelo aberto de raciocínio?
Depende do workload. Para tarefas fechadas de raciocínio, o MiMo-V2-Flash ou o gpt-oss-120b entregam IQ próximo com fração do custo. Para multimodalidade visual ou tarefas que exigem conhecimento atualizado, o o3 ainda justifica o preço.