FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

12 modelos de raciocínio, um líder chinês e o3 custando 26 vezes mais

O recorte de reasoning do catálogo mostra Xiaomi na frente do índice de inteligência e OpenAI cobrando US$ 8 por milhão de tokens de saída no topo.

Redação FalaVIP IA 3 min de leitura
34,02índice de inteligência do Xiaomi MiMo-V2-Flash (líder do recorte)
US$ 0,30preço por milhão de tokens de saída do MiMo-V2-Flash
US$ 8,00preço por milhão de tokens de saída do OpenAI o3

O líder do recorte não é quem você espera

Se você abriu o catálogo procurando modelos de raciocínio esperando ver OpenAI, Anthropic ou Google no topo, vai estranhar o primeiro lugar. O índice de inteligência mais alto do recorte de reasoning hoje é do Xiaomi MiMo-V2-Flash, com 34,02. O segundo colocado é o OpenAI o3, com 31,09. A diferença de quase três pontos parece pequena até você olhar o preço: o MiMo cobra US$ 0,30 por milhão de tokens de saída, enquanto o o3 cobra US$ 8,00. São 26 vezes mais caro pelo mesmo tipo de tarefa.

Inteligência × preço no recorte
MiMo-V2-Flasho3Claude Haiku 4.5gpt-oss-120bNova 2 LiteQwen3 Next 80B A3B ThinkingINTELLECT-3gpt-oss-20bUS$ por milhão (saída, escala log)índice de inteligência

O que o marketing do "modelo de raciocínio" esconde

O rótulo "reasoning" virou commodity. Dos 313 modelos do catálogo, 12 se anunciam como modelos de raciocínio, e a maioria dos lançamentos dos últimos 30 dias (19 no total no catálogo inteiro) já chega com essa etiqueta. Ocorre que raciocinar, para esses modelos, significa gastar mais tokens por resposta — eles emitem cadeias internas de pensamento antes de entregar a saída final. Isso muda a conta no fim do mês, porque o que dispara o custo é justamente o token de saída, e é aí que os preços mais divergem.

Destaques do recorte: modelos de raciocínio
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
gpt-oss-120bopenai24.10.17131k
Nova 2 Liteamazon19.22.51M
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
INTELLECT-3prime-intellect15.71.1131k
gpt-oss-20bopenai15.20.13131k

Olha o contraste no recorte: o gpt-oss-20b cobra US$ 0,13 por milhão de saída, o gpt-oss-120b US$ 0,17, e o Nova 2 Lite da Amazon US$ 2,50. Quando você soma a diferença de preço de saída com o volume de tokens que um modelo de raciocínio cospe por chamada, o efeito sobre a fatura é multiplicativo, não aditivo.

Para quem isso muda alguma coisa

Se você está construindo agente, ferramenta de código ou qualquer fluxo que faça o modelo pensar em voz alta antes de responder, o recorte de janeiro de 2026 entrega uma escolha clara: MiMo-V2-Flash e gpt-oss-120b dominam o topo do índice de inteligência por uma fração do custo do o3. O Claude Haiku 4.5 entra como terceira opção interessante — 29,89 de IQ, US$ 5,00 por milhão de saída, multimodal (texto, imagem, arquivo) e com nota de coding de 43,89, a mais alta do recorte.

Se você está usando raciocínio para tarefas pontuais e curtas, ou se o orçamento não é problema, o o3 segue valendo: é o modelo mais equilibrado do recorte, multimodal, com a maior nota de "blended" (3,5) e velocidade de 108,93 tokens por segundo. Mas saiba que cada resposta sua paga o pato.

Para quem opera chatbot simples, sumarização ou classificação, raciocínio não é a resposta. Um modelo não-reasoning mais barato e mais rápido entrega o mesmo resultado com menos latência e menos tokens queimados.

O tabuleiro geopolítico do raciocínio

Dos 8 modelos com dados completos no recorte, 5 vêm dos Estados Unidos (OpenAI, Anthropic, Amazon, Prime Intellect) e 2 da China (Xiaomi, Qwen). O líder absoluto do índice de inteligência é chinês, open-weights, com 309B de parâmetros totais e 15B ativos — uma arquitetura Mixture-of-Experts que roda barato porque só uma fração dos parâmetros é acionada por token. O Qwen3 Next 80B A3B Thinking também é chinês, open-weights, e cobra US$ 1,20 por milhão de saída, posicionando-se entre o topo e o meio do recorte.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 313 modelos disponíveis no catálogo nesta data.

A leitura prática: a fronteira de raciocínio em janeiro de 2026 não está mais concentrada em um único país ou laboratório. Xiaomi, Qwen, OpenAI, Anthropic e Prime Intellect estão todos entregando modelos com reasoning ativo, e a briga por preço é o que define o ranking — não a nacionalidade do criador.

O que você faz com isso hoje

Se a sua fila de推理 (desculpa, de raciocínio) está crescendo e a fatura junto, teste o MiMo-V2-Flash como default. É open-weights, tem o maior IQ do recorte e custa menos de 4% do o3 por token de saída. Mantenha o o3 como fallback para os casos em que você precisa do melhor absoluto e pode pagar por ele. E pare de tratar "modelo de raciocínio" como upgrade gratuito — cada chamada é uma aposta multiplicada pelo preço de saída.

Em uma frase

Trocar o modelo de raciocínio default pelo MiMo-V2-Flash ou pelo gpt-oss-120b pode cortar a fatura de saída em mais de 20 vezes sem perder o topo do índice de inteligência do recorte.

Perguntas frequentes

Qual é o modelo de raciocínio mais barato do catálogo em janeiro de 2026?

Entre os modelos de raciocínio com dados de preço, o gpt-oss-20b da OpenAI é o mais barato, a US$ 0,13 por milhão de tokens de saída. Logo atrás vem o gpt-oss-120b, a US$ 0,17, e o MiMo-V2-Flash da Xiaomi, a US$ 0,30.

Por que modelos de raciocínio custam mais na prática?

Porque eles emitem tokens internos de pensamento antes da resposta final. O token de saída é o que dispara o custo, e modelos de raciocínio geram muito mais saída por chamada do que modelos convencionais — o multiplicador de preço aparece na fatura, não no cardápio.

Xiaomi MiMo-V2-Flash é realmente melhor que o OpenAI o3?

No índice de inteligência do recorte, sim: 34,02 contra 31,09. Mas o o3 é multimodal (aceita imagem e arquivo), tem nota de blended mais alta e conhecimento de corte declarado. Para tarefas puramente textuais de raciocínio, o MiMo entrega mais por uma fração do custo.

Leia também