Quatro modelos chineses, um topo e uma conta muito mais barata
Xiaomi, Qwen e Baidu ocupam o recorte chinês do catálogo e entregam o melhor custo por inteligência — com pesos abertos e um detalhe que ninguém conta no release.
O chinês mais barato do topo é também o mais inteligente do recorte
Pega o catálogo inteiro, separa só o que vem da China, e o que sobra cabe numa mão: quatro modelos. Em um catálogo de mais de 322 itens, isso é 1,2% — pouco em quantidade, mas é justamente nesse 1,2% que mora o melhor custo por inteligência da casa. O Xiaomi MiMo-V2-Flash lidera o recorte com índice de inteligência 34,024 e cobra US$ 0,30 por milhão de tokens de saída. Para efeito de régua, o segundo colocado do recorte, o Qwen3-Next-80B-A3B-Thinking, cobra US$ 1,20 pela mesma unidade — quatro vezes mais caro — e entrega índice 16,867.
A conta fica ainda mais favorável quando você compara com o topo geral do catálogo. O segundo colocado absoluto, o OpenAI o3, sai por US$ 8 por milhão de tokens de saída. O MiMo cobra US$ 0,30 pela mesma unidade. É uma diferença de 26 vezes no preço de saída, com o Xiaomi entregando um índice de inteligência maior (34,024 contra 31,096 do o3).
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O que o release não conta: pesos abertos e arquitetura MoE
Os quatro modelos do recorte compartilham duas características que raramente aparecem em destaque no marketing. A primeira é que todos têm pesos abertos. Isso muda o cálculo para quem roda carga em infraestrutura própria ou quer evitar lock-in de fornecedor. A segunda é a arquitetura Mixture-ofExperts: dos 309 bilhões de parâmetros do MiMo, só 15 bilhões são ativados por token. É como ter um arquivo de 309 GB no disco, mas o processador só precisa ler 15 GB para responder cada pergunta — o que ajuda a explicar o preço agressivo sem perder qualidade.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
| ERNIE 4.5 300B A47B | baidu | 8.9 | 1.1 | 131k |
Para quem isso vale — e para quem não muda nada
Vale para você se: está construindo produto com chamadas longas à API, precisa de raciocínio estruturado (os dois modelos Qwen3-Next Thinking e o MiMo são modelos de raciocínio), ou quer testar carga em modelo de peso aberto antes de comprometer orçamento. O MiMo é o candidato óbvio para o topo da pilha quando o requisito é inteligência por dólar.
Não muda nada se: você depende de um SLA corporativo com suporte humano, precisa de multimodalidade nativa (todos os quatro são text→text), ou já tem contrato firmado com OpenAI/Anthropic e o custo marginal de migrar é maior que a economia. Também não muda nada se você está atrás do melhor modelo absoluto em benchmarks de coding ou agentic — o recorte chinês não traz dados de coding/agentic comparáveis ao topo geral.
O detalhe que ninguém menciona: contexto de 262 mil tokens
Três dos quatro modelos do recorte oferecem janela de contexto de 262.144 tokens. O quarto, o ERNIE 4.5 da Baidu, fica em 131.072. Em termos práticos, isso significa que você consegue colar um repositório inteiro, um livro técnico ou uma transcrição de reunião longa sem precisar fragmentar. É um número que não vira manchete, mas que decide viabilidade quando o caso de uso é análise de codebase ou revisão documental.
O que você faz com isso hoje
Se você está pagando a API e o caso de uso cabe em texto puro, o MiMo-V2-Flash é o teste óbvio: é o modelo mais inteligente do catálogo e custa uma fração do segundo colocado. Antes de migrar de fato, meça o seu prompt médio — se a maioria das suas chamadas gasta muito em saída, a economia é imediata. Se você precisa de raciocínio estruturado e está disposto a pagar um pouco mais, o Qwen3-Next Thinking entra como segunda opção. E se o seu fluxo exige rodar localmente, qualquer um dos quatro serve como ponto de partida com peso aberto — começando pelo MiMo, que tem a melhor relação entre parâmetros ativos e índice de inteligência do recorte.
Teste o MiMo-V2-Flash como substituto do topo geral se o seu caso de uso é texto puro — a economia na fatura pode chegar a 26 vezes por milhão de tokens de saída sem perder qualidade.
Perguntas frequentes
Qual é o modelo chinês mais barato com bom índice de inteligência?
O Xiaomi MiMo-V2-Flash lidera o recorte chinês com índice 34,024 e cobra US$ 0,30 por milhão de tokens de saída — é também o modelo mais inteligente do catálogo inteiro nesta data.
Modelos chineses têm pesos abertos?
Sim, os quatro modelos do recorte (Xiaomi MiMo, Qwen3-Next Thinking, Qwen3-Next Instruct e ERNIE 4.5) são listados como open weights, o que permite rodar localmente ou evitar lock-in de fornecedor.
Quanto custa rodar o MiMo comparado com o OpenAI o3?
O MiMo cobra US$ 0,30 por milhão de tokens de saída; o o3 cobra US$ 8 pela mesma unidade. Em uma carga com 10 milhões de tokens de saída por mês, isso é US$ 3 contra US$ 80.