FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Quatro modelos chineses, um topo e uma conta muito mais barata

Xiaomi, Qwen e Baidu ocupam o recorte chinês do catálogo e entregam o melhor custo por inteligência — com pesos abertos e um detalhe que ninguém conta no release.

Redação FalaVIP IA 3 min de leitura
US$ 0,30por milhão de tokens de saída do MiMo-V2-Flash
34,024índice de inteligência do MiMo-V2-Flash (topo do catálogo)
4modelos chineses no catálogo de 322

O chinês mais barato do topo é também o mais inteligente do recorte

Pega o catálogo inteiro, separa só o que vem da China, e o que sobra cabe numa mão: quatro modelos. Em um catálogo de mais de 322 itens, isso é 1,2% — pouco em quantidade, mas é justamente nesse 1,2% que mora o melhor custo por inteligência da casa. O Xiaomi MiMo-V2-Flash lidera o recorte com índice de inteligência 34,024 e cobra US$ 0,30 por milhão de tokens de saída. Para efeito de régua, o segundo colocado do recorte, o Qwen3-Next-80B-A3B-Thinking, cobra US$ 1,20 pela mesma unidade — quatro vezes mais caro — e entrega índice 16,867.

Inteligência × preço no recorte
MiMo-V2-FlashQwen3 Next 80B A3B ThinkingQwen3 Next 80B A3B InstructERNIE 4.5 300B A47B US$ por milhão (saída, escala log)índice de inteligência

A conta fica ainda mais favorável quando você compara com o topo geral do catálogo. O segundo colocado absoluto, o OpenAI o3, sai por US$ 8 por milhão de tokens de saída. O MiMo cobra US$ 0,30 pela mesma unidade. É uma diferença de 26 vezes no preço de saída, com o Xiaomi entregando um índice de inteligência maior (34,024 contra 31,096 do o3).

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 322 modelos disponíveis no catálogo nesta data.

O que o release não conta: pesos abertos e arquitetura MoE

Os quatro modelos do recorte compartilham duas características que raramente aparecem em destaque no marketing. A primeira é que todos têm pesos abertos. Isso muda o cálculo para quem roda carga em infraestrutura própria ou quer evitar lock-in de fornecedor. A segunda é a arquitetura Mixture-ofExperts: dos 309 bilhões de parâmetros do MiMo, só 15 bilhões são ativados por token. É como ter um arquivo de 309 GB no disco, mas o processador só precisa ler 15 GB para responder cada pergunta — o que ajuda a explicar o preço agressivo sem perder qualidade.

Destaques do recorte: os modelos chineses
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
Qwen3 Next 80B A3B Instructqwen13.81.1262k
ERNIE 4.5 300B A47B baidu8.91.1131k

Para quem isso vale — e para quem não muda nada

Vale para você se: está construindo produto com chamadas longas à API, precisa de raciocínio estruturado (os dois modelos Qwen3-Next Thinking e o MiMo são modelos de raciocínio), ou quer testar carga em modelo de peso aberto antes de comprometer orçamento. O MiMo é o candidato óbvio para o topo da pilha quando o requisito é inteligência por dólar.

Não muda nada se: você depende de um SLA corporativo com suporte humano, precisa de multimodalidade nativa (todos os quatro são text→text), ou já tem contrato firmado com OpenAI/Anthropic e o custo marginal de migrar é maior que a economia. Também não muda nada se você está atrás do melhor modelo absoluto em benchmarks de coding ou agentic — o recorte chinês não traz dados de coding/agentic comparáveis ao topo geral.

O detalhe que ninguém menciona: contexto de 262 mil tokens

Três dos quatro modelos do recorte oferecem janela de contexto de 262.144 tokens. O quarto, o ERNIE 4.5 da Baidu, fica em 131.072. Em termos práticos, isso significa que você consegue colar um repositório inteiro, um livro técnico ou uma transcrição de reunião longa sem precisar fragmentar. É um número que não vira manchete, mas que decide viabilidade quando o caso de uso é análise de codebase ou revisão documental.

O que você faz com isso hoje

Se você está pagando a API e o caso de uso cabe em texto puro, o MiMo-V2-Flash é o teste óbvio: é o modelo mais inteligente do catálogo e custa uma fração do segundo colocado. Antes de migrar de fato, meça o seu prompt médio — se a maioria das suas chamadas gasta muito em saída, a economia é imediata. Se você precisa de raciocínio estruturado e está disposto a pagar um pouco mais, o Qwen3-Next Thinking entra como segunda opção. E se o seu fluxo exige rodar localmente, qualquer um dos quatro serve como ponto de partida com peso aberto — começando pelo MiMo, que tem a melhor relação entre parâmetros ativos e índice de inteligência do recorte.

Em uma frase

Teste o MiMo-V2-Flash como substituto do topo geral se o seu caso de uso é texto puro — a economia na fatura pode chegar a 26 vezes por milhão de tokens de saída sem perder qualidade.

Perguntas frequentes

Qual é o modelo chinês mais barato com bom índice de inteligência?

O Xiaomi MiMo-V2-Flash lidera o recorte chinês com índice 34,024 e cobra US$ 0,30 por milhão de tokens de saída — é também o modelo mais inteligente do catálogo inteiro nesta data.

Modelos chineses têm pesos abertos?

Sim, os quatro modelos do recorte (Xiaomi MiMo, Qwen3-Next Thinking, Qwen3-Next Instruct e ERNIE 4.5) são listados como open weights, o que permite rodar localmente ou evitar lock-in de fornecedor.

Quanto custa rodar o MiMo comparado com o OpenAI o3?

O MiMo cobra US$ 0,30 por milhão de tokens de saída; o o3 cobra US$ 8 pela mesma unidade. Em uma carga com 10 milhões de tokens de saída por mês, isso é US$ 3 contra US$ 80.

Leia também