Quatro modelos chineses, um só topo de ranking e preço de centavos
Xiaomi, Qwen e Baidu ocupam o catálogo com pesos abertos e custo por token que nenhum americano consegue igualar hoje.
Quatro modelos. Três criadores. Um único país. E o mais barato deles, o Xiaomi MiMo-V2-Flash, aparece no topo do ranking de inteligência do catálogo inteiro — acima de OpenAI o3 e Anthropic Claude Haiku 4.5, cobrando US$ 0,30 por milhão de tokens de saída. Quem paga a API em real precisa parar e olhar esse recorte.
O recorte chinês hoje
O catálogo guarda 314 modelos ainda listados nesta data. Desses, só quatro vêm da China: Xiaomi MiMo-V2-Flash, Qwen3 Next 80B A3B Thinking, Qwen3 Next 80B A3B Instruct e Baidu ERNIE 4.5 300B A47B. Três criadores diferentes, mas o mesmo padrão: pesos abertos, arquitetura Mixture-of-Experts (MoE) e preço de token que parece erro de digitação.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
| ERNIE 4.5 300B A47B | baidu | 8.9 | 1.1 | 131k |
O que está em jogo quando o preço cai
O MiMo-V2-Flash tem 309 bilhões de parâmetros totais, mas só ativa 15 bilhões por token. Pense num restaurante com cardápio enorme: você só cozinha o prato que pediu, não a cozinha inteira. É assim que o MoE entrega um modelo grande sem cobrar caro pela conta de luz — e é assim que a Xiaomi consegue cobrar US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de tokens de saída, com cache a US$ 0,01.
Compare com o OpenAI o3, que lidera o topo do mercado em inteligência logo abaixo do MiMo: US$ 8 por milhão de tokens de saída. São 26 vezes mais caro na saída. O Claude Haiku 4.5, da Anthropic, fica em US$ 5. A diferença não é margem — é estratégia.
Onde cada um chinês pisa
O MiMo-V2-Flash é o caso óbvio: melhor índice de inteligência do recorte (34,024), raciocínio ativado, contexto de 262 mil tokens, e o preço mais baixo da lista. Serve para quem quer o topo do ranking sem vender rim.
O Qwen3 Next 80B A3B Thinking é o primo que pensa em voz alta: emite traces de raciocínio por padrão, foi feito para problemas de várias etapas — provas, debug de código, lógica. É mais barato que o irmão Instruct na entrada (US$ 0,15 vs US$ 0,10 por milhão de tokens de entrada) e entrega 196,94 tokens por segundo. O índice de inteligência é 16,867, bem abaixo do MiMo, mas o recorte de raciocínio estruturado tem outro público.
O Qwen3 Next 80B A3B Instruct é a versão sem thinking traces: respostas rápidas e estáveis, sem o "vou explicar meu raciocínio" antes da resposta. Sai por US$ 0,10 na entrada e US$ 1,10 na saída. É o modelo de produção para quem não quer latência de raciocínio.
O Baidu ERNIE 4.5 300B A47B é o mais velho do grupo (lançado em junho de 2025) e o mais caro na entrada: US$ 0,28 por milhão de tokens. Ativa 47 bilhões de parâmetros por token, contexto de 131 mil, e fica com índice de inteligência 8,867 — o mais baixo do recorte. É o caso de uso onde o nome Baidu pesa mais que o benchmark.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem isso muda o jogo
Se você roda volume alto de tokens de saída — geração de código, agentes, pipelines que despejam texto —, o MiMo-V2-Flash sozinho já justifica repensar a stack. A conta de API muda de ordem de grandeza.
Se você precisa de raciocínio explícito e auditável, o Qwen Thinking entra como opção de peso aberto a preço de commodity. Para quem já roda Qwen, é evolução natural.
Se você roda o Baidu ERNIE, provavelmente é por integração com o ecossistema Baidu — o índice de inteligência não justifica a troca.
Para quem não muda nada
Se seu gargalo é multimodalidade (imagem, áudio, vídeo), nenhum dos quatro entrega. Se você precisa de SLA corporativo ocidental com contrato, suporte e data residency garantido em jurisdição americana ou europeia, pesos abertos chineses não substituem isso. E se seu caso de uso é tão sensível que cada ponto percentual de benchmark importa mais que preço, o o3 e o Claude Haiku continuam no jogo — só não no mesmo orçamento.
O catálogo nesta data tem 15 modelos lançados nos últimos 30 dias. Quatro deles são chineses. A conta da API, daqui pra frente, vai ter cada vez mais linha de Pequim.
Se você roda alto volume de tokens de saída e pode hospedar ou consumir via API de pesos abertos, o MiMo-V2-Flash da Xiaomi é o primeiro candidato a testar antes de renovar contrato com OpenAI ou Anthropic.
Perguntas frequentes
Quais são os modelos chineses no catálogo hoje?
Quatro: Xiaomi MiMo-V2-Flash, Qwen3 Next 80B A3B Thinking, Qwen3 Next 80B A3B Instruct e Baidu ERNIE 4.5 300B A47B. Todos com pesos abertos e arquitetura Mixture-of-Experts.
Quanto custa o MiMo-V2-Flash da Xiaomi?
US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de tokens de saída, com cache a US$ 0,01. É o modelo mais barato entre os que lideram o ranking de inteligência do catálogo.
Modelo chinês substitui OpenAI ou Anthropic?
Depende do caso. Para alto volume de tokens de saída e tarefas onde preço domina, o MiMo-V2-Flash já lidera o índice de inteligência do catálogo e custa uma fração do o3 ou do Claude Haiku 4.5. Para multimodalidade, SLA corporativo ocidental ou contratos com data residency específica, não substitui.