FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Quatro modelos chineses, um só topo de ranking e preço de centavos

Xiaomi, Qwen e Baidu ocupam o catálogo com pesos abertos e custo por token que nenhum americano consegue igualar hoje.

Redação FalaVIP IA 3 min de leitura
US$ 0,30por milhão de tokens de saída do MiMo-V2-Flash
309Bparâmetros totais do MiMo-V2-Flash, com só 15B ativos
4 modeloschineses listados no catálogo, de três criadores diferentes

Quatro modelos. Três criadores. Um único país. E o mais barato deles, o Xiaomi MiMo-V2-Flash, aparece no topo do ranking de inteligência do catálogo inteiro — acima de OpenAI o3 e Anthropic Claude Haiku 4.5, cobrando US$ 0,30 por milhão de tokens de saída. Quem paga a API em real precisa parar e olhar esse recorte.

O recorte chinês hoje

O catálogo guarda 314 modelos ainda listados nesta data. Desses, só quatro vêm da China: Xiaomi MiMo-V2-Flash, Qwen3 Next 80B A3B Thinking, Qwen3 Next 80B A3B Instruct e Baidu ERNIE 4.5 300B A47B. Três criadores diferentes, mas o mesmo padrão: pesos abertos, arquitetura Mixture-of-Experts (MoE) e preço de token que parece erro de digitação.

Destaques do recorte: os modelos chineses
ModeloCriadorInteligênciaSaída US$/MContexto
MiMo-V2-Flashxiaomi34.00.3262k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
Qwen3 Next 80B A3B Instructqwen13.81.1262k
ERNIE 4.5 300B A47B baidu8.91.1131k

O que está em jogo quando o preço cai

O MiMo-V2-Flash tem 309 bilhões de parâmetros totais, mas só ativa 15 bilhões por token. Pense num restaurante com cardápio enorme: você só cozinha o prato que pediu, não a cozinha inteira. É assim que o MoE entrega um modelo grande sem cobrar caro pela conta de luz — e é assim que a Xiaomi consegue cobrar US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de tokens de saída, com cache a US$ 0,01.

Compare com o OpenAI o3, que lidera o topo do mercado em inteligência logo abaixo do MiMo: US$ 8 por milhão de tokens de saída. São 26 vezes mais caro na saída. O Claude Haiku 4.5, da Anthropic, fica em US$ 5. A diferença não é margem — é estratégia.

Inteligência × preço no recorte
MiMo-V2-FlashQwen3 Next 80B A3B ThinkingQwen3 Next 80B A3B InstructERNIE 4.5 300B A47B US$ por milhão (saída, escala log)índice de inteligência

Onde cada um chinês pisa

O MiMo-V2-Flash é o caso óbvio: melhor índice de inteligência do recorte (34,024), raciocínio ativado, contexto de 262 mil tokens, e o preço mais baixo da lista. Serve para quem quer o topo do ranking sem vender rim.

O Qwen3 Next 80B A3B Thinking é o primo que pensa em voz alta: emite traces de raciocínio por padrão, foi feito para problemas de várias etapas — provas, debug de código, lógica. É mais barato que o irmão Instruct na entrada (US$ 0,15 vs US$ 0,10 por milhão de tokens de entrada) e entrega 196,94 tokens por segundo. O índice de inteligência é 16,867, bem abaixo do MiMo, mas o recorte de raciocínio estruturado tem outro público.

O Qwen3 Next 80B A3B Instruct é a versão sem thinking traces: respostas rápidas e estáveis, sem o "vou explicar meu raciocínio" antes da resposta. Sai por US$ 0,10 na entrada e US$ 1,10 na saída. É o modelo de produção para quem não quer latência de raciocínio.

O Baidu ERNIE 4.5 300B A47B é o mais velho do grupo (lançado em junho de 2025) e o mais caro na entrada: US$ 0,28 por milhão de tokens. Ativa 47 bilhões de parâmetros por token, contexto de 131 mil, e fica com índice de inteligência 8,867 — o mais baixo do recorte. É o caso de uso onde o nome Baidu pesa mais que o benchmark.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 314 modelos disponíveis no catálogo nesta data.

Para quem isso muda o jogo

Se você roda volume alto de tokens de saída — geração de código, agentes, pipelines que despejam texto —, o MiMo-V2-Flash sozinho já justifica repensar a stack. A conta de API muda de ordem de grandeza.

Se você precisa de raciocínio explícito e auditável, o Qwen Thinking entra como opção de peso aberto a preço de commodity. Para quem já roda Qwen, é evolução natural.

Se você roda o Baidu ERNIE, provavelmente é por integração com o ecossistema Baidu — o índice de inteligência não justifica a troca.

Para quem não muda nada

Se seu gargalo é multimodalidade (imagem, áudio, vídeo), nenhum dos quatro entrega. Se você precisa de SLA corporativo ocidental com contrato, suporte e data residency garantido em jurisdição americana ou europeia, pesos abertos chineses não substituem isso. E se seu caso de uso é tão sensível que cada ponto percentual de benchmark importa mais que preço, o o3 e o Claude Haiku continuam no jogo — só não no mesmo orçamento.

O catálogo nesta data tem 15 modelos lançados nos últimos 30 dias. Quatro deles são chineses. A conta da API, daqui pra frente, vai ter cada vez mais linha de Pequim.

Em uma frase

Se você roda alto volume de tokens de saída e pode hospedar ou consumir via API de pesos abertos, o MiMo-V2-Flash da Xiaomi é o primeiro candidato a testar antes de renovar contrato com OpenAI ou Anthropic.

Perguntas frequentes

Quais são os modelos chineses no catálogo hoje?

Quatro: Xiaomi MiMo-V2-Flash, Qwen3 Next 80B A3B Thinking, Qwen3 Next 80B A3B Instruct e Baidu ERNIE 4.5 300B A47B. Todos com pesos abertos e arquitetura Mixture-of-Experts.

Quanto custa o MiMo-V2-Flash da Xiaomi?

US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de tokens de saída, com cache a US$ 0,01. É o modelo mais barato entre os que lideram o ranking de inteligência do catálogo.

Modelo chinês substitui OpenAI ou Anthropic?

Depende do caso. Para alto volume de tokens de saída e tarefas onde preço domina, o MiMo-V2-Flash já lidera o índice de inteligência do catálogo e custa uma fração do o3 ou do Claude Haiku 4.5. Para multimodalidade, SLA corporativo ocidental ou contratos com data residency específica, não substitui.

Leia também