Os 4 modelos chineses no catálogo custam menos de US$ 1,20 por milhão de saída
Xiaomi, Qwen e Baidu ocupam 1,2% do catálogo e entregam o modelo mais barato entre os top 5 de inteligência.
O recorte que ninguém está olhando
Dos 322 modelos que o catálogo ainda mantém hoje, só 4 vêm da China. É 1,2% do tabuleiro. Parece pouco, e é pouco — mas o que esses quatro fazem com esse espaço é o que interessa. Em 26 de janeiro de 2026, o modelo mais barato entre os cinco mais inteligentes do catálogo inteiro é chinês, e não por acaso: é o Xiaomi MiMo-V2-Flash, cobrando US$ 0,30 por milhão de tokens de saída enquanto entrega o maior índice de inteligência da lista.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| Qwen3 Next 80B A3B Instruct | qwen | 13.8 | 1.1 | 262k |
| ERNIE 4.5 300B A47B | baidu | 8.9 | 1.1 | 131k |
O caso Xiaomi: o topo da tabela por uma fração do preço
O MiMo-V2-Flash foi lançado em 14 de dezembro de 2025 e aparece com IQ 34,024 — à frente do OpenAI o3 (31,096) e do Anthropic Claude Haiku 4.5 (29,892). O detalhe que muda a conta: o o3 cobra US$ 8 por milhão de tokens de saída, e o Haiku 4.5 cobra US$ 5. O Xiaomi cobra US$ 0,30. São 26 vezes mais barato que o o3 para um índice de inteligência superior no recorte atual.
A arquitetura explica parte do truque. São 309 bilhões de parâmetros totais com apenas 15 bilhões ativos por token — um Mixture-of-Experts que só acorda os neurônios necessários para cada pedaço da resposta. É como um restaurante com cardápio de 300 pratos, mas o cozinheiro só prepara três por vez. O contexto de 262 mil tokens e o raciocínio nativo completam o pacote. Os pesos são abertos, então dá para inspecionar, hospedar ou destrinchar o modelo antes de mandar a primeira requisição.
A turma da Qwen: dois sabores, mesma economia
A Qwen entra com dois modelos da linha Qwen3-Next 80B A3B, lançados em 11 de setembro de 2025. A diferença entre eles é de design, não de preço: o Thinking foi feito para problemas que pedem cadeia de raciocínio visível — provas, debug, lógica multi-passo — e custa US$ 1,20 por milhão de saída. O Instruct é a versão sem traços de pensamento, mais rápida (173 tokens por segundo contra 196 do Thinking), e custa US$ 1,10.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Aqui o leitor brasileiro precisa prestar atenção. O Thinking tem IQ 16,867 e o Instruct tem 13,754. Ambos são abertos, ambos usam só 3 bilhões de parâmetros ativos em 80 bilhões totais, e ambos rodam em contexto de 262 mil tokens. Para tarefas com etapas explícitas, o Thinking compensa o dólar a mais. Para conversa e resposta direta, o Instruct já resolve.
Baidu: o veterano discreto
O ERNIE 4.5 300B A47B é o mais antigo do recorte, de junho de 2025, e o mais barato de entrada entre os quatro: US$ 0,28 por milhão de tokens de entrada. O IQ 8,867 coloca ele abaixo dos outros três, e o contexto de 131 mil tokens é a metade. Mas os 47 bilhões de parâmetros ativos em 300 totais ainda são uma máquina respeitável, e o preço de entrada o torna interessante para workloads que processam muito texto e devolvem pouco — indexação, classificação, sumarização em massa.
Para quem isso muda a conta — e para quem não muda
Se você está rodando agente, raciocínio em múltiplas etapas ou geração pesada de código, o MiMo-V2-Flash é, neste recorte, a melhor relação entre inteligência e preço. Se o seu gargalo é entrada de texto e você quer algo aberto e barato para classificar ou resumir, o ERNIE 4.5 entra como opção de volume. Se você precisa de thinking explícito sem pagar o preço de um modelo frontier, o Qwen3 Thinking é o meio-termo.
Se o seu caso de uso exige o que o catálogo chama de "acima de IQ 45", nenhum dos quatro serve — a lista de modelos acima desse limiar está vazia hoje, e nenhum chinês aparece nela. Para workloads sensíveis a latência em regiões sem boa rota para provedores chineses, a equação de preço pode não compensar o overhead de rede. E se a sua stack depende de uma API americana com SLA específico, esses quatro não substituem — complementam.
O que fazer com isso hoje
Olhe para a sua fatura do último mês e separe o que é entrada do que é saída. Se a maior parte do custo é saída e você está pagando US$ 5 ou US$ 8 por milhão, vale rodar um piloto com o MiMo-V2-Flash na mesma tarefa e comparar o resultado — o índice de inteligência diz que a perda de qualidade, se houver, não é óbvia no recorte. Se a maior parte é entrada, o ERNIE 4.5 a US$ 0,28 entra como substituto natural para o que provavelmente é uma chamada de classificação ou embedding por outro caminho.
Trocar o modelo frontier mais caro pelo MiMo-V2-Flash no caminho de saída é a mudança com maior impacto imediato na fatura, sem perda mensurável de inteligência no recorte atual.
Perguntas frequentes
Quais modelos chineses estão no catálogo hoje?
Em 26 de janeiro de 2026, são quatro: Xiaomi MiMo-V2-Flash, Qwen3-Next-80B-A3B Thinking, Qwen3-Next-80B-A3B Instruct e Baidu ERNIE 4.5 300B A47B. Todos têm pesos abertos e vêm de creators diferentes — Xiaomi, Qwen e Baidu.
O Xiaomi MiMo-V2-Flash é realmente o mais inteligente do catálogo?
No recorte atual, ele lidera com IQ 34,024, à frente do OpenAI o3 (31,096) e do Anthropic Claude Haiku 4.5 (29,892). O índice é a medição de hoje e não há série histórica para comparar evolução.
Por que o MiMo-V2-Flash é tão mais barato?
É um Mixture-of-Experts com 309B parâmetros totais mas só 15B ativos por token, o que reduz o custo de inferência por requisição. O preço publicado é US$ 0,30 por milhão de tokens de saída, contra US$ 8 do o3.