Qwen 3.5 397B e MiMo-V2-Flash empatam em QI, mas a conta sai 7,8x maior
Dois modelos chineses open-weights com 34 pontos de inteligência e arquitetura híbrida. Um cobra US$ 2,34 por milhão de tokens de saída; o outro, US$ 0,30.
O empate que ninguém pediu
Você olha o índice de inteligência e vê 34,262 contra 34,024. Diferença de 0,24 ponto. Em qualquer cenário prático, é o mesmo modelo. Só que um cobra US$ 2,34 por milhão de tokens de saída e o outro, US$ 0,30. Em volume, isso é uma diferença de 7,8x na fatura — sem que a capacidade tenha mudado.
A pergunta que sobra é: o que o Qwen 3.5 397B A17B está vendendo para justificar esse preço? E a resposta está nos números que o índice de inteligência não mostra.
O que o Qwen cobra a mais
O Qwen 3.5 397B A17B tem 397 bilhões de parâmetros totais com 17 bilhões ativos. É uma arquitetura MoE híbrida, com atenção linear misturada à atenção tradicional — o tipo de escolha que entrega throughput alto sem perder qualidade em tarefas longas. Lançado em 16 de fevereiro de 2026, multimodal de verdade: aceita texto, imagem e vídeo, devolve só texto. Janela de contexto de 262 mil tokens.
Onde ele ganha do MiMo: coding 48,21 contra não medido; agentic 19,84 contra não medido; blended de US$ 1,35 por milhão de tokens (preço médio ponderado) contra não publicado. O MiMo-V2-Flash, da Xiaomi, só tem os números de inteligência e de omniscience — o resto do quadro comparativo ficou de fora.
Traduzindo o marketing: o Qwen está sendo vendido como ferramenta de produção. O MiMo, como base aberta barata.
O que o MiMo entrega por quase nada
MiMo-V2-Flash tem 309 bilhões totais e 15 bilhões ativos. Mesma família de arquitetura híbrida, mesma janela de 262 mil tokens, mas só texto → texto. Lançado em 14 de dezembro de 2025, mais de dois meses antes do Qwen 3.5. E é o modelo mais barato do catálogo inteiro com índice acima de 34.
| Critério | Qwen3.5 397B A17B | MiMo-V2-Flash |
|---|---|---|
| Índice de inteligência | 34.3 | 34.0 |
| Entrada US$/M | 0.55 | 0.1 |
| Saída US$/M | 3.5 | 0.3 |
| Contexto | 262k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 88 | — |
| Índice de código | 48.2 | — |
| Índice agêntico | 19.8 | — |
O detalhe que muda a conta: o MiMo tem cache de leitura a US$ 0,01 por milhão de tokens. Quando você repete o mesmo prompt em chamadas sucessivas — exatamente o que acontece em qualquer pipeline RAG ou agente — o custo de input colapsa. O Qwen 3.5 não publicou preço de cache. Se você roda agente com contexto repetido, a diferença real entre os dois pode passar de 10x.
Onde cada um ganha
Qwen 3.5 397B A17B ganha quando: você precisa de multimodal nativo (imagem e vídeo entram no prompt), tem tarefa de coding pesada ou quer agentic validado por benchmark. O preço de US$ 2,34 por milhão de saída é alto, mas você está pagando por um modelo que entrega em produção.
MiMo-V2-Flash ganha quando: o trabalho é texto puro, o prompt se repete muito e a margem de cada chamada precisa ser gorda. US$ 0,30 por milhão de saída com cache a US$ 0,01 é, hoje, a referência de custo no topo do catálogo.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
E para deixar claro onde isso se encaixa: o Gemini 3.1 Pro Preview lidera com 47,7 de índice e cobra US$ 12 por milhão de saída. Claude Sonnet 4.6 está em 35,1 por US$ 15. Os dois modelos chineses deste comparativo entregam 90% da inteligência do Claude por uma fração do preço — e o MiMo, especificamente, cobra 40x menos que o Sonnet com índice quase idêntico.
O que isso muda na sua pilha
Se você está pagando API para gerar texto em volume, o MiMo-V2-Flash é o novo padrão de custo. Se você precisa ver imagem ou vídeo junto, não tem escolha: é Qwen 3.5, e a conta vai ser proporcional à multimodelidade. O empate no índice é só o ponto de partida — o resto da decisão mora nos centavos por token e no que você, de fato, coloca no prompt.
Para texto puro em volume, troque para o MiMo-V2-Flash e use o cache de US$ 0,01 para colapsar o custo de prompts repetidos; só pague os US$ 2,34 do Qwen 3.5 quando a entrada tiver imagem ou vídeo.
Perguntas frequentes
Qwen 3.5 397B A17B ou Xiaomi MiMo-V2-Flash: qual é mais barato?
O MiMo-V2-Flash é mais barato em quase todas as métricas: US$ 0,10 por milhão de tokens de entrada contra US$ 0,39, e US$ 0,30 por milhão de saída contra US$ 2,34. Em volume com cache habilitado, a diferença pode passar de 10x.
Os dois modelos têm o mesmo nível de inteligência?
Praticamente. O índice Artificial Analysis marca 34,262 para o Qwen 3.5 e 34,024 para o MiMo-V2-Flash — 0,24 ponto de diferença, dentro da margem de empate. O Qwen tem, porém, medições de coding (48,21) e agentic (19,84) que o MiMo não publicou.
Qual dos dois aceita imagem e vídeo?
Só o Qwen 3.5 397B A17B. O MiMo-V2-Flash é text-to-text. Se o seu fluxo precisa anexar imagem ou vídeo ao prompt, o MiMo está fora da jogada.