Sonnet 4.6 custa 50 vezes mais que MiMo-V2-Flash; vale a diferença?
Comparativo frente a frente entre o modelo da Anthropic e o MoE open-weights da Xiaomi, com índice de inteligência, contexto e preço na ponta do lápis.
Lançado três dias antes desta comparação, o Claude Sonnet 4.6 da Anthropic aparece no catálogo com preço de saída de US$ 15 por milhão de tokens. O MiMo-V2-Flash da Xiaomi, que estreou em dezembro de 2025, cobra US$ 0,30 pela mesma janela. A diferença é de 50x — e é exatamente aí que mora a decisão que ninguém quer tomar no escuro.
O que cada um entrega em inteligência
No índice de inteligência medido hoje, o Sonnet 4.6 marca 35,108 e o MiMo-V2-Flash marca 34,024. A separação é de pouco mais de um ponto, o que, em termos práticos, coloca os dois modelos no mesmo andar de capacidade geral. Quem olha só o número não vê motivo para trocar.
O detalhe que muda o cálculo está no tipo de tarefa. O Sonnet 4.6 é multimodal de verdade: aceita texto, imagem e arquivo, e devolve texto. O MiMo-V2-Flash é só texto→texto. Se o seu fluxo envolve mandar PDF, print ou planilha junto com o prompt, o modelo da Xiaomi não entra na conversa.
Preço: a tradução honesta do release
Quando o catálogo diz que o MiMo é "barato", ele quer dizer isto: para cada milhão de tokens que saem do modelo, você paga US$ 0,30. No Sonnet 4.6, o mesmo milhão custa US$ 15. Na entrada, a proporção é parecida: US$ 3 contra US$ 0,10. E tem cache de leitura — US$ 0,30 por milhão no Sonnet, US$ 0,01 no MiMo.
Traduzindo para um caso real: um agente que gasta 5 milhões de tokens de saída por mês custa cerca de US$ 75 no Sonnet 4.6 e US$ 1,50 no MiMo-V2-Flash. Em volume, essa diferença paga um engenheiro júnior.
Contexto, arquitetura e o que isso significa na prática
A janela de contexto do Sonnet 4.6 é de 1 milhão de tokens. A do MiMo-V2-Flash é de 262 mil. Se o seu caso de uso é resumir um repositório inteiro ou manter uma conversa longa com dezenas de documentos anexados, o modelo da Anthropic segura sem você precisar truncar. O da Xiaomi, não.
O MiMo-V2-Flash é uma Mixture-of-Experts com 309 bilhões de parâmetros totais e só 15 bilhões ativos por token — é como ter um restaurante com 309 chefs na folha, mas só 15 cozinham cada prato. O resultado é que o modelo roda mais barato por token, e os pesos são abertos: você pode self-host, ajustar fino, ou inspecionar o que está acontecendo dentro. O Sonnet 4.6 é fechado e só roda via API da Anthropic.
| Critério | Claude Sonnet 4.6 | MiMo-V2-Flash |
|---|---|---|
| Índice de inteligência | 35.1 | 34.0 |
| Entrada US$/M | 3 | 0.1 |
| Saída US$/M | 15 | 0.3 |
| Contexto | 1M | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 41 | — |
| Índice de código | — | — |
| Índice agêntico | — | — |
Velocidade e o resto do tabuleiro
O Sonnet 4.6 aparece com 41,37 tokens por segundo no catálogo. O MiMo-V2-Flash não tem velocidade publicada — o catálogo não mediu. Isso não significa que o modelo da Xiaomi é lento; significa que o número não está disponível para comparar com o mesmo critério.
Para situar os dois no mercado atual, vale olhar quem está na frente: o Gemini 3.1 Pro Preview lidera o índice de inteligência com 47,738 e cobra US$ 12 por milhão de tokens de saída — mais barato que o Sonnet 4.6 e bem à frente em capacidade. O Qwen3.5 397B A17B aparece logo abaixo, com 34,262 de IQ e US$ 2,34 por milhão de saída. O catálogo tem mais de 340 modelos listados hoje, vindos de 52 criadores diferentes.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
Quando cada um ganha
Sonnet 4.6 ganha quando você precisa de multimodal real (imagem, PDF, arquivo), janela de 1 milhão de tokens para trabalhar com bases grandes, e prefere pagar pela API em vez de manter infraestrutura. É o caso de times pequenos que querem delegar a operação para o provedor e usar o modelo como ferramenta pronta.
MiMo-V2-Flash ganha quando o orçamento é o fator decisivo, a tarefa é só texto, e você tem capacidade técnica para hospedar e ajustar um modelo open-weights. É o caso de empresas com volume alto de tokens, equipes de ML maduras, ou qualquer cenário onde os 50x de economia mensal compensam o investimento em infraestrutura.
Se multimodal e contexto gigante não estão no seu checklist, o MiMo-V2-Flash entrega o mesmo andar de inteligência por uma fração do custo. Se estão, o Sonnet 4.6 ainda é o caminho mais curto — até alguém open-weights cobrir essa lacuna.
Pague Anthropic quando precisar de multimodal e contexto de 1M; escolha o MiMo-V2-Flash quando o gargalo for custo por token e a tarefa for só texto.
Perguntas frequentes
Qual a diferença de preço entre Claude Sonnet 4.6 e MiMo-V2-Flash?
O Sonnet 4.6 cobra US$ 15 por milhão de tokens de saída, enquanto o MiMo-V2-Flash cobra US$ 0,30 pela mesma janela — uma diferença de 50x. Na entrada, a proporção se mantém: US$ 3 contra US$ 0,10 por milhão.
O MiMo-V2-Flash aceita imagem e PDF?
Não. O MiMo-V2-Flash é exclusivamente texto→texto. Quem precisa enviar imagem, PDF ou arquivo junto com o prompt precisa usar o Sonnet 4.6 ou outro modelo multimodal.
O MiMo-V2-Flash tem pesos abertos?
Sim. O MiMo-V2-Flash é open-weights, com 309 bilhões de parâmetros totais em arquitetura Mixture-of-Experts e 15 bilhões ativos por token. Dá para self-host e fazer ajuste fino, ao contrário do Sonnet 4.6, que só roda via API.