Os 24 pesos abertos do catálogo entregam o melhor da fronteira por uma fração do preço
Modelos com pesos publicados já ocupam o topo do ranking de inteligência e cobram até 26 vezes menos que o o3 da OpenAI por token de saída.
O ranking virou, e quase ninguém avisou
Se você paga a conta da API e ainda acha que "open weight" é sinônimo de modelo capenga, olha o topo do catálogo hoje. O modelo mais inteligente da lista geral é o Xiaomi MiMo-V2-Flash, com pesos abertos, 309B parâmetros totais e 15B ativos por passagem. Ele custa US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de tokens de saída. O segundo colocado, OpenAI o3, cobra US$ 8,00 pelo mesmo milhão de tokens de saída. São 26 vezes mais caro pelo segundo lugar.
A diferença não está só no preço. Está no que ficou barato de verdade: o token de saída, que é o que mais pesa na fatura quando você roda agente, geração de código ou resumo longo. Entrada e cache também caíram, mas a saída é onde a fronteira aberta já entrega o mesmo nível de inteligência por uma fração do custo.
O recorte tem 24 modelos, mas só oito criadores
O catálogo guarda 314 modelos. Desses, 24 publicam pesos. Oito empresas diferentes assinam a lista: Xiaomi, OpenAI, Mistral, Qwen, Prime Intellect, NVIDIA, e mais dois que não aparecem no recorte principal. Não é um nicho de laboratório obscuro — é Meta, é a própria OpenAI, é a NVIDIA vendendo chip e modelo ao mesmo tempo.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| MiMo-V2-Flash | xiaomi | 34.0 | 0.3 | 262k |
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Devstral 2 2512 | mistralai | 19.2 | 2 | 262k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| Mistral Large 3 2512 | mistralai | 15.9 | 1.5 | 262k |
| INTELLECT-3 | prime-intellect | 15.7 | 1.1 | 131k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Nemotron 3 Nano 30B A3B | nvidia | 14.5 | 0.2 | 262k |
O padrão que aparece quando você olha o recorte inteiro é claro: toda a vanguarda aberta é Mixture-of-Experts. Dos oito modelos listados, sete são MoE com parâmetros ativos entre 3B e 41B, mesmo quando o total passa de 600B. A exceção é o Devstral 2 2512 da Mistral, que ainda é denso, com 123B ativos. A arquitetura virou padrão porque entrega mais inteligência por dólar de inferência — você carrega o modelo inteiro na memória, mas só aciona uma fração dos pesos a cada token.
Traduzindo o marketing dos pesos abertos
Quando o release diz "modelo aberto", o que muda na prática? Três coisas, e só três:
- Você pode rodar localmente se tiver GPU suficiente. MiMo-V2-Flash com 15B ativos cabe em uma única H100; gpt-oss-120b com 5,1B ativos cabe em uma estação com 24GB de VRAM.
- Você pode fazer fine-tuning com seus próprios dados. Apache 2.0 no Mistral Large 3 e no gpt-oss-20b, licença própria no restante.
- Você não fica refém de uma API só. Pode trocar de provedor, hospedar em casa, ou revender acesso.
O que não muda: o modelo ainda precisa de conhecimento de corte recente para alguns domínios, e a qualidade de raciocínio ainda varia por tarefa. O Devstral 2 2512, por exemplo, é especializado em código agêntico e tem IQ geral de 19,242 — abaixo do MiMo, mas com nota de coding de 31,259, a maior do recorte.
Quem se beneficia e quem não muda nada
Vale a pena olhar para pesos abertos se:
- Você roda agente ou geração de código em volume e a fatura de tokens de saída está te matando.
- Você tem requisito regulatório de não mandar dado para API fechada.
- Você quer experimentar fine-tuning sem gastar seis dígitos com um laboratório.
Não muda nada se:
- Você usa modelo para poucas chamadas por mês e o custo já é irrelevante.
- Seu produto depende de multimodalidade nativa (vídeo, áudio) que o recorte aberto ainda não entrega bem.
- Você precisa de SLA corporativo com suporte humano 24/7 — peso aberto não vem com isso.
O tabuleiro em janeiro de 2026
O cenário é chinês, americano e francês. Xiaomi e Qwen (China) dominam o topo de inteligência aberta. OpenAI e NVIDIA (EUA) ocupam o meio com modelos eficientes. Mistral (França) segura a ponta de código com o Devstral. Nenhum dos pesos abertos do recorte vem de laboratório brasileiro, indiano ou japonês. A geografia da fronteira aberta segue sendo EUA-China-Europa, com a China puxando a inteligência bruta e os EUA a eficiência por dólar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
O que você faz com isso hoje
Se você está escolhendo modelo agora, a regra é simples: rode o MiMo-V2-Flash como default para tarefas que exigem raciocínio pesado, e o gpt-oss-20b para tarefas simples que precisam ser baratas — custa US$ 0,03 por milhão de tokens de entrada e US$ 0,13 por milhão de saída, com 21B totais e 3,6B ativos. Para código agêntico, o Devstral 2 2512 é o que tem a melhor nota específica do recorte. O o3 da OpenAI continua sendo opção quando você precisa do melhor absoluto e não liga para o custo — mas em 2026, "o melhor absoluto" já não é mais o suficiente para justificar 26 vezes o preço.
Antes de chamar a API mais cara, teste o MiMo-V2-Flash como default: ele lidera o catálogo e cobra US$ 0,30 por milhão de tokens de saída — 26 vezes menos que o o3.
Perguntas frequentes
O que significa "pesos abertos" na prática?
Significa que os arquivos de pesos do modelo são publicados sob alguma licença e podem ser baixados, rodados localmente e ajustados com dados próprios. Não significa que o treinamento foi aberto ou que o uso comercial é livre em todos os casos — cada modelo tem sua licença, do Apache 2.0 a termos próprios.
Posso rodar o MiMo-V2-Flash na minha empresa?
Em teoria sim, porque ele tem 15B parâmetros ativos por passagem. Na prática, você precisa de pelo menos uma GPU H100 com 80GB para inferência confortável, ou um servidor com várias A100/L40S. Para fine-tuning, a conta de memória sobe bastante.
Modelo aberto é mais barato que API fechada sempre?
Não automaticamente. Você troca custo de token por custo de infraestrutura: GPU, energia, equipe de MLOps. A conta fecha quando o volume de chamadas é alto o suficiente para diluir o custo fixo do hardware. Abaixo desse ponto, a API fechada ainda sai mais barata.