106B parâmetros, US$ 1,10 por milhão: o que o INTELLECT-3 entrega de verdade
Prime Intellect lança modelo MoE open weights pós-treinado com RL massivo; o índice de inteligência bate o do gpt-oss-20b e do Llama 4 Maverick, mas cobra caro na saída.
O gancho está no preço de saída, não no tamanho
A Prime Intellect soltou hoje o INTELLECT-3, um MoE de 106B parâmetros com 12B ativos por passagem, pós-treinado a partir do GLM-4.5-Air-Base via SFT seguido de RL em larga escala. O comunicado fala em "state-of-the-art para o tamanho" em matemática — e, olhando o índice de inteligência atual, a nota 15,718 confirma o discurso: fica acima do gpt-oss-20b (15,225) e do Llama 4 Maverick (14,477), dois concorrentes diretos na faixa dos modelos abertos médios.
Mas a conta vem agora. Entrada custa US$ 0,20 por milhão de tokens e a saída — que é onde mora o gasto real de quem usa o modelo em produção — sai por US$ 1,10 por milhão. Multiplica isso por uma chamada de agente que devolve 5.000 tokens e a diferença para US$ 0,13 do gpt-oss-20b aparece rápido.
O que mudou em relação aos pares abertos
O INTELLECT-3 entra numa prateleira específica: modelos com pesos abertos, raciocínio nativo, contexto de 128K e parâmetros na casa das dezenas de bilhões. Os quatro pares mais próximos no catálogo de hoje são exatamente esses.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| INTELLECT-3 (o novo) | 15.7 | 0.2 | 1.1 | 131k |
| gpt-oss-20b | 15.2 | 0.03 | 0.13 | 131k |
| Llama 4 Scout | 10.3 | 0.1 | 0.3 | 1.31M |
| Llama 3.3 Nemotron Super 49B | 12.4 | 0.4 | 0.4 | 131k |
| Llama 4 Maverick | 14.5 | 0.2 | 0.696 | 1.05M |
Olhando o recorte, três coisas se destacam. Primeiro, a nota de inteligência é a mais alta do grupo — e isso inclui o Llama 4 Maverick, que tem 402B totais, quase quatro vezes mais. Segundo, o preço de entrada é competitivo (US$ 0,20 fica abaixo dos US$ 0,40 do Nemotron Super 49B), mas o de saída é o mais caro entre os pares. Terceiro, o INTELLECT-3 é o único do grupo treinado explicitamente para raciocínio, junto com o gpt-oss-20b.
Para quem vale — e para quem não muda nada
Vale para você se: roda agente em produção e precisa de raciocínio forte sem fechar contrato com OpenAI ou Anthropic; já tem infra para hospedar 106B em MoE (não é trivial) ou aceita pagar a API; e o gargalo da sua conta é a qualidade da resposta, não o volume de tokens gerados.
Não muda nada para você se: o seu caso de uso é classificação simples, sumarização curta ou extração de JSON — o gpt-oss-20b cobre por uma fração do custo. Também não muda nada se você já tem pipeline com Llama 4 Maverick e está feliz com multimodal — o INTELLECT-3 é só texto. E se você roda modelo local sem GPU A100/H100 sobrando, 106B totais com 12B ativos não cabem no seu setup; o gpt-oss-20b (21B) ou o Nemotron 49B continuam sendo a porta de entrada.
Onde ele se encaixa no tabuleiro
No topo do índice hoje, OpenAI o3 lidera com 31,096 a US$ 8 por milhão de saída, seguido do Claude Haiku 4.5 a US$ 5. O INTELLECT-3 está bem abaixo desses números — e não foi feito para competir com eles. O nicho dele é a faixa intermediária dos abertos, onde Qwen3 Next 80B A3B Thinking (16,867 a US$ 1,20) e gpt-oss-120b (24,126 a US$ 0,17) reinam em propostas diferentes: o Qwen pensa mais e cobra mais caro na saída; o gpt-oss-120b entrega mais inteligência por uma fração do custo de saída.
Em outras palavras: o INTELLECT-3 não é o mais barato nem o mais inteligente da prateleira. É o que melhor equilibra raciocínio nativo com open weights na casa dos 100B, cobrando caro na saída para bancar o pós-treinamento com RL.
A implicação prática
Se você está pagando API em modelo aberto hoje, faça a conta antes de trocar. Para cada milhão de tokens de saída, o INTELLECT-3 custa US$ 1,10 contra US$ 0,13 do gpt-oss-20b — uma diferença de 8,5 vezes. Só compensa trocar se o ganho de 0,5 ponto no índice de inteligência refletir em taxa de aprovação maior nas suas tarefas de raciocínio. Meça antes. Se você roda on-prem, o cálculo é outro: o custo é de GPU, não de token, e aí o INTELLECT-3 começa a fazer sentido para times que já têm cluster H100 parado.
| Campo | Valor |
|---|---|
| Identificador | prime-intellect/intellect-3 |
| Criador | prime-intellect |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 1.10 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text->text |
| Índice de inteligência (AA) | 15.7 |
| Parâmetros | 107B (12B ativos por token) |
| Pesos | abertos |
| Raciocínio | sim (gasta tokens de saída pensando) |
Troque para o INTELLECT-3 só se a sua tarefa de raciocínio ganhar mais que 8 vezes em qualidade para justificar a saída a US$ 1,10 por milhão; nos demais casos, gpt-oss-20b ou gpt-oss-120b continuam entregando mais por menos.
Perguntas frequentes
O que é o INTELLECT-3 da Prime Intellect?
É um modelo open weights de 106B parâmetros totais com 12B ativos por passagem (MoE), pós-treinado a partir do GLM-4.5-Air-Base via SFT e RL em larga escala. Foi lançado em 27 de novembro de 2025 e entra no catálogo a US$ 0,20 por milhão de tokens de entrada e US$ 1,10 por milhão de saída.
INTELLECT-3 é melhor que gpt-oss-20b?
No índice de inteligência atual, sim: 15,718 contra 15,225 do gpt-oss-20b. Mas o gpt-oss-20b custa US$ 0,13 por milhão de saída, contra US$ 1,10 do INTELLECT-3 — uma diferença de 8,5 vezes no preço de saída.
Vale rodar INTELLECT-3 localmente?
Depende da sua infra. Com 106B totais em MoE e 12B ativos, você precisa de cluster com GPUs H100 ou A100 sobrando. Em CPU ou em GPUs menores, o Nemotron 49B ou o gpt-oss-20b continuam sendo as opções realistas.