Olmo 3.1 32B Instruct custa US$ 0,60 por milhão de saída — e entrega menos inteligência que um modelo de 3B da Mistral
A AllenAI abriu o código de um 32B que perde, no índice de inteligência, para o Ministral 3B que cabe em qualquer GPU.
A conta chegou antes da curiosidade. O Olmo 3.1 32B Instruct, da AllenAI, entra hoje no catálogo cobrando US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de saída — e, no índice de inteligência que rege essa discussão, marca 6,212. É um número baixo. Para situar: o topo da tabela hoje é o Xiaomi MiMo-V2-Flash, com 34,024, seguido do OpenAI o3 (31,096) e do Claude Haiku 4.5 (29,892). Estamos falando de um modelo que não está brigando com esses.
Onde ele se encaixa, então
O 3.1 32B Instruct é um modelo denso de 32,2 bilhões de parâmetros, todos ativos, com pesos abertos, contexto de 65.536 tokens e foco declarado em diálogo multi-turno e seguimento de instrução. Não é um modelo de raciocínio — o campo reasoning está em falso — e não traz preço de cache publicado. A descrição do catálogo não traz data de corte de conhecimento, então trate qualquer coisa factual que ele afirme como suspeita até checar.
A pergunta que importa é: para que serve um 32B com esse índice, nesse preço? A resposta vem quando você compara com o que já existia.
A comparação que dói
Olha o que está sentado na mesma prateleira de modelos pequenos e abertos:
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Olmo 3.1 32B Instruct (o novo) | 6.2 | 0.2 | 0.6 | 66k |
| Ministral 3 3B 2512 | 7.1 | 0.1 | 0.1 | 131k |
| Granite 4.0 Micro | 2.0 | 0.017 | 0.112 | 131k |
| Nova Micro 1.0 | 4.4 | 0.035 | 0.14 | 128k |
| Ministral 3 8B 2512 | 9.0 | 0.15 | 0.15 | 262k |
O Ministral 3 8B, da Mistral, lançado em 2 de dezembro de 2025, custa US$ 0,15 por milhão de saída — quatro vezes mais barato — e marca 8,974 no índice de inteligência. É menor (8B contra 32B), mas entrega mais. O Ministral 3 3B, ainda mais barato (US$ 0,10 por milhão de saída), marca 7,074. O Olmo 3.1 32B perde para os dois.
Quer o contraponto de outro lado? O Granite 4.0 Micro, da IBM, custa US$ 0,112 por milhão de saída e marca 1,952 — é pior no índice, mas é quase cinco vezes mais barato. O Nova Micro 1.0, da Amazon, marca 4,416 a US$ 0,14 por milhão de saída. Em nenhum desses pares o Olmo 3.1 32B ganha.
O argumento dos pesos abertos
Existe um porém que os números não capturam: o Olmo 3.1 32B Instruct tem pesos abertos (open_weights: true). Você pode baixar, fazer fine-tune, hospedar na sua própria infraestrutura e tirar a fatura da API do meio. Para quem precisa de soberania sobre o modelo — empresas reguladas, times que ajustam o modelo para domínio próprio, projetos que não podem mandar dado sensível para API de terceiros — esse é o ponto. É o mesmo argumento que vale para a família Olmo há meses.
Mas o índice de inteligência é o que é. Se você quer o melhor modelo aberto pequeno pelo dinheiro, hoje, o Ministral 3 8B entrega mais por menos e ainda tem visão (text+image->text). Se você quer o mais barato possível e aceita qualidade menor, o Granite Micro ou o Nova Micro resolvem.
| Campo | Valor |
|---|---|
| Identificador | allenai/olmo-3.1-32b-instruct |
| Criador | allenai |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 0.600 / M tokens |
| Janela de contexto | 66k |
| Modalidade | text->text |
| Índice de inteligência (AA) | 6.2 |
| Parâmetros | 32.2B (32.2B ativos por token) |
| Pesos | abertos |
Para quem vale
Vale para quem precisa de pesos abertos acima de qualquer outra coisa, tem hardware para rodar 32B em GPU própria e aceita o índice de inteligência atual como piso para fine-tunar em cima. É o canivete suíço do time que quer treinar, não o canivete suíço do time que quer chamar de API.
Para quem não muda nada
Não muda nada para quem já chama Mistral, Granite ou Nova por API e não tem demanda específica por pesos abertos nesse tamanho. Não muda nada para quem precisa de raciocínio — o campo está em falso. Não muda nada para quem busca o melhor custo-benefício da categoria pequena: o índice de 6,212 perde para modelos menores e mais baratos que já estão no mercado há mais de um mês.
O tabuleiro
Em 6 de janeiro de 2026, o catálogo tem mais de 314 modelos de 48 criadores diferentes, e 19 foram lançados nos últimos 30 dias. A briga na faixa pequena e aberta está densa: Mistral, IBM, AllenAI, Amazon, todos disputando o mesmo centavo por milhão de tokens. O Olmo 3.1 32B Instruct entra nesse ringue cobrando caro pelo que entrega — a menos que o seu caso de uso seja especificamente "quero os pesos".
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
A implicação prática: antes de colocar o Olmo 3.1 32B Instruct numa rota de produção, rode o seu próprio eval com o seu dado. O índice de catálogo é referência, não sentença — e, nesse caso, a referência aponta para os concorrentes menores e mais baratos.
Só faz sentido trocar para o Olmo 3.1 32B Instruct se você precisa especificamente de pesos abertos de 32B; em custo-benefício, o Ministral 3 8B ganha no índice e no preço.
Perguntas frequentes
O Olmo 3.1 32B Instruct é melhor que o Ministral 3 8B?
Não pelo índice de inteligência atual: o Olmo 3.1 32B marca 6,212 contra 8,974 do Ministral 3 8B, e custa quatro vezes mais por milhão de tokens de saída (US$ 0,60 contra US$ 0,15).
Quanto custa usar o Olmo 3.1 32B Instruct pela API?
US$ 0,20 por milhão de tokens de entrada e US$ 0,60 por milhão de tokens de saída. O catálogo não publicou preço de cache para este modelo.
O Olmo 3.1 32B Instruct serve para raciocínio ou agentes?
Não. O catálogo marca o campo `reasoning` como falso e não traz nota de agentic — é um modelo de instrução e diálogo, não um modelo de raciocínio estruturado.