Granite 4.1 8B custa US$ 0,10 por milhão de tokens e não quer competir com GPT-5.3
O novo modelo aberto da IBM chega barato, pequeno e com 131K de contexto — e o jogo dele é outro.
Quatro dias depois de chegar ao catálogo, o Granite 4.1 8B já é o tipo de lançamento que faz a pergunta certa na hora errada: a IBM está cobrando US$ 0,10 por milhão de tokens de saída e US$ 0,05 por milhão de entrada, com cache de leitura no mesmo valor da entrada. É barato. Mas barato em relação a quê?
O preço só impressiona se você comparar errado
Compare com o topo de gama e a conta parece absurda: o Gemini 3.1 Pro Preview cobra US$ 12 por milhão de saída, o GPT-5.3-Codex cobra US$ 14, e o DeepSeek V4 Pro cobra US$ 1,74. O Granite 4.1 8B entra a quase 140 vezes mais barato que o Codex. Só que essa comparação é desonesta — você está colocando um carro de passeio contra um caminhão.
O índice de inteligência do Granite 4.1 8B é 6,421. O do Ministral 3 3B, da Mistral, é 7,074. O do LFM2.5-1.2B-Instruct, da LiquidAI, é 2,299. O do Granite 4.0 Micro, da própria IBM, é 1,952. Ou seja: o modelo novo da IBM está no mesmo terreno de outros modelos pequenos voltados para tarefas específicas, não no terreno dos frontais.
O que esse modelo está realmente fazendo
Pensa no Granite 4.1 8B como um motor elétrico de小车 de entrega: ele não vai te levar do Rio a São Paulo em três horas, mas entrega o pacote na esquina gastando quase nada de bateria. Os 8 bilhões de parâmetros, todos ativos (não é MoE), com 131.072 tokens de contexto e pesos abertos, entregam exatamente o que uma equipe de TI precisa para rodar classificação, extração, sumarização e roteamento de intenção dentro de casa — sem mandar dado sensível para a API de ninguém.
| Campo | Valor |
|---|---|
| Identificador | ibm-granite/granite-4.1-8b |
| Criador | ibm-granite |
| Preço de entrada | US$ 0.050 / M tokens |
| Preço de saída | US$ 0.100 / M tokens |
| Janela de contexto | 131k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.050 / M (0% de desconto) |
| Índice de inteligência (AA) | 6.4 |
| Índice de código | 9.5 |
| Parâmetros | 8B (8B ativos por token) |
| Pesos | abertos |
| Velocidade de saída | 101 tokens/s |
A velocidade registrada é de 100,93 tokens por segundo, e o preço blended (entrada + saída ponderados) fica em US$ 0,0625 por milhão. É o tipo de número que some na fatura quando você processa 100 milhões de tokens por mês. A nota de coding é 9,5 — acima do Ministral 3 3B, que marca 4,784 — então, para completar código pequeno ou rodar em pipelines de revisão automática, o Granite 4.1 8B se sustenta.
Onde ele perde e para quem não faz sentido
Se você precisa de raciocínio encadeado, planejamento multi-etapa ou agente autônomo, este modelo não é a peça. O campo reasoning está em false, o agentic veio nulo, e a nota de codificação, embora razoável, não substitui um Codex. Para resumir um PDF de 200 páginas com nuance ou para gerar uma estratégia de marketing do zero, o caminho continua sendo um modelo acima de IQ 40.
Contra o próprio irmão mais velho, o Granite 4.0 Micro, o 4.1 8B sai pior no preço de saída (US$ 0,10 contra US$ 0,112 — na prática, empate) e muito melhor em inteligência (6,421 contra 1,952). É uma evolução real dentro da família. Já contra o Ministral 3 3B, a disputa fica apertada: o francês custa o mesmo na saída, entrega contexto idêntico de 131K, ainda traz visão (text+image->text) e tem velocidade quase duas vezes maior (208,41 t/s contra 100,93 t/s). A vantagem do Granite está nos pesos abertos e no ecossistema IBM — relevante se você já roda em watsonx.
| Modelo | Inteligência | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|---|
| Granite 4.1 8B (o novo) | 6.4 | 0.05 | 0.1 | 131k |
| LFM2.5-1.2B-Instruct (free) | 2.3 | 0 | 0 | 33k |
| LFM2.5-1.2B-Thinking (free) | 2.3 | 0 | 0 | 33k |
| Ministral 3 3B 2512 | 7.1 | 0.1 | 0.1 | 131k |
| Granite 4.0 Micro | 2.0 | 0.017 | 0.112 | 131k |
O tabuleiro em 4 de maio de 2026
O catálogo tem hoje mais de 435 modelos listados, vindos de 60 criadores. Nos últimos 30 dias, 47 modelos entraram. O topo de inteligência continua dominado por Google, OpenAI e DeepSeek, todos acima de IQ 45, com o Xiaomi MiMo-V2.5-Pro marcando 42,88 logo abaixo. O Granite 4.1 8B não está nem perto desse grupo — e não foi feito para estar.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| DeepSeek V4 Pro 0423 | 45.3 | 2.0845 |
| MiMo-V2.5-Pro | 42.9 | 0.87 |
| MiMo-V2.5 | 38.0 | 0.28 |
O que fazer com isso na segunda-feira
Se você está pagando API para classificar ticket, extrair campo de contrato ou rodar um RAG simples em documentos internos, vale testar o Granite 4.1 8B no lugar do modelo grande que está fazendo esse trabalho hoje. A conta cai, o dado não sai, e a perda de qualidade é pequena para a tarefa. Se o seu caso é gerar código complexo, raciocinar sobre problemas abertos ou construir agente, continue olhando para Gemini 3.1 Pro, GPT-5.3-Codex ou DeepSeek V4 Pro — e aceite pagar entre 17× e 140× mais por milhão de tokens de saída.
Troque seu modelo grande pelo Granite 4.1 8B em tarefas internas de classificação, extração e sumarização; mantenha o modelo grande para raciocínio, código complexo e agente.
Perguntas frequentes
Quanto custa o Granite 4.1 8B?
US$ 0,05 por milhão de tokens de entrada e US$ 0,10 por milhão de tokens de saída, com cache de leitura no mesmo valor da entrada. O preço blended fica em US$ 0,0625 por milhão de tokens.
Granite 4.1 8B serve para programação?
Serve para completar e revisar código pequeno, com nota 9,5 em coding. Não substitui um modelo de raciocínio como o GPT-5.3-Codex para tarefas complexas de engenharia.
Qual a diferença entre Granite 4.1 8B e Granite 4.0 Micro?
O 4.1 8B tem 8 bilhões de parâmetros contra 3B do Micro, índice de inteligência de 6,421 contra 1,952, e o mesmo contexto de 131K. O preço de saída é praticamente igual (US$ 0,10 contra US$ 0,112).