Grok 4.1 Fast custa metade do Claude Haiku 4.5
xAI entra na briga dos modelos agentic com 2 milhões de contexto e preço de commodity — mas sem nota de inteligência medida.
Você está olhando para a fatura da API e vendo um lançamento novo da xAI no mesmo dia em que o Claude Haiku 4.5 aparece em segundo lugar no ranking de inteligência. A pergunta não é qual é melhor — é qual dos dois cabe no seu orçamento sem te fazer perder sono.
O preço é a notícia
O Grok 4.1 Fast chega cobrando US$ 0,20 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída. Em cache, a tarifa despenca para US$ 0,05. É o tipo de tabela que faz você refazer a planilha.
Coloque do lado do Claude Haiku 4.5, que hoje é o segundo colocado em inteligência e cobra US$ 1 por milhão de entrada e US$ 5 por milhão de saída. O Grok é cinco vezes mais barato na saída. Em cache, a diferença é ainda maior: US$ 0,05 contra US$ 0,10 do Haiku. Para quem roda agente que devolve muito texto — suporte automatizado, pesquisa profunda, varredura de logs — essa é a conta que decide o fornecedor.
| Campo | Valor |
|---|---|
| Identificador | x-ai/grok-4.1-fast |
| Criador | x-ai |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 0.500 / M tokens |
| Janela de contexto | 2M |
| Modalidade | text+image+file->text |
| Leitura de cache | US$ 0.050 / M (75% de desconto) |
O que a xAI está vendendo (e o que não está)
A descrição oficial posiciona o modelo como o melhor da xAI para tool calling agentic, citando explicitamente suporte ao cliente e pesquisa profunda como casos de uso. O detalhe que merece atenção: o reasoning pode ser ativado ou desativado por chamada. Isso é importante porque significa que você paga o token de raciocínio só quando quer — e modelos rivais obrigam você a engolir o custo do pensamento encadeado em toda requisição.
A janela de contexto é de 2 milhões de tokens. É o mesmo território do Haiku 4.5 e maior do que a maioria dos modelos abertos do ranking atual. Para quem alimenta agente com codebase inteira ou transcrição de call center, esse é o limite que importa.
O que os dados não dizem
Aqui vai o porém. O Grok 4.1 Fast não tem nota de inteligência publicada no catálogo, não tem benchmark de codificação, não tem score agentic, não tem blended price. O catálogo também não informa país de origem, velocidade, nem corte de conhecimento. Você está comprando um modelo sem saber como ele se compara numericamente com o o3 (IQ 31,096) ou com o próprio Haiku 4.5 (IQ 29,892).
Isso não é defeito automático — o OpenRouter não mediu, mas a xAI certamente publicou benchmarks próprios. O ponto é: para o seu comparativo de compra, a régua oficial ainda não existe. Quem precisa decidir hoje vai ter de testar com o próprio caso de uso.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Para quem vale — e para quem não muda nada
Vale para você se: roda agente de tool calling em produção, paga a conta em dólar e precisa de contexto longo. O preço de cache a US$ 0,05 é praticamente commodity, e a opção de desligar o reasoning transforma o modelo num dual-use: barato como um 8B quando você só quer classificar, esperto como um frontier quando você liga o pensamento.
Não muda nada se: você já está casado com o Claude Haiku 4.5 e mediu qualidade de resposta no seu caso específico — a diferença de cinco vezes no preço só compensa se o Grok entregar taxa de sucesso parecida, e isso ninguém te garante sem teste. Também não muda nada para workloads que dependem de multimodalidade nativa de áudio ou vídeo, porque a modalidade declarada é texto + imagem + arquivo → texto, sem fala.
Também passa batido se você está no tier gratuito: o Grok 4.1 Fast não tem flag free. É API paga desde o primeiro token.
O tabuleiro em 19 de novembro
O catálogo tem mais de 277 modelos listados hoje, vindos de 42 criadores. Nos últimos 30 dias, foram 16 lançamentos — o ritmo não está desacelerando. O topo de inteligência segue dominado por OpenAI (o3 em 31,096) e Anthropic (Haiku 4.5 em 29,892), com a OpenAI preenchendo o resto do pódio com os modelos gpt-oss abertos. A xAI não aparece nessa régua.
A jogada da xAI, portanto, não é ganhar o ranking de inteligência — é ganhar o ranking de preço por token útil em workload agentic. É uma briga diferente, e o Grok 4.1 Fast chega posicionado para ela.
O que você faz com isso amanhã
Se você tem agente em produção hoje, roda um piloto de 48 horas com o Grok 4.1 Fast no mesmo prompt que usa no Haiku 4.5. Meça taxa de sucesso de tool call, tokens de saída por tarefa e latência. Se a qualidade ficar dentro de 10% do Haiku, a economia anual vai pagar um engenheiro júnior. Se ficar abaixo, você volta para o Haiku e segue a vida — mas agora sabendo que existe uma opção cinco vezes mais barata esperando para ser reavaliada quando a xAI publicar os números.
Teste o Grok 4.1 Fast em workload agentic com reasoning desligado por padrão; se a taxa de sucesso de tool call ficar próxima do Haiku 4.5, a economia de cinco vezes no token de saída muda a conta da API no fim do mês.
Perguntas frequentes
Quanto custa o Grok 4.1 Fast na API?
Cobra US$ 0,20 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de saída e US$ 0,05 por milhão de tokens em cache. É cinco vezes mais barato na saída do que o Claude Haiku 4.5.
O Grok 4.1 Fast tem nota de inteligência no catálogo?
Não. O índice de inteligência, o benchmark de codificação e o score agentic não foram publicados no catálogo nesta data. Você só consegue comparar via teste próprio no seu caso de uso.
Para que serve o Grok 4.1 Fast?
A xAI posiciona o modelo para tool calling agentic, citando suporte ao cliente e pesquisa profunda como casos de uso. O reasoning pode ser ativado ou desativado por chamada, o que permite usar o modelo barato sem custo de pensamento encadeado.