FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Grok 4.1 Fast custa metade do Claude Haiku 4.5

xAI entra na briga dos modelos agentic com 2 milhões de contexto e preço de commodity — mas sem nota de inteligência medida.

Redação FalaVIP IA 4 min de leitura
US$ 0,20por milhão de tokens de entrada
US$ 0,50por milhão de tokens de saída
US$ 0,05por milhão de tokens em cache

Você está olhando para a fatura da API e vendo um lançamento novo da xAI no mesmo dia em que o Claude Haiku 4.5 aparece em segundo lugar no ranking de inteligência. A pergunta não é qual é melhor — é qual dos dois cabe no seu orçamento sem te fazer perder sono.

O preço é a notícia

O Grok 4.1 Fast chega cobrando US$ 0,20 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída. Em cache, a tarifa despenca para US$ 0,05. É o tipo de tabela que faz você refazer a planilha.

Coloque do lado do Claude Haiku 4.5, que hoje é o segundo colocado em inteligência e cobra US$ 1 por milhão de entrada e US$ 5 por milhão de saída. O Grok é cinco vezes mais barato na saída. Em cache, a diferença é ainda maior: US$ 0,05 contra US$ 0,10 do Haiku. Para quem roda agente que devolve muito texto — suporte automatizado, pesquisa profunda, varredura de logs — essa é a conta que decide o fornecedor.

Ficha técnica — Grok 4.1 Fast
CampoValor
Identificadorx-ai/grok-4.1-fast
Criadorx-ai
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 0.500 / M tokens
Janela de contexto2M
Modalidadetext+image+file->text
Leitura de cacheUS$ 0.050 / M (75% de desconto)

O que a xAI está vendendo (e o que não está)

A descrição oficial posiciona o modelo como o melhor da xAI para tool calling agentic, citando explicitamente suporte ao cliente e pesquisa profunda como casos de uso. O detalhe que merece atenção: o reasoning pode ser ativado ou desativado por chamada. Isso é importante porque significa que você paga o token de raciocínio só quando quer — e modelos rivais obrigam você a engolir o custo do pensamento encadeado em toda requisição.

A janela de contexto é de 2 milhões de tokens. É o mesmo território do Haiku 4.5 e maior do que a maioria dos modelos abertos do ranking atual. Para quem alimenta agente com codebase inteira ou transcrição de call center, esse é o limite que importa.

O que os dados não dizem

Aqui vai o porém. O Grok 4.1 Fast não tem nota de inteligência publicada no catálogo, não tem benchmark de codificação, não tem score agentic, não tem blended price. O catálogo também não informa país de origem, velocidade, nem corte de conhecimento. Você está comprando um modelo sem saber como ele se compara numericamente com o o3 (IQ 31,096) ou com o próprio Haiku 4.5 (IQ 29,892).

Isso não é defeito automático — o OpenRouter não mediu, mas a xAI certamente publicou benchmarks próprios. O ponto é: para o seu comparativo de compra, a régua oficial ainda não existe. Quem precisa decidir hoje vai ter de testar com o próprio caso de uso.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 277 modelos disponíveis no catálogo nesta data.

Para quem vale — e para quem não muda nada

Vale para você se: roda agente de tool calling em produção, paga a conta em dólar e precisa de contexto longo. O preço de cache a US$ 0,05 é praticamente commodity, e a opção de desligar o reasoning transforma o modelo num dual-use: barato como um 8B quando você só quer classificar, esperto como um frontier quando você liga o pensamento.

Não muda nada se: você já está casado com o Claude Haiku 4.5 e mediu qualidade de resposta no seu caso específico — a diferença de cinco vezes no preço só compensa se o Grok entregar taxa de sucesso parecida, e isso ninguém te garante sem teste. Também não muda nada para workloads que dependem de multimodalidade nativa de áudio ou vídeo, porque a modalidade declarada é texto + imagem + arquivo → texto, sem fala.

Também passa batido se você está no tier gratuito: o Grok 4.1 Fast não tem flag free. É API paga desde o primeiro token.

O tabuleiro em 19 de novembro

O catálogo tem mais de 277 modelos listados hoje, vindos de 42 criadores. Nos últimos 30 dias, foram 16 lançamentos — o ritmo não está desacelerando. O topo de inteligência segue dominado por OpenAI (o3 em 31,096) e Anthropic (Haiku 4.5 em 29,892), com a OpenAI preenchendo o resto do pódio com os modelos gpt-oss abertos. A xAI não aparece nessa régua.

A jogada da xAI, portanto, não é ganhar o ranking de inteligência — é ganhar o ranking de preço por token útil em workload agentic. É uma briga diferente, e o Grok 4.1 Fast chega posicionado para ela.

O que você faz com isso amanhã

Se você tem agente em produção hoje, roda um piloto de 48 horas com o Grok 4.1 Fast no mesmo prompt que usa no Haiku 4.5. Meça taxa de sucesso de tool call, tokens de saída por tarefa e latência. Se a qualidade ficar dentro de 10% do Haiku, a economia anual vai pagar um engenheiro júnior. Se ficar abaixo, você volta para o Haiku e segue a vida — mas agora sabendo que existe uma opção cinco vezes mais barata esperando para ser reavaliada quando a xAI publicar os números.

Em uma frase

Teste o Grok 4.1 Fast em workload agentic com reasoning desligado por padrão; se a taxa de sucesso de tool call ficar próxima do Haiku 4.5, a economia de cinco vezes no token de saída muda a conta da API no fim do mês.

Perguntas frequentes

Quanto custa o Grok 4.1 Fast na API?

Cobra US$ 0,20 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de saída e US$ 0,05 por milhão de tokens em cache. É cinco vezes mais barato na saída do que o Claude Haiku 4.5.

O Grok 4.1 Fast tem nota de inteligência no catálogo?

Não. O índice de inteligência, o benchmark de codificação e o score agentic não foram publicados no catálogo nesta data. Você só consegue comparar via teste próprio no seu caso de uso.

Para que serve o Grok 4.1 Fast?

A xAI posiciona o modelo para tool calling agentic, citando suporte ao cliente e pesquisa profunda como casos de uso. O reasoning pode ser ativado ou desativado por chamada, o que permite usar o modelo barato sem custo de pensamento encadeado.

Leia também