Grok 4 Fast cobra US$ 0,50 por milhão de saída e entra sem nota de IQ
xAI promete custo SOTA e 2 milhões de tokens de contexto, mas o catálogo não publicou índice de inteligência, velocidade nem país de origem.
O número que o release faz você esquecer
Você viu o anúncio do Grok 4 Fast e a primeira coisa que entrou no olho foi a janela de contexto: 2 milhões de tokens. É o dobro do que a maioria dos modelos concorrentes entrega hoje. Mas a pergunta que importa para quem paga a conta da API não é "quanto contexto cabe" — é "quanto custa encher esse contexto".
A xAI publicou três números: US$ 0,20 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de saída e US$ 0,05 por milhão em cache. Traduzindo: se você jogar 1 milhão de tokens de input num único request, paga US$ 0,20 só para o modelo "ler". A conta de saída, a que costuma detonar o orçamento, ficou em US$ 0,50 — abaixo do US$ 0,696 do Llama 4 Maverick, mas acima dos US$ 0,17 do gpt-oss-120b, que é open weights.
| Campo | Valor |
|---|---|
| Identificador | x-ai/grok-4-fast |
| Criador | x-ai |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 0.500 / M tokens |
| Janela de contexto | 2M |
| Modalidade | text+image+file->text |
| Leitura de cache | US$ 0.050 / M (75% de desconto) |
O que o catálogo não está te contando
O Grok 4 Fast entrou no catálogo hoje com iq: null, coding: null, agentic: null, speed: null e country: null. Não é um bug: o catálogo simplesmente não publicou essas métricas para o modelo. Isso significa que, em 19 de setembro de 2025, você não consegue comparar o Grok 4 Fast com o3, com o gpt-oss-120b ou com o Qwen3 Next 80B A3B Thinking em uma régua única de inteligência.
Para efeito de situação: o topo do catálogo hoje é o OpenAI o3, com IQ 31,096 e saída a US$ 8 por milhão. O segundo é o gpt-oss-120b, com IQ 24,126 e saída a US$ 0,17. O Grok 4 Fast, sem nota, está no terreno dos "confia no release".
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para quem o Grok 4 Fast faz sentido
Vale a pena testar agora se você se encaixa em um desses três casos:
- Tarefas com prompt longo e saída curta. Análise de contrato, resumo de transcrição, extração de informação em PDFs grandes. Você paga caro na entrada (US$ 0,20) e barato na saída (US$ 0,50). É o cenário em que o cache de US$ 0,05 brilha: reusar o mesmo contexto em chamadas repetidas derruba o custo efetivo.
- Multimodal de baixo custo. O release lista
text+image+file->text. Se você já precisa mandar imagem e PDF junto, evita pagar um modelo mais caro só para "abrir" o arquivo. - Testes de raciocínio opcional. O release diz que vem em dois sabores, "non-reasoning" e "reasoning" — o que sugere que dá para escolher se quer pagar o tempo extra de inferência ou não. Quem decide isso na chamada da API tem uma alavanca de custo que poucos concorrentes expõem assim.
Quando NÃO trocar o que você já usa
Se o seu gargalo é qualidade de raciocínio em código ou agente, o catálogo não te dá régua para afirmar que o Grok 4 Fast bate o3 ou mesmo o gpt-oss-120b. Sem coding e agentic publicados, a comparação é cega. E se você roda volume alto de saída — geração de texto longo, agentes que escrevem muito — o US$ 0,50 por milhão perde para os US$ 0,17 do gpt-oss-120b, que é open weights e tem IQ 24,126 medido.
Outra limitação prática: knowledge cutoff em 30 de setembro de 2025 — o que é estranho para um modelo lançado em 19 de setembro, e provavelmente reflete a data de corte do dataset de treino, não a data em que o modelo "sabe" o que aconteceu. Não trate isso como promessa de atualização.
O tabuleiro em 19 de setembro
A xAI entra no catálogo no mesmo dia em que o top 5 de inteligência é dominado por OpenAI (o3, gpt-oss-120b, gpt-oss-20b) e Qwen, com Meta em quinto via Llama 4 Maverick. O Grok 4 Fast não disputa essa régua hoje — disputa a régua do "quanto contexto você consegue enfiar nesse request sem estourar a fatura". É um posicionamento de preço e janela, não de capacidade medida.
Se a xAI publicar IQ, coding e agentic nas próximas semanas, esse perfil muda. Até lá, é um modelo para experimentar em workload de contexto longo com saída contida, e para manter na lista de espera para o resto.
Teste o Grok 4 Fast quando o seu gargalo for contexto longo com saída curta e você puder se dar ao luxo de não ter régua de IQ publicada; para tudo que exige comparação de capacidade, espere a xAI publicar as métricas que faltam.
Perguntas frequentes
Quanto custa o Grok 4 Fast na API?
US$ 0,20 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de saída e US$ 0,05 por milhão em cache, segundo o catálogo em 19 de setembro de 2025.
O Grok 4 Fast tem índice de inteligência publicado?
Não. No catálogo, `iq`, `coding`, `agentic` e `speed` estão como `null` — o que significa que você não consegue ranquear o modelo contra o3, gpt-oss-120b ou Qwen3 Next em uma régua única hoje.
Para que tipo de tarefa o Grok 4 Fast vale a pena?
Workloads com prompt muito longo (até 2 milhões de tokens) e saída curta — análise de contrato, resumo de transcrição, extração em PDFs — onde o cache de US$ 0,05 por milhão reduz o custo efetivo em chamadas repetidas.