Grok Code Fast 1 custa US$ 1,50 por milhão na saída e US$ 0,02 no cache
A xAI vendeu o modelo como “rápido e econômico” para coding agêntico, mas a economia de verdade está num número que o release não destaca primeiro: o cache.
Grok Code Fast 1 chegou há 12 dias com uma proposta que precisa ser lida com lupa. A xAI está vendendo o modelo como “rápido e econômico” para coding agêntico, mas os números não contam a história toda na superfície. Entrada a US$ 0,20 por milhão de tokens e saída a US$ 1,50 por milhão. Comparado ao o3 da OpenAI, que cobra US$ 8 por milhão na saída, parece barato. Comparado aos modelos da linha gpt-oss da própria OpenAI — gpt-oss-120b a US$ 0,17 e gpt-oss-20b a US$ 0,13 — ele é caro.
Então onde está a economia prometida? No cache.
| Campo | Valor |
|---|---|
| Identificador | x-ai/grok-code-fast-1 |
| Criador | x-ai |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 1.50 / M tokens |
| Janela de contexto | 256k |
| Modalidade | text->text |
| Leitura de cache | US$ 0.020 / M (90% de desconto) |
O detalhe que ninguém destaca primeiro
O preço de cache é US$ 0,02 por milhão de tokens. Isso é um décimo do preço de entrada. Em um workflow agêntico — onde o agente relê o mesmo contexto dezenas de vezes enquanto chama ferramentas, faz loops e refatora — essa diferença vira economia real no fim do mês. Para quem paga a fatura, é o número que importa.
A descrição oficial diz que o modelo foi feito para “agentic coding” e mostra os traces de raciocínio na resposta. Isso é uma escolha de produto: o desenvolvedor vê o que o modelo está pensando, pode corrigir o curso no meio do caminho. Faz sentido em fluxos longos, não em perguntas curtas.
Onde ele se encaixa no tabuleiro
O catálogo de hoje tem 222 modelos espalhados por 38 criadores. Os cinco mais inteligentes nesta medição atual são todos da OpenAI e da Meta: o3 lidera com IQ 31,1, seguido pelos gpt-oss-120b (24,1) e gpt-oss-20b (15,2), depois Llama 4 Maverick (14,5) e Scout (10,3). Grok Code Fast 1 não aparece nessa lista — não há índice de inteligência publicado para ele.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
Isso por si só já diz algo. O modelo não está sendo vendido como o mais capaz, e sim como o mais prático para uma tarefa específica. A escolha de não publicar um IQ geral reforça a mensagem: o caso de uso não é bate-papo nem raciocínio puro, é coding agêntico.
Comparado ao topo em preço de saída:
- o3 (US$ 8/M): referência em raciocínio, custa mais de 5x o preço do Grok Code.
- gpt-oss-120b (US$ 0,17/M): quase 9x mais barato na saída e melhor posicionado no índice atual, mas generalista.
- Llama 4 Maverick (US$ 0,696/M): custa menos da metade do preço e tem capacidade geral maior.
Grok Code Fast 1 entra numa faixa em que cobra mais do que a maioria dos generalistas, mas entrega uma coisa que nenhum deles promete com a mesma clareza: traces de raciocínio expostos na resposta e preço de cache agressivo. É economia vertical para um caso de uso vertical.
Para quem vale a pena
Se você roda um agente de coding que faz dezenas de chamadas com o mesmo prompt de sistema, mesma base de código, mesmo histórico — o cache de US$ 0,02 muda a conta. É aqui que o modelo vence.
Se você está chamando a API uma vez para gerar uma função ou fazer um debug pontual, o cache não ajuda muito. Pagar US$ 1,50 por milhão de saída por um modelo cujo índice de inteligência nem foi medido publicamente começa a parecer troca ruim.
Para quem não muda nada
Se você já está usando o3 para raciocínio pesado ou um modelo da Meta para tarefas baratas, Grok Code Fast 1 não desloca nada. O índice de inteligência atual coloca os modelos da OpenAI e da Meta à frente em capacidade bruta — e por menos.
Se seu workflow não é agêntico — poucas chamadas, prompts curtos — o preço de cache não é diferencial. Você paga caro pela especialização que não vai usar.
O que fazer com isso
A pergunta para decidir não é “este modelo é bom?” — é quantas vezes por tarefa meu agente relê o mesmo contexto. Se a resposta for dezenas, vale testar com cache ligado e medir a fatura. Se for uma ou duas chamadas por sessão, fica onde está: o preço de saída de US$ 1,50 por milhão de tokens não se paga sozinho quando não há reuso de contexto.
Se seu agente de coding relê o mesmo contexto dezenas de vezes por tarefa, Grok Code Fast 1 muda a conta pelo cache de US$ 0,02; em chamada pontual, a especialização não se paga.
Perguntas frequentes
O que é o Grok Code Fast 1?
É um modelo de raciocínio da xAI focado em coding agêntico, com traces de raciocínio visíveis na resposta. Foi lançado em 26 de agosto de 2025 e trabalha com contexto de 256 mil tokens.
Quanto custa usar o Grok Code Fast 1?
US$ 0,20 por milhão de tokens de entrada, US$ 1,50 por milhão na saída e US$ 0,02 por milhão em cache. O cache é um décimo do preço de entrada, o que favorece fluxos agênticos com muito reuso de contexto.
Grok Code Fast 1 é melhor que o o3?
Não há dados públicos comparando os dois diretamente. O o3 aparece como o modelo mais inteligente do catálogo atual, mas custa mais de cinco vezes por milhão de tokens na saída que o Grok Code Fast 1.