FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Grok Code Fast 1 custa US$ 1,50 por milhão na saída e US$ 0,02 no cache

A xAI vendeu o modelo como “rápido e econômico” para coding agêntico, mas a economia de verdade está num número que o release não destaca primeiro: o cache.

Redação FalaVIP IA 3 min de leitura
US$ 1,50por milhão de tokens de saída
US$ 0,02por milhão de tokens em cache
256 miltokens de contexto

Grok Code Fast 1 chegou há 12 dias com uma proposta que precisa ser lida com lupa. A xAI está vendendo o modelo como “rápido e econômico” para coding agêntico, mas os números não contam a história toda na superfície. Entrada a US$ 0,20 por milhão de tokens e saída a US$ 1,50 por milhão. Comparado ao o3 da OpenAI, que cobra US$ 8 por milhão na saída, parece barato. Comparado aos modelos da linha gpt-oss da própria OpenAI — gpt-oss-120b a US$ 0,17 e gpt-oss-20b a US$ 0,13 — ele é caro.

Então onde está a economia prometida? No cache.

Ficha técnica — Grok Code Fast 1
CampoValor
Identificadorx-ai/grok-code-fast-1
Criadorx-ai
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 1.50 / M tokens
Janela de contexto256k
Modalidadetext->text
Leitura de cacheUS$ 0.020 / M (90% de desconto)

O detalhe que ninguém destaca primeiro

O preço de cache é US$ 0,02 por milhão de tokens. Isso é um décimo do preço de entrada. Em um workflow agêntico — onde o agente relê o mesmo contexto dezenas de vezes enquanto chama ferramentas, faz loops e refatora — essa diferença vira economia real no fim do mês. Para quem paga a fatura, é o número que importa.

A descrição oficial diz que o modelo foi feito para “agentic coding” e mostra os traces de raciocínio na resposta. Isso é uma escolha de produto: o desenvolvedor vê o que o modelo está pensando, pode corrigir o curso no meio do caminho. Faz sentido em fluxos longos, não em perguntas curtas.

Onde ele se encaixa no tabuleiro

O catálogo de hoje tem 222 modelos espalhados por 38 criadores. Os cinco mais inteligentes nesta medição atual são todos da OpenAI e da Meta: o3 lidera com IQ 31,1, seguido pelos gpt-oss-120b (24,1) e gpt-oss-20b (15,2), depois Llama 4 Maverick (14,5) e Scout (10,3). Grok Code Fast 1 não aparece nessa lista — não há índice de inteligência publicado para ele.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 222 modelos disponíveis no catálogo nesta data.

Isso por si só já diz algo. O modelo não está sendo vendido como o mais capaz, e sim como o mais prático para uma tarefa específica. A escolha de não publicar um IQ geral reforça a mensagem: o caso de uso não é bate-papo nem raciocínio puro, é coding agêntico.

Comparado ao topo em preço de saída:

  • o3 (US$ 8/M): referência em raciocínio, custa mais de 5x o preço do Grok Code.
  • gpt-oss-120b (US$ 0,17/M): quase 9x mais barato na saída e melhor posicionado no índice atual, mas generalista.
  • Llama 4 Maverick (US$ 0,696/M): custa menos da metade do preço e tem capacidade geral maior.

Grok Code Fast 1 entra numa faixa em que cobra mais do que a maioria dos generalistas, mas entrega uma coisa que nenhum deles promete com a mesma clareza: traces de raciocínio expostos na resposta e preço de cache agressivo. É economia vertical para um caso de uso vertical.

Para quem vale a pena

Se você roda um agente de coding que faz dezenas de chamadas com o mesmo prompt de sistema, mesma base de código, mesmo histórico — o cache de US$ 0,02 muda a conta. É aqui que o modelo vence.

Se você está chamando a API uma vez para gerar uma função ou fazer um debug pontual, o cache não ajuda muito. Pagar US$ 1,50 por milhão de saída por um modelo cujo índice de inteligência nem foi medido publicamente começa a parecer troca ruim.

Para quem não muda nada

Se você já está usando o3 para raciocínio pesado ou um modelo da Meta para tarefas baratas, Grok Code Fast 1 não desloca nada. O índice de inteligência atual coloca os modelos da OpenAI e da Meta à frente em capacidade bruta — e por menos.

Se seu workflow não é agêntico — poucas chamadas, prompts curtos — o preço de cache não é diferencial. Você paga caro pela especialização que não vai usar.

O que fazer com isso

A pergunta para decidir não é “este modelo é bom?” — é quantas vezes por tarefa meu agente relê o mesmo contexto. Se a resposta for dezenas, vale testar com cache ligado e medir a fatura. Se for uma ou duas chamadas por sessão, fica onde está: o preço de saída de US$ 1,50 por milhão de tokens não se paga sozinho quando não há reuso de contexto.

Em uma frase

Se seu agente de coding relê o mesmo contexto dezenas de vezes por tarefa, Grok Code Fast 1 muda a conta pelo cache de US$ 0,02; em chamada pontual, a especialização não se paga.

Perguntas frequentes

O que é o Grok Code Fast 1?

É um modelo de raciocínio da xAI focado em coding agêntico, com traces de raciocínio visíveis na resposta. Foi lançado em 26 de agosto de 2025 e trabalha com contexto de 256 mil tokens.

Quanto custa usar o Grok Code Fast 1?

US$ 0,20 por milhão de tokens de entrada, US$ 1,50 por milhão na saída e US$ 0,02 por milhão em cache. O cache é um décimo do preço de entrada, o que favorece fluxos agênticos com muito reuso de contexto.

Grok Code Fast 1 é melhor que o o3?

Não há dados públicos comparando os dois diretamente. O o3 aparece como o modelo mais inteligente do catálogo atual, mas custa mais de cinco vezes por milhão de tokens na saída que o Grok Code Fast 1.

Leia também