FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

Grok 4 Fast chega a US$ 0,50 por milhão de tokens de saída

xAI estreia modelo multimodal com janela de 2 milhões de tokens; preço de saída é 16 vezes menor que o do OpenAI o3.

Redação FalaVIP IA 3 min de leitura
US$ 0,50por milhão de tokens de saída
US$ 0,20por milhão de tokens de entrada
US$ 0,05por milhão de tokens em cache

Pagar US$ 8 por milhão de tokens de saída para conversar com um modelo de ponta era o padrão até outro dia. Hoje, 19 de setembro de 2025, a xAI coloca no catálogo o Grok 4 Fast cobrando US$ 0,50 pelo mesmo milhão. A diferença é grande o suficiente para mudar a conta no fim do mês.

O que a xAI entregou de fato

O Grok 4 Fast é multimodal — aceita texto, imagem e arquivo, devolve texto — e roda com janela de 2 milhões de tokens. Isso é o dobro do que a maioria dos concorrentes pratica hoje. O catálogo lista duas variantes: uma sem raciocínio e outra com raciocínio embutido, mas ambas com o mesmo preço de tabela.

Ficha técnica — Grok 4 Fast
CampoValor
Identificadorx-ai/grok-4-fast
Criadorx-ai
Preço de entradaUS$ 0.200 / M tokens
Preço de saídaUS$ 0.500 / M tokens
Janela de contexto2M
Modalidadetext+image+file->text
Leitura de cacheUS$ 0.050 / M (75% de desconto)

Os números que importam para o boleto:

  • Entrada: US$ 0,20 por milhão de tokens
  • Saída: US$ 0,50 por milhão de tokens
  • Cache: US$ 0,05 por milhão de tokens (4 vezes mais barato que a entrada)

O corte de conhecimento declarado é 30 de setembro de 2025 — ou seja, o modelo foi treinado com dados até poucos dias antes do lançamento.

Como ele se posiciona no catálogo de hoje

O catálogo soma 230 modelos ativos de 39 criadores, e o índice de inteligência Artificial Analysis é a régua usada aqui. O topo continua sendo do OpenAI o3, com IQ 31,096 e preço de saída de US$ 8 por milhão de tokens. O Grok 4 Fast entrou sem nota de inteligência publicada — o catálogo não trouxe IQ, coding nem agentic benchmark junto com o lançamento.

Preço de saída (US$ por milhão de tokens)
Grok 4 Fast0,5o38gpt-oss-120b0,17Qwen3 Next 80B A3B Thinking1,2US$/M
Fonte: OpenRouter

Quando você compara só o preço de saída, a história é brutal. O Grok 4 Fast a US$ 0,50 é 16 vezes mais barato que o o3, mais barato que o Qwen3 Next 80B A3B Thinking (US$ 1,20) e mais barato que o gpt-oss-120b da própria OpenAI (US$ 0,17 de saída, mas é um modelo aberto com IQ 24,126). É a faixa de preço dos modelos pequenos, com a promessa de ser um modelo grande.

Inteligência × preço de saída
o3gpt-oss-120bQwen3 Next 80B A3B ThinkingUS$ por milhão (saída, escala log)índice de inteligência

O problema é que "barato" sem nota de inteligência é uma promessa, não um fato. O catálogo não publicou o IQ do Grok 4 Fast nesta data. Você está comprando a janela de 2M e o multimodal pelo preço de um modelo de entrada.

Para quem isso muda a conta

Se o seu uso é processar documentos longos, fazer OCR de PDFs ou manter conversas com histórico gigante, a janela de 2M tokens por si só já é um motivo para testar. Você para de ter que dividir arquivo em pedaços, o que economiza chamadas e, portanto, dólares.

Se o seu uso é raciocínio pesado — código complexo, planejamento multi-etapa, agentic — o o3 segue sendo o topo do catálogo hoje, e o Qwen3 Next Thinking (IQ 16,867 a US$ 1,20 de saída) é a alternativa chinesa com nota publicada. O Grok 4 Fast entra sem benchmark que sustente essa comparação.

Se você roda volume alto de chamadas curtas, o preço de cache a US$ 0,05 é o que mais pesa: cada prompt repetido custa 4 vezes menos que a entrada.

O tabuleiro em 19 de setembro

A xAI é a empresa de Elon Musk baseada nos Estados Unidos. O catálogo mostra 16 modelos lançados nos últimos 30 dias — o ritmo não para. O Grok 4 Fast não destrói o o3 em inteligência medida, mas redefine o piso de preço para um modelo multimodal com janela gigante. É a mesma jogada que a DeepSeek e a Qwen vêm fazendo no lado chinês: forçar a régua de baixo para cima.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 230 modelos disponíveis no catálogo nesta data.

A pergunta que fica não é se o Grok 4 Fast é o melhor modelo do catálogo — não é, pelo que está medido hoje. A pergunta é se vale pagar 16 vezes menos por algo que pode entregar 70%, 80% ou 90% da capacidade do topo. Até a xAI publicar os números, essa resposta é um teste de produção, não uma planilha.

O que fazer com isso hoje

Roteamento é a palavra. Configure seu sistema para mandar tarefas pesadas e de baixa tolerância a erro para o o3, e mandar leitura de documentos longos, OCR e conversas com histórico para o Grok 4 Fast. O cache a US$ 0,05 transforma prompts de sistema repetidos em custo quase zero. E espere a próxima medição de inteligência Artificial Analysis para saber onde o Grok 4 Fast realmente senta nesse gráfico.

Em uma frase

Roteie tarefas: o o3 continua no topo pelo que está medido, mas o Grok 4 Fast a US$ 0,50 de saída muda o cálculo para documentos longos, multimodal e prompts em cache.

Perguntas frequentes

Quanto custa o Grok 4 Fast?

US$ 0,20 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de saída e US$ 0,05 por milhão de tokens em cache. É pago, não tem tier gratuito.

O Grok 4 Fast é melhor que o OpenAI o3?

O catálogo não publicou IQ nem benchmark do Grok 4 Fast nesta data. O o3 segue no topo com IQ 31,096 e preço 16 vezes maior. A comparação de capacidade ainda não pode ser feita pelos números públicos.

Qual a vantagem da janela de 2 milhões de tokens?

Permite colar documentos longos, PDFs inteiros ou históricos de conversa sem dividir em pedaços. Isso reduz o número de chamadas e, em produção, reduz a fatura mesmo quando o preço por token é parecido.

Leia também