Grok 4 Fast chega a US$ 0,50 por milhão de tokens de saída
xAI estreia modelo multimodal com janela de 2 milhões de tokens; preço de saída é 16 vezes menor que o do OpenAI o3.
Pagar US$ 8 por milhão de tokens de saída para conversar com um modelo de ponta era o padrão até outro dia. Hoje, 19 de setembro de 2025, a xAI coloca no catálogo o Grok 4 Fast cobrando US$ 0,50 pelo mesmo milhão. A diferença é grande o suficiente para mudar a conta no fim do mês.
O que a xAI entregou de fato
O Grok 4 Fast é multimodal — aceita texto, imagem e arquivo, devolve texto — e roda com janela de 2 milhões de tokens. Isso é o dobro do que a maioria dos concorrentes pratica hoje. O catálogo lista duas variantes: uma sem raciocínio e outra com raciocínio embutido, mas ambas com o mesmo preço de tabela.
| Campo | Valor |
|---|---|
| Identificador | x-ai/grok-4-fast |
| Criador | x-ai |
| Preço de entrada | US$ 0.200 / M tokens |
| Preço de saída | US$ 0.500 / M tokens |
| Janela de contexto | 2M |
| Modalidade | text+image+file->text |
| Leitura de cache | US$ 0.050 / M (75% de desconto) |
Os números que importam para o boleto:
- Entrada: US$ 0,20 por milhão de tokens
- Saída: US$ 0,50 por milhão de tokens
- Cache: US$ 0,05 por milhão de tokens (4 vezes mais barato que a entrada)
O corte de conhecimento declarado é 30 de setembro de 2025 — ou seja, o modelo foi treinado com dados até poucos dias antes do lançamento.
Como ele se posiciona no catálogo de hoje
O catálogo soma 230 modelos ativos de 39 criadores, e o índice de inteligência Artificial Analysis é a régua usada aqui. O topo continua sendo do OpenAI o3, com IQ 31,096 e preço de saída de US$ 8 por milhão de tokens. O Grok 4 Fast entrou sem nota de inteligência publicada — o catálogo não trouxe IQ, coding nem agentic benchmark junto com o lançamento.
Quando você compara só o preço de saída, a história é brutal. O Grok 4 Fast a US$ 0,50 é 16 vezes mais barato que o o3, mais barato que o Qwen3 Next 80B A3B Thinking (US$ 1,20) e mais barato que o gpt-oss-120b da própria OpenAI (US$ 0,17 de saída, mas é um modelo aberto com IQ 24,126). É a faixa de preço dos modelos pequenos, com a promessa de ser um modelo grande.
O problema é que "barato" sem nota de inteligência é uma promessa, não um fato. O catálogo não publicou o IQ do Grok 4 Fast nesta data. Você está comprando a janela de 2M e o multimodal pelo preço de um modelo de entrada.
Para quem isso muda a conta
Se o seu uso é processar documentos longos, fazer OCR de PDFs ou manter conversas com histórico gigante, a janela de 2M tokens por si só já é um motivo para testar. Você para de ter que dividir arquivo em pedaços, o que economiza chamadas e, portanto, dólares.
Se o seu uso é raciocínio pesado — código complexo, planejamento multi-etapa, agentic — o o3 segue sendo o topo do catálogo hoje, e o Qwen3 Next Thinking (IQ 16,867 a US$ 1,20 de saída) é a alternativa chinesa com nota publicada. O Grok 4 Fast entra sem benchmark que sustente essa comparação.
Se você roda volume alto de chamadas curtas, o preço de cache a US$ 0,05 é o que mais pesa: cada prompt repetido custa 4 vezes menos que a entrada.
O tabuleiro em 19 de setembro
A xAI é a empresa de Elon Musk baseada nos Estados Unidos. O catálogo mostra 16 modelos lançados nos últimos 30 dias — o ritmo não para. O Grok 4 Fast não destrói o o3 em inteligência medida, mas redefine o piso de preço para um modelo multimodal com janela gigante. É a mesma jogada que a DeepSeek e a Qwen vêm fazendo no lado chinês: forçar a régua de baixo para cima.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
A pergunta que fica não é se o Grok 4 Fast é o melhor modelo do catálogo — não é, pelo que está medido hoje. A pergunta é se vale pagar 16 vezes menos por algo que pode entregar 70%, 80% ou 90% da capacidade do topo. Até a xAI publicar os números, essa resposta é um teste de produção, não uma planilha.
O que fazer com isso hoje
Roteamento é a palavra. Configure seu sistema para mandar tarefas pesadas e de baixa tolerância a erro para o o3, e mandar leitura de documentos longos, OCR e conversas com histórico para o Grok 4 Fast. O cache a US$ 0,05 transforma prompts de sistema repetidos em custo quase zero. E espere a próxima medição de inteligência Artificial Analysis para saber onde o Grok 4 Fast realmente senta nesse gráfico.
Roteie tarefas: o o3 continua no topo pelo que está medido, mas o Grok 4 Fast a US$ 0,50 de saída muda o cálculo para documentos longos, multimodal e prompts em cache.
Perguntas frequentes
Quanto custa o Grok 4 Fast?
US$ 0,20 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de saída e US$ 0,05 por milhão de tokens em cache. É pago, não tem tier gratuito.
O Grok 4 Fast é melhor que o OpenAI o3?
O catálogo não publicou IQ nem benchmark do Grok 4 Fast nesta data. O o3 segue no topo com IQ 31,096 e preço 16 vezes maior. A comparação de capacidade ainda não pode ser feita pelos números públicos.
Qual a vantagem da janela de 2 milhões de tokens?
Permite colar documentos longos, PDFs inteiros ou históricos de conversa sem dividir em pedaços. Isso reduz o número de chamadas e, em produção, reduz a fatura mesmo quando o preço por token é parecido.