FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Grok 4.20 Multi-Agent cobra US$ 2,50 por milhão, mas não tem IQ publicado

Lançado há 12 dias pela SpaceXAI, o modelo chega como peça de orquestração agentic com preço competitivo, mas sem nota de inteligência, coding ou agentic no catálogo atual.

Redação FalaVIP IA 3 min de leitura
US$ 2,50por milhão de tokens de saída
US$ 0,20por milhão de tokens em cache
2 milhõesde tokens de contexto

O preço que chama atenção, o buraco onde deveria estar o benchmark

Doze dias após o lançamento, o Grok 4.20 Multi-Agent cobra US$ 2,50 por milhão de tokens de saída. É pouco para um modelo desenhado para orquestração agentic, onde cada turno dispara várias chamadas em paralelo. Coloque lado a lado com os dois únicos modelos acima de IQ 45 hoje no catálogo — Gemini 3.1 Pro Preview a US$ 12 e GPT-5.3-Codex a US$ 14 — e o Grok parece pechincha.

Só que falta a peça principal. A nota de inteligência dele é nula. O catálogo atual não publicou IQ, coding, agentic nem blended para esse modelo. Você não consegue colocar o Grok 4.20 Multi-Agent no mesmo gráfico que o topo do mercado. Só consegue comparar o preço.

Ficha técnica — Grok 4.20 Multi-Agent
CampoValor
Identificadorx-ai/grok-4.20-multi-agent
Criadorx-ai
Preço de entradaUS$ 1.25 / M tokens
Preço de saídaUS$ 2.50 / M tokens
Janela de contexto2M
Modalidadetext+image+file->text
Leitura de cacheUS$ 0.200 / M (84% de desconto)

Multi-agente é bonito no release, caro no detalhe

A descrição oficial diz: múltiplos agentes operando em paralelo para pesquisa profunda, coordenação de ferramentas e síntese. É a mesma arquitetura que variantes "pro" de outras casas vêm oferecendo. O detalhe que o release não destaca é que cada conversa pode virar cinco, dez, vinte chamadas internas — todas cobrando pelo tarifário cheio quando o cache não é atingido.

Aí entra o número que mais importa para esse modelo: US$ 0,20 por milhão de tokens em cache, contra US$ 1,25 de input. Em fluxos multi-agente, todo agente relê o contexto compartilhado dezenas de vezes. Quando você acerta o cache, o custo real por turno despenca. Quando você erra — e em orquestração dinâmica é fácil errar — o custo real explode além do que o preço de tabela sugere.

Para quem faz sentido, e para quem não

Esse modelo serve para times que já estão montando pipelines agentic e precisam de uma peça barata para usar como "trabalhador" dentro de uma orquestração maior. O contexto de 2 milhões de tokens ajuda em pesquisas longas, síntese de documentos grandes e coordenação de múltiplos agentes sobre o mesmo material. A modalidade aceita texto, imagem e arquivo como entrada, devolvendo só texto — combina com workflows que já pré-processam multimodal em outro lugar.

Não vale para quem quer um modelo único de chat, código ou Q&A. Para isso existem alternativas com IQ medido e tarifa parecida: Xiaomi MiMo-V2-Omni (IQ 35,8 por US$ 2) e Qwen 3.5 397B A17B (IQ 34,2 por US$ 2,34). São single-shot, sem a camada multi-agente, mas entregam nota de qualidade comparável por preço parecido.

Também não vale se você precisa comparar antes de comprar. Sem benchmark publicado, a única forma de saber se ele presta é rodar na sua carga. E o catálogo de hoje tem 390 modelos, 54 criadores, 28 lançamentos nos últimos 30 dias — não é como se faltasse candidato para um A/B interno.

Onde ele senta no tabuleiro de abril

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
MiMo-V2-Omni35.92
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
Entre os 390 modelos disponíveis no catálogo nesta data.

O topo em 12 de abril segue concentrado em duas casas, Google e OpenAI, ambas acima de IQ 45 e ambas com preço de saída a partir de US$ 12 por milhão. A faixa intermediária, IQ entre 34 e 36, reúne Xiaomi, Anthropic e Qwen com tarifas entre US$ 2 e US$ 15. O Grok 4.20 Multi-Agent senta numa cadeira sem etiqueta: preço de intermediário, sem nota, posicionamento de agente.

Para um CTO, isso vira três decisões práticas. A primeira: trate como peça de orquestração, não como modelo principal, e meça na sua própria carga antes de comprometer volume. A segunda: se multi-agência for o caso, o número de verdade é o de cache, não o de output — calcule com a taxa de acerto real do seu pipeline. A terceira: se inteligência medida for requisito, volte para Gemini 3.1 Pro Preview ou GPT-5.3-Codex. Custam mais, mas aparecem no gráfico de comparação — e o gráfico, aqui, vale o preço extra.

Em uma frase

Trate o Grok 4.20 Multi-Agent como peça barata de orquestração agentic: só vale se você já mediu na sua carga e mantém taxa alta de acerto de cache — sem nota de IQ no catálogo, o preço de tabela sozinho não fecha a conta.

Perguntas frequentes

Quanto custa o Grok 4.20 Multi-Agent na API?

Cobra US$ 2,50 por milhão de tokens de saída e US$ 1,25 por milhão de tokens de entrada. O preço de cache é US$ 0,20 por milhão, cerca de seis vezes mais barato que o input, o que pesa em fluxos multi-agente que relêem o mesmo contexto várias vezes.

O Grok 4.20 Multi-Agent tem benchmark de inteligência publicado?

Não. O catálogo atual registra IQ, coding, agentic e blended como nulos para esse modelo. Sem nota publicada, não dá para colocá-lo no mesmo gráfico que Gemini 3.1 Pro Preview ou GPT-5.3-Codex.

Para que serve um modelo multi-agente como esse?

Serve para times que já constroem pipelines agentic — pesquisa profunda, coordenação de ferramentas e síntese feita por vários agentes em paralelo. O contexto de 2 milhões de tokens e a entrada multimodal (texto, imagem, arquivo) ajudam em workflows que processam material grande. Não substitui um modelo principal de chat ou Q&A simples.

Leia também