Grok 4.20 Multi-Agent cobra US$ 2,50 por milhão, mas não tem IQ publicado
Lançado há 12 dias pela SpaceXAI, o modelo chega como peça de orquestração agentic com preço competitivo, mas sem nota de inteligência, coding ou agentic no catálogo atual.
O preço que chama atenção, o buraco onde deveria estar o benchmark
Doze dias após o lançamento, o Grok 4.20 Multi-Agent cobra US$ 2,50 por milhão de tokens de saída. É pouco para um modelo desenhado para orquestração agentic, onde cada turno dispara várias chamadas em paralelo. Coloque lado a lado com os dois únicos modelos acima de IQ 45 hoje no catálogo — Gemini 3.1 Pro Preview a US$ 12 e GPT-5.3-Codex a US$ 14 — e o Grok parece pechincha.
Só que falta a peça principal. A nota de inteligência dele é nula. O catálogo atual não publicou IQ, coding, agentic nem blended para esse modelo. Você não consegue colocar o Grok 4.20 Multi-Agent no mesmo gráfico que o topo do mercado. Só consegue comparar o preço.
| Campo | Valor |
|---|---|
| Identificador | x-ai/grok-4.20-multi-agent |
| Criador | x-ai |
| Preço de entrada | US$ 1.25 / M tokens |
| Preço de saída | US$ 2.50 / M tokens |
| Janela de contexto | 2M |
| Modalidade | text+image+file->text |
| Leitura de cache | US$ 0.200 / M (84% de desconto) |
Multi-agente é bonito no release, caro no detalhe
A descrição oficial diz: múltiplos agentes operando em paralelo para pesquisa profunda, coordenação de ferramentas e síntese. É a mesma arquitetura que variantes "pro" de outras casas vêm oferecendo. O detalhe que o release não destaca é que cada conversa pode virar cinco, dez, vinte chamadas internas — todas cobrando pelo tarifário cheio quando o cache não é atingido.
Aí entra o número que mais importa para esse modelo: US$ 0,20 por milhão de tokens em cache, contra US$ 1,25 de input. Em fluxos multi-agente, todo agente relê o contexto compartilhado dezenas de vezes. Quando você acerta o cache, o custo real por turno despenca. Quando você erra — e em orquestração dinâmica é fácil errar — o custo real explode além do que o preço de tabela sugere.
Para quem faz sentido, e para quem não
Esse modelo serve para times que já estão montando pipelines agentic e precisam de uma peça barata para usar como "trabalhador" dentro de uma orquestração maior. O contexto de 2 milhões de tokens ajuda em pesquisas longas, síntese de documentos grandes e coordenação de múltiplos agentes sobre o mesmo material. A modalidade aceita texto, imagem e arquivo como entrada, devolvendo só texto — combina com workflows que já pré-processam multimodal em outro lugar.
Não vale para quem quer um modelo único de chat, código ou Q&A. Para isso existem alternativas com IQ medido e tarifa parecida: Xiaomi MiMo-V2-Omni (IQ 35,8 por US$ 2) e Qwen 3.5 397B A17B (IQ 34,2 por US$ 2,34). São single-shot, sem a camada multi-agente, mas entregam nota de qualidade comparável por preço parecido.
Também não vale se você precisa comparar antes de comprar. Sem benchmark publicado, a única forma de saber se ele presta é rodar na sua carga. E o catálogo de hoje tem 390 modelos, 54 criadores, 28 lançamentos nos últimos 30 dias — não é como se faltasse candidato para um A/B interno.
Onde ele senta no tabuleiro de abril
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| MiMo-V2-Omni | 35.9 | 2 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
O topo em 12 de abril segue concentrado em duas casas, Google e OpenAI, ambas acima de IQ 45 e ambas com preço de saída a partir de US$ 12 por milhão. A faixa intermediária, IQ entre 34 e 36, reúne Xiaomi, Anthropic e Qwen com tarifas entre US$ 2 e US$ 15. O Grok 4.20 Multi-Agent senta numa cadeira sem etiqueta: preço de intermediário, sem nota, posicionamento de agente.
Para um CTO, isso vira três decisões práticas. A primeira: trate como peça de orquestração, não como modelo principal, e meça na sua própria carga antes de comprometer volume. A segunda: se multi-agência for o caso, o número de verdade é o de cache, não o de output — calcule com a taxa de acerto real do seu pipeline. A terceira: se inteligência medida for requisito, volte para Gemini 3.1 Pro Preview ou GPT-5.3-Codex. Custam mais, mas aparecem no gráfico de comparação — e o gráfico, aqui, vale o preço extra.
Trate o Grok 4.20 Multi-Agent como peça barata de orquestração agentic: só vale se você já mediu na sua carga e mantém taxa alta de acerto de cache — sem nota de IQ no catálogo, o preço de tabela sozinho não fecha a conta.
Perguntas frequentes
Quanto custa o Grok 4.20 Multi-Agent na API?
Cobra US$ 2,50 por milhão de tokens de saída e US$ 1,25 por milhão de tokens de entrada. O preço de cache é US$ 0,20 por milhão, cerca de seis vezes mais barato que o input, o que pesa em fluxos multi-agente que relêem o mesmo contexto várias vezes.
O Grok 4.20 Multi-Agent tem benchmark de inteligência publicado?
Não. O catálogo atual registra IQ, coding, agentic e blended como nulos para esse modelo. Sem nota publicada, não dá para colocá-lo no mesmo gráfico que Gemini 3.1 Pro Preview ou GPT-5.3-Codex.
Para que serve um modelo multi-agente como esse?
Serve para times que já constroem pipelines agentic — pesquisa profunda, coordenação de ferramentas e síntese feita por vários agentes em paralelo. O contexto de 2 milhões de tokens e a entrada multimodal (texto, imagem, arquivo) ajudam em workflows que processam material grande. Não substitui um modelo principal de chat ou Q&A simples.