Claude Sonnet 5 sobe e Grok 4.6 desce: o ranking de agentes que importa
Dez posições trocaram de dono em três arenas de uso real nesta segunda. Quem ganha e quem perde quando o que muda é a preferência de quem paga a API.
O ranking de hoje não é benchmark — é recibo
Você acordou, abriu o painel de uso da sua API e percebeu que o modelo que estava em segundo lugar na arena de agentes para apps mobile agora está em terceiro. O que antes era o quinto virou sexto. E assim por diante, em três arenas diferentes, com dez posições trocando de dono de uma vez. Isso aconteceu hoje, 24 de agosto de 2026, e ninguém soltou release para comemorar.
A diferença entre ranking de benchmark e ranking de uso real é a mesma entre a nota do Enem e a escolha de cursinho: o primeiro mede capacidade, o segundo mede para onde o dinheiro está indo. Quando alguém muda de modelo numa arena de agentes, é porque decidiu — com base em latência, custo, taxa de erro ou simplesmente resultado de produção — que vale trocar. É o tipo de sinal que aparece na fatura antes de aparecer no Twitter.
| Arena | Modelo | Posição antes | Posição depois |
|---|---|---|---|
| agents-webapps | Grok 4.6 | 5º | 6º |
| agents-mobileapps | Claude Sonnet 4.6 | 4º | 5º |
| agents-agenticgamedev | Claude Sonnet 5 | 5º | 8º |
| agents-webapps | Claude Sonnet 5 | 6º | 5º |
| agents-mobileapps | Claude Fable 5 | 5º | 7º |
| agents-agenticgamedev | Claude Opus 4.8 | 3º | 5º |
| agents-agenticgamedev | Gemini 3.7 Flash | 2º | 4º |
| agents-mobileapps | Grok 4.5 | 7º | 3º |
| agents-mobileapps | Qwen3.8 Max | 3º | 4º |
| agents-agenticgamedev | Claude Opus 4.7 | 4º | 6º |
Quem ganhou posição
Os dois movimentos de maior salto são do Claude Sonnet 5, que subiu de 6º para 5º em webapps e de 5º para 8º em agenticgamedev — uma contramão curiosa, porque subiu numa arena e despencou em outra no mesmo dia. Em mobileapps, o Grok 4.5 deu o salto mais agressivo da lista: de 7º para 3º. É a maior subida em posições entre todas as dez trocas. O Qwen3.8 Max também subiu em mobileapps, de 3º para 4º — um avanço modesto, mas numa arena disputada.
Em agenticgamedev, o Gemini 3.7 Flash caiu de 2º para 4º, mas isso é queda, não subida. As subidas nessa arena foram mais tímidas: nenhum modelo saltou mais de uma posição para cima. O que houve ali foi reorganização de meio de tabela.
Quem perdeu posição
O lado perdedor tem mais nomes do que o lado vencedor. Grok 4.6 caiu de 5º para 6º em webapps — a versão mais nova da família perdeu fôlego exatamente na arena onde a versão anterior, Grok 4.5, está em disparada. Claude Fable 5 desceu de 5º para 7º em mobileapps, e Claude Opus 4.8 caiu de 3º para 5º em agenticgamedev. O Claude Opus 4.7 foi de 4º para 6º na mesma arena.
Juntando tudo: três modelos da Anthropic perderam posição, dois da Anthropic ganharam, um da xAI perdeu e outro da xAI ganhou, um do Google caiu e um da Alibaba subiu. É um dia típico de mercado fragmentado — ninguém varreu a mesa.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Opus 5 | 63.1 | 25 |
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Grok 4.6 | 60.9 | 6 |
| Kimi K3 | 59.7 | 15 |
O que isso diz sobre o tabuleiro
Para entender por que essas trocas importam, vale olhar quem está no topo do catálogo hoje. O Claude Opus 5 lidera o índice de inteligência medido hoje com IQ 63,053 e custa US$ 25 por milhão de tokens de saída. Logo atrás vem o Claude Fable 5 (IQ 62,073, US$ 50/M out) e o GPT-5.6 Sol da OpenAI (IQ 60,93, US$ 10/M out). O Grok 4.6 aparece em quarto no índice com IQ 60,923 e preço de US$ 6 por milhão de tokens de saída — quase quatro vezes mais barato que o Opus 5.
O detalhe que conta: o modelo que mais subiu em mobileapps, Grok 4.5, não aparece no topo do índice de inteligência. O que move ranking de uso real raramente é o modelo mais capaz — é o que entrega o suficiente pelo menor custo, ou o que tem a melhor latência para a tarefa específica. Em arena de agentes para celular, cada milissegundo e cada centavo por token viram multiplicador.
Para quem está escolhendo modelo hoje: se você roda agentes em webapps e está no Claude Sonnet 5, mantenha — ele subiu. Se está no Grok 4.6 em webapps, vale reavaliar: a versão anterior está em ascensão em outra arena, e a nova perdeu posição. Em mobileapps, a subida do Grok 4.5 sugere que vale testar antes de comprometer orçamento. Em agenticgamedev, o caos de meio de tabela indica que ninguém domina — é a arena onde experimentar ainda compensa.
Para quem não muda nada: se você usa Opus 5 ou GPT-5.6 Sol em tarefas de raciocínio puro, esses rankings de agentes não dizem respeito a você — são arenas de execução, não de cognição.
Antes de migrar de modelo, confira em qual arena você está rodando: as dez trocas de hoje mostram que subir no ranking de inteligência não garante subir no ranking de uso, e que versões anteriores podem estar performando melhor que as novas na sua categoria específica.
Perguntas frequentes
O que é uma arena de agentes no ranking de uso real?
É uma categoria de tarefa onde se mede qual modelo as pessoas de fato escolhem para rodar agentes autônomos — webapps, mobileapps e agenticgamedev são as três que mexeram hoje. Diferente de benchmark, reflete decisão de quem paga a conta, não nota de capacidade.
Por que o Claude Sonnet 5 subiu em webapps mas caiu em agenticgamedev?
Porque as arenas medem usos diferentes: webapps envolve gerar interfaces web, agenticgamedev envolve criar jogos de forma agentica. O mesmo modelo pode ser a melhor escolha para um fluxo e não para outro, e o ranking mostra exatamente isso.
Vale trocar do Grok 4.6 para o Grok 4.5 em mobileapps?
Os dados de hoje mostram o Grok 4.5 subindo de 7º para 3º em mobileapps enquanto o Grok 4.6 caiu em webapps — sinal de que a versão anterior pode estar entregando melhor na sua arena específica. Vale testar com seu caso de uso antes de migrar definitivamente.