FalaVIP IA quinta-feira, 03 de setembro de 2026
Mercado

Claude Sonnet 5 sobe e Grok 4.6 desce: o ranking de agentes que importa

Dez posições trocaram de dono em três arenas de uso real nesta segunda. Quem ganha e quem perde quando o que muda é a preferência de quem paga a API.

Redação FalaVIP IA 3 min de leitura
10posições que mudaram de dono nas arenas de agentes
3arenas afetadas: webapps, mobileapps e agenticgamedev
US$ 6,00por milhão de tokens de saída do Grok 4.6

O ranking de hoje não é benchmark — é recibo

Você acordou, abriu o painel de uso da sua API e percebeu que o modelo que estava em segundo lugar na arena de agentes para apps mobile agora está em terceiro. O que antes era o quinto virou sexto. E assim por diante, em três arenas diferentes, com dez posições trocando de dono de uma vez. Isso aconteceu hoje, 24 de agosto de 2026, e ninguém soltou release para comemorar.

A diferença entre ranking de benchmark e ranking de uso real é a mesma entre a nota do Enem e a escolha de cursinho: o primeiro mede capacidade, o segundo mede para onde o dinheiro está indo. Quando alguém muda de modelo numa arena de agentes, é porque decidiu — com base em latência, custo, taxa de erro ou simplesmente resultado de produção — que vale trocar. É o tipo de sinal que aparece na fatura antes de aparecer no Twitter.

Movimentações no ranking de uso
ArenaModeloPosição antesPosição depois
agents-webappsGrok 4.6
agents-mobileappsClaude Sonnet 4.6
agents-agenticgamedevClaude Sonnet 5
agents-webappsClaude Sonnet 5
agents-mobileappsClaude Fable 5
agents-agenticgamedevClaude Opus 4.8
agents-agenticgamedevGemini 3.7 Flash
agents-mobileappsGrok 4.5
agents-mobileappsQwen3.8 Max
agents-agenticgamedevClaude Opus 4.7
Ranking de uso real do OpenRouter por categoria de tarefa.

Quem ganhou posição

Os dois movimentos de maior salto são do Claude Sonnet 5, que subiu de 6º para 5º em webapps e de 5º para 8º em agenticgamedev — uma contramão curiosa, porque subiu numa arena e despencou em outra no mesmo dia. Em mobileapps, o Grok 4.5 deu o salto mais agressivo da lista: de 7º para 3º. É a maior subida em posições entre todas as dez trocas. O Qwen3.8 Max também subiu em mobileapps, de 3º para 4º — um avanço modesto, mas numa arena disputada.

Em agenticgamedev, o Gemini 3.7 Flash caiu de 2º para 4º, mas isso é queda, não subida. As subidas nessa arena foram mais tímidas: nenhum modelo saltou mais de uma posição para cima. O que houve ali foi reorganização de meio de tabela.

Quem perdeu posição

O lado perdedor tem mais nomes do que o lado vencedor. Grok 4.6 caiu de 5º para 6º em webapps — a versão mais nova da família perdeu fôlego exatamente na arena onde a versão anterior, Grok 4.5, está em disparada. Claude Fable 5 desceu de 5º para 7º em mobileapps, e Claude Opus 4.8 caiu de 3º para 5º em agenticgamedev. O Claude Opus 4.7 foi de 4º para 6º na mesma arena.

Juntando tudo: três modelos da Anthropic perderam posição, dois da Anthropic ganharam, um da xAI perdeu e outro da xAI ganhou, um do Google caiu e um da Alibaba subiu. É um dia típico de mercado fragmentado — ninguém varreu a mesa.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Opus 563.125
Claude Fable 562.150
GPT-5.6 Sol60.910
Grok 4.660.96
Kimi K359.715
Entre os 557 modelos disponíveis no catálogo nesta data.

O que isso diz sobre o tabuleiro

Para entender por que essas trocas importam, vale olhar quem está no topo do catálogo hoje. O Claude Opus 5 lidera o índice de inteligência medido hoje com IQ 63,053 e custa US$ 25 por milhão de tokens de saída. Logo atrás vem o Claude Fable 5 (IQ 62,073, US$ 50/M out) e o GPT-5.6 Sol da OpenAI (IQ 60,93, US$ 10/M out). O Grok 4.6 aparece em quarto no índice com IQ 60,923 e preço de US$ 6 por milhão de tokens de saída — quase quatro vezes mais barato que o Opus 5.

O detalhe que conta: o modelo que mais subiu em mobileapps, Grok 4.5, não aparece no topo do índice de inteligência. O que move ranking de uso real raramente é o modelo mais capaz — é o que entrega o suficiente pelo menor custo, ou o que tem a melhor latência para a tarefa específica. Em arena de agentes para celular, cada milissegundo e cada centavo por token viram multiplicador.

Para quem está escolhendo modelo hoje: se você roda agentes em webapps e está no Claude Sonnet 5, mantenha — ele subiu. Se está no Grok 4.6 em webapps, vale reavaliar: a versão anterior está em ascensão em outra arena, e a nova perdeu posição. Em mobileapps, a subida do Grok 4.5 sugere que vale testar antes de comprometer orçamento. Em agenticgamedev, o caos de meio de tabela indica que ninguém domina — é a arena onde experimentar ainda compensa.

Para quem não muda nada: se você usa Opus 5 ou GPT-5.6 Sol em tarefas de raciocínio puro, esses rankings de agentes não dizem respeito a você — são arenas de execução, não de cognição.

Em uma frase

Antes de migrar de modelo, confira em qual arena você está rodando: as dez trocas de hoje mostram que subir no ranking de inteligência não garante subir no ranking de uso, e que versões anteriores podem estar performando melhor que as novas na sua categoria específica.

Perguntas frequentes

O que é uma arena de agentes no ranking de uso real?

É uma categoria de tarefa onde se mede qual modelo as pessoas de fato escolhem para rodar agentes autônomos — webapps, mobileapps e agenticgamedev são as três que mexeram hoje. Diferente de benchmark, reflete decisão de quem paga a conta, não nota de capacidade.

Por que o Claude Sonnet 5 subiu em webapps mas caiu em agenticgamedev?

Porque as arenas medem usos diferentes: webapps envolve gerar interfaces web, agenticgamedev envolve criar jogos de forma agentica. O mesmo modelo pode ser a melhor escolha para um fluxo e não para outro, e o ranking mostra exatamente isso.

Vale trocar do Grok 4.6 para o Grok 4.5 em mobileapps?

Os dados de hoje mostram o Grok 4.5 subindo de 7º para 3º em mobileapps enquanto o Grok 4.6 caiu em webapps — sinal de que a versão anterior pode estar entregando melhor na sua arena específica. Vale testar com seu caso de uso antes de migrar definitivamente.

Leia também