Grok 4.6 salta de 20º para 1º em agentes Android e recolorá o tabuleiro
Salto de 19 posições num único dia mostra como o ranking de uso real pode mudar sem aviso — e por que benchmark não previa isso.
Um ranking diferente do que você acompanha
Você está de olho no índice agregado de inteligência — e tudo bem, ele tem utilidade. Mas existe outro placar que ninguém olha com a mesma frequência, e que mexe mais no seu bolso: o ranking de uso real por categoria. Lá, a pergunta é qual modelo as pessoas de fato chamam para resolver um problema específico. E esse placar pode virar do avesso num único dia, como aconteceu nesta sexta-feira.
Hoje, 21 de agosto de 2026, o Grok 4.6 saltou da 20ª para a 1ª posição em agents-androidnative. Dezenove posições em 24 horas. Quem olhasse ontem o ranking de IQ agregado e escolhesse modelo por ali não tinha como prever essa mudança — porque ela não é sobre capacidade bruta, é sobre preferência de uso naquela tarefa.
| Arena | Modelo | Posição antes | Posição depois |
|---|---|---|---|
| models-3d | Claude Opus 5 | 3º | 2º |
| agents-androidnative | Grok 4.6 | 20º | 1º |
| models-uicomponent | Grok 4.6 | 3º | 6º |
| agents-androidnative | Grok 4.5 | 2º | 4º |
| agents-androidnative | Gemini 3.7 Flash | 6º | 3º |
| agents-mobileapps | Claude Fable 5 | 5º | 4º |
| agents-webapps | Grok 4.6 | 5º | 6º |
| models-3d | Qwen3.8 Max | 2º | 3º |
| models-codecategories | Gemini 3.7 Flash | 4º | 5º |
| agents-mobileapps | Claude Sonnet 4.6 | 4º | 7º |
O que o salto do Grok 4.6 significa (e o que não significa)
Não significa que o Grok virou o modelo mais inteligente do mercado. O índice de hoje coloca Claude Opus 5 na frente (IQ 63,053), seguido por Claude Fable 5 (62,073) e OpenAI GPT-5.6 Sol (60,93) — o Grok 4.6 aparece logo atrás, com 60,923. A diferença entre os quatro cabe na margem de erro de qualquer benchmark. O salto no ranking de uso é outra coisa: é gente escolhendo-o especificamente para construir agentes que rodam em Android nativo.
A analogia é a do GPS e o mapa. O índice agregado te diz qual rota é mais curta no papel; o ranking de uso real te diz qual caminho o pessoal está pegando de fato no trânsito desta manhã. Os dois podem discordar sem nenhum dos dois estar mentindo.
Quem perdeu posição — e por que isso importa
A movimentação não aconteceu em silêncio. O Claude Opus 4.7, que estava em 4º em agents-androidnative, caiu para 7º. O Kimi K2.7 Code desceu de 5º para 7º em agents-htmlslides. Já em agents-webapps, o Kimi K3 perdeu a liderança e agora é vice — uma troca de cadeira que abre espaço para outro modelo assumir a ponta.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Opus 5 | 63.1 | 25 |
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Grok 4.6 | 60.9 | 6 |
| Kimi K3 | 59.7 | 15 |
Olhando o conjunto, dois padrões aparecem. Primeiro: a Anthropic tem modelos fortes em quase toda categoria de agentes, mas não trava a liderança em nenhuma — Opus 4.7 caiu em androidnative, caiu em htmlslides, caiu em mobileapps; Fable 5 subiu em mobileapps e em UI component, mas isso é movimento de meio de tabela. Segundo: a xAI acertou em cheio um nicho específico, e a OpenAI continua mais forte em raciocínio geral do que em agentes especializados — fato, não opinião, é o que o ranking diz.
Para quem isso muda alguma coisa
Se você está construindo agentes que rodam em Android nativo, o Grok 4.6 virou referência imediata da categoria. Vale testar mesmo que sua pilha atual seja Anthropic — o salto não acontece por acaso, e quando 19 modelos são deixados para trás em um dia, alguma coisa no output está agradando quem usa.
Se você está construindo apps web ou apresentações em HTML, a mensagem é diferente: Claude Opus 4.7 segue forte, mas perdeu terreno. Hora de olhar o que subiu no lugar — e rodar o mesmo prompt nos dois antes de decidir trocar de modelo padrão.
Se você está escolhendo provedor por preço, nada aqui muda diretamente. O catálogo hoje lista DeepSeek V4 Flash 0731 a US$ 0,18 por milhão de tokens de saída como opção mais barata acima de IQ 45 — mas esse é outro ranking, o de custo, e ele conversa pouco com o de uso. São dois mapas diferentes do mesmo território.
A implicação prática
Trate o ranking de IQ agregado como farol de longo prazo e o ranking de uso por categoria como farol de curto prazo. Quem decide modelo olhando só um dos dois está navegando com um olho fechado. Hoje, para Android nativo, o olho curto diz Grok 4.6; para webapps e UI component, diz Claude Fable 5; para game dev em Godot, diz Claude Opus 4.7. Amanhã, qualquer um desses pode virar de novo — e foi exatamente isso que aconteceu em 21 de agosto.
Antes de trocar de modelo padrão, confira o ranking de uso da sua categoria específica — ele mudou mais rápido que o índice de IQ e aponta o que o pessoal realmente está usando hoje.
Perguntas frequentes
O Grok 4.6 é o modelo mais inteligente agora?
Não. O índice de IQ agregado de hoje coloca o Claude Opus 5 na frente, com 63,053, e o Grok 4.6 logo atrás, com 60,923. O salto foi no ranking de uso real em agents-androidnative, que mede preferência, não capacidade.
Por que o ranking de uso muda tanto num dia?
Porque ele mede qual modelo as pessoas escolhem para cada tipo de tarefa, e essa escolha pode mudar rápido quando um modelo novo atende bem um nicho — como aconteceu com o Grok 4.6 em Android nativo.
Vale trocar meu modelo padrão pelo que lidera o ranking de uso?
Depende da sua categoria. Se você trabalha com Android nativo, vale testar o Grok 4.6; para webapps, Claude Fable 5 e Kimi K3 seguem competitivos. O ranking de uso é um sinal forte, mas não dispensa teste com seu próprio prompt.