Grok 4.6 alcança IQ 60,9, mas não lidera o ranking
O modelo da xAI estreia por US$ 3 por milhão e empata com o GPT-5.6 Sol, enquanto três versões do Claude Opus 5 ficam acima. Para agentes autônomos, o benchmark ainda não responde tudo.
O Grok 4.6 (high) estreou com IQ de 60,9 e preço de US$ 3 por milhão. O número coloca o modelo da xAI no mesmo nível do GPT-5.6 Sol, mas não no topo: quatro configurações do Claude aparecem acima dele no ranking do Artificial Analysis, e uma quinta empata com o Grok.
A diferença pesa para quem escolhe modelo para produção. O Claude Opus 5 (Adaptive Reasoning, Max Effort) marca 63,1 e custa US$ 10 por milhão. O GPT-5.6 Sol chega a 60,9 por US$ 11,25. O Grok entrega o mesmo IQ do GPT por um preço associado à estreia bem menor, mas ainda fica atrás dos resultados máximos do Claude.
O que mudou — e o que não mudou
A mudança objetiva é a entrada do Grok 4.6 (high) no índice de benchmarks em 13 de agosto de 2026. O modelo passa a ter uma posição comparável à dos sistemas mais fortes avaliados pelo Artificial Analysis.
Isso não significa que a xAI tenha demonstrado, com os números disponíveis, vantagem em programação ou em tarefas agênticas. Não há notas de coding ou agentic para o Grok 4.6 nos dados publicados. Também não há janela de contexto nem divisão entre preço de entrada e preço de saída para essa configuração.
Esse detalhe é central para a fatura. Um IQ alto pode justificar testes em tarefas difíceis, mas não informa sozinho quanto custará uma execução longa com ferramentas, quantas chamadas serão necessárias ou como o modelo se comportará diante de falhas. Para um agente autônomo, essas variáveis podem importar tanto quanto a nota geral.
O preço parece competitivo, mas exige comparação correta
O valor de US$ 3 coloca o Grok 4.6 abaixo do Claude Opus 5, a US$ 10, e do GPT-5.6 Sol, a US$ 11,25, nas referências do Artificial Analysis. Também fica acima das opções que lideram a relação custo-benefício: o DeepSeek V4 Flash 0731 marca 51,8 por US$ 0,175 por milhão, enquanto o DeepSeek V4 Pro 0813 marca 53 por US$ 0,544.
A escolha, portanto, não é simplesmente entre o modelo mais inteligente e o mais barato. Se você usa a API em alto volume, a diferença entre US$ 0,175, US$ 0,544 e US$ 3 por milhão pode superar o ganho de qualidade em tarefas rotineiras. Se o fluxo depende de decisões complexas, o Grok entra como candidato para testes, não como substituto automático de toda a sua pilha.
O catálogo do OpenRouter reúne 547 modelos de 67 criadores. No mesmo dia, o Google lançou o Gemini 3.7 Flash por US$ 0,375 por milhão de tokens de entrada e US$ 1,875 de saída, com contexto de 1.048.576 tokens. A configuração batch custa US$ 0,188 na entrada e US$ 0,938 na saída. O cenário deixa claro que a disputa combina desempenho, preço e formato de uso.
A aposta nos agentes ainda está sem nota própria
O lançamento do Grok Bot para desktop e iOS foi destacado por Paula Bernardes em seu canal. A conexão com a disputa por força de trabalho sintética é direta: quanto mais tarefas um produto executa sem intervenção, mais importante fica a capacidade de planejar, usar ferramentas e recuperar-se de erros.
Mas a estreia do Grok 4.6 no benchmark não comprova essas capacidades. O índice mostra um resultado geral de inteligência e um preço associado. Não mostra, neste registro, uma nota agêntica para o modelo. Para quem pretende delegar operações inteiras, isso significa que o teste precisa reproduzir o fluxo real: chamadas de ferramenta, limites de tempo, aprovações humanas e custo total por tarefa.
Para quem o Grok 4.6 faz sentido
O modelo interessa a equipes que querem testar uma opção de alto desempenho sem pagar o preço listado para as configurações mais caras do Claude e do GPT. Também pode entrar em comparativos de tarefas que exigem raciocínio mais forte, desde que o custo final seja medido por execução completa.
Para quem precisa sobretudo de classificação, extração, respostas curtas ou processamento em massa, o Grok não aparece como escolha óbvia. Os modelos mais baratos do Artificial Analysis têm notas inferiores, mas podem reduzir drasticamente a despesa em rotinas simples. E, para agentes autônomos, a ausência de notas específicas de agentic e de dados completos de contexto impede uma decisão baseada apenas no IQ.
A consequência prática é simples: coloque o Grok 4.6 (high) em um teste A/B com tarefas reais, registre custo por tarefa e só depois decida se os 60,9 pontos compensam os US$ 3 por milhão.
Se você usa agentes em produção, trate o Grok 4.6 como candidato de teste: o IQ é alto e o preço é competitivo, mas faltam métricas agênticas e detalhes de cobrança para justificar uma migração.
Perguntas frequentes
Qual é o IQ do Grok 4.6?
O Grok 4.6 (high) estreou no Artificial Analysis com IQ de 60,9. Ele empata com o GPT-5.6 Sol e fica abaixo das principais configurações do Claude Opus 5.
Quanto custa o Grok 4.6 na API?
O preço associado à estreia do Grok 4.6 (high) é de US$ 3 por milhão. O registro disponível não separa esse valor entre tokens de entrada e de saída.
O Grok 4.6 é melhor para agentes autônomos?
Os dados disponíveis não trazem uma nota agentic para o Grok 4.6. Por isso, o modelo pode ser incluído em testes de agentes, mas o benchmark de IQ sozinho não comprova desempenho superior em fluxos com ferramentas.
Fontes
- O Grok Bot Aprende Seu Fluxo e Trabalha Sem Você Paula Bernardes · vídeo