Claude Opus 5 toma o topo de dataviz enquanto Anthropic perde em agentes
Movimentações de 15 de agosto mostram a família Claude em lados opostos do ranking de uso real: vence onde o output é visual, recua onde o trabalho é código.
O novo líder da dataviz
Claude Opus 5 entrou para o topo do ranking de dataviz nesta segunda-feira. Saiu da segunda posição e tomou o lugar de quem estava em primeiro — uma troca seca, sem disputa declarada, registrada no painel de uso real. E uso real é diferente de benchmark: significa que, ao longo das últimas horas, mais gente efetivamente pediu um gráfico, um dashboard ou uma visualização para o Opus 5 do que para qualquer outro modelo da categoria.
O preço explica por que essa escolha tem peso. Opus 5 cobra US$ 25 por milhão de tokens de saída. Quem está fazendo dataviz séria — gráficos interativos, SVGs complexos, painéis com múltiplas séries — queima tokens de saída a cada iteração. A conta sobe.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Opus 5 | 63.1 | 25 |
| Claude Fable 5 | 62.1 | 50 |
| GPT-5.6 Sol | 60.9 | 10 |
| Grok 4.6 | 60.9 | 6 |
| Kimi K3 | 59.7 | 15 |
Para comparar: o DeepSeek V4 Flash 0731, que aparece na faixa dos modelos acima de IQ 45 mais baratos do catálogo, sai por US$ 0,18 por milhão de tokens de saída. Mesma tarefa potencial, diferença de duas ordens de grandeza no orçamento. Mas o painel de uso diz que, no recorte de dataviz, a turma que está pagando é a turma que está escolhendo Opus 5.
E no fullstack, Anthropic sangra
A contradição aparece quando você olha para o outro lado da casa. Na arena agents-fullstack — categoria que mede agentes escrevendo aplicação completa, do backend ao frontend — a Anthropic perdeu duas posições em um único dia. Claude Fable 5 caiu de #2 para #4, e Claude Opus 4.8 despencou de #5 para #7.
| Arena | Modelo | Posição antes | Posição depois |
|---|---|---|---|
| models-uicomponent | Grok 4.6 | 2º | 3º |
| models-asciiart | Grok 4.5 | 6º | 5º |
| models-website | Muse Spark 1.2 | 2º | 3º |
| agents-fullstack | Claude Opus 4.8 | 5º | 7º |
| models-svg | Claude Fable 5 | 3º | 2º |
| models-uicomponent | Claude Opus 5 | 3º | 2º |
| agents-fullstack | Grok 4.5 | 4º | 6º |
| agents-fullstack | Grok 4.6 | 3º | 5º |
| models-codecategories | GLM 5.2 | 6º | 5º |
| models-codecategories | Grok 4.6 | 5º | 6º |
A leitura técnica: Opus 5 e Fable 5 são os dois modelos de topo no ranking de inteligência hoje (IQ 63,053 e 62,073 respectivamente). Mas agentes que precisam entregar código de produção em múltiplos arquivos estão migrando para outros fornecedores. Não dá para cravar quem tomou os lugares — o painel não mostra — mas a fuga é mensurável: dois modelos Anthropic somando três posições perdidas no mesmo painel no mesmo dia.
Grok em três frentes, com resultados diferentes
A SpaceXAI também teve um dia agitado. Grok 4.5 subiu para a segunda posição em agents-godotgamedev — desenvolvimento de jogos com a engine Godot. Ponto para o ecossistema.
Mas Grok 4.6 foi na contramão em três arenas distintas: caiu de #2 para #3 em agents-mobileapps e em models-uicomponent, e de #5 para #7 em models-3d. É um padrão: quando a tarefa pede acabamento visual — interface, modelo 3D, app mobile — o Grok 4.6 está cedendo espaço. Quando o trabalho é lógica de jogo, segura.
GLM 5.2 sobe sem fazer barulho
A movimentação mais quieta do dia é do GLM 5.2. O modelo subiu de #6 para #5 em duas arenas diferentes: models-3d e models-codecategories. Não é uma escalada explosiva, mas o fato de aparecer em dois painéis distintos no mesmo dia sugere consistência, não acaso. Em geração de código por categoria e em modelagem 3D, o GLM 5.2 está conquistando terreno centímetro por centímetro.
O Kimi K3 também mexeu — caiu de #2 para #3 em models-svg. Pequeno recuo, mas numa categoria onde a Anthropic acabou de chegar ao topo. Coincidência ou pressão direta? O painel não explica, só mede.
O que isso muda no seu próximo deploy
Três implicações práticas saem deste mapa de hoje.
Se você está rodando Claude Opus 4.8 ou Fable 5 em pipelines que entregam aplicação fullstack, vale testar concorrentes nas mesmas tarefas. O painel mostra que parte do mercado já fez isso — esperar para reagir é perder benchmark de produção.
Para dataviz com budget apertado, o Opus 5 virou referência de uso, não só de capacidade bruta. Mas o DeepSeek V4 Flash 0731 a US$ 0,18/M continua sendo a opção mais barata na faixa de IQ acima de 45 — a conta, e não o painel, vai dizer qual vale para o seu volume.
Em 3D, UI component e geração de código por categoria, o GLM 5.2 é o nome a acompanhar nas próximas semanas. Dois painéis mexendo ao mesmo tempo não é ruído estatístico.
O catálogo completo tem mais de 549 modelos ativos nesta data, vindos de 68 criadores diferentes, com 44 novidades nos últimos 30 dias. A ordem muda todo dia. O que conta é onde a mudança te atravessa.
Antes do próximo deploy em fullstack ou dataviz, rode um A/B entre Claude Opus 5, alternativas mais baratas e os modelos que estão tomando as posições que Opus 4.8 e Fable 5 perderam.
Perguntas frequentes
O ranking de uso real das arenas mede o quê, exatamente?
Mede quais modelos as pessoas efetivamente escolhem para cada tipo de tarefa — gerar visualizações de dados, escrever aplicação fullstack, criar componentes de UI e assim por diante. Diferente de benchmark, que roda testes sintéticos, o ranking de uso reflete chamadas reais registradas no catálogo.
Claude Opus 5 é o melhor modelo para fazer dataviz?
É o mais usado hoje na arena de dataviz. Isso é diferente de 'melhor' no sentido absoluto — significa que, considerando custo, qualidade e o tipo de tarefa, foi o que mais gente efetivamente pediu nas últimas horas do recorte.
Vale manter Claude Opus 4.8 ou Fable 5 em agentes fullstack?
Os dois modelos caíram no ranking da arena agents-fullstack nesta data. Não quer dizer que deixaram de funcionar — quer dizer que parte do mercado migrou para outras opções. Vale rodar um teste A/B nas suas tarefas antes de decidir manter ou trocar.