FalaVIP IA quinta-feira, 03 de setembro de 2026
Mercado

Claude Opus 5 toma o topo de dataviz enquanto Anthropic perde em agentes

Movimentações de 15 de agosto mostram a família Claude em lados opostos do ranking de uso real: vence onde o output é visual, recua onde o trabalho é código.

Redação FalaVIP IA 3 min de leitura
US$ 25por milhão de tokens de saída do Claude Opus 5
US$ 0,18por milhão de tokens de saída do DeepSeek V4 Flash 0731
IQ 63,053índice do Claude Opus 5, maior do catálogo hoje

O novo líder da dataviz

Claude Opus 5 entrou para o topo do ranking de dataviz nesta segunda-feira. Saiu da segunda posição e tomou o lugar de quem estava em primeiro — uma troca seca, sem disputa declarada, registrada no painel de uso real. E uso real é diferente de benchmark: significa que, ao longo das últimas horas, mais gente efetivamente pediu um gráfico, um dashboard ou uma visualização para o Opus 5 do que para qualquer outro modelo da categoria.

O preço explica por que essa escolha tem peso. Opus 5 cobra US$ 25 por milhão de tokens de saída. Quem está fazendo dataviz séria — gráficos interativos, SVGs complexos, painéis com múltiplas séries — queima tokens de saída a cada iteração. A conta sobe.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Opus 563.125
Claude Fable 562.150
GPT-5.6 Sol60.910
Grok 4.660.96
Kimi K359.715
Entre os 549 modelos disponíveis no catálogo nesta data.

Para comparar: o DeepSeek V4 Flash 0731, que aparece na faixa dos modelos acima de IQ 45 mais baratos do catálogo, sai por US$ 0,18 por milhão de tokens de saída. Mesma tarefa potencial, diferença de duas ordens de grandeza no orçamento. Mas o painel de uso diz que, no recorte de dataviz, a turma que está pagando é a turma que está escolhendo Opus 5.

E no fullstack, Anthropic sangra

A contradição aparece quando você olha para o outro lado da casa. Na arena agents-fullstack — categoria que mede agentes escrevendo aplicação completa, do backend ao frontend — a Anthropic perdeu duas posições em um único dia. Claude Fable 5 caiu de #2 para #4, e Claude Opus 4.8 despencou de #5 para #7.

Movimentações no ranking de uso
ArenaModeloPosição antesPosição depois
models-uicomponentGrok 4.6
models-asciiartGrok 4.5
models-websiteMuse Spark 1.2
agents-fullstackClaude Opus 4.8
models-svgClaude Fable 5
models-uicomponentClaude Opus 5
agents-fullstackGrok 4.5
agents-fullstackGrok 4.6
models-codecategoriesGLM 5.2
models-codecategoriesGrok 4.6
Ranking de uso real do OpenRouter por categoria de tarefa.

A leitura técnica: Opus 5 e Fable 5 são os dois modelos de topo no ranking de inteligência hoje (IQ 63,053 e 62,073 respectivamente). Mas agentes que precisam entregar código de produção em múltiplos arquivos estão migrando para outros fornecedores. Não dá para cravar quem tomou os lugares — o painel não mostra — mas a fuga é mensurável: dois modelos Anthropic somando três posições perdidas no mesmo painel no mesmo dia.

Grok em três frentes, com resultados diferentes

A SpaceXAI também teve um dia agitado. Grok 4.5 subiu para a segunda posição em agents-godotgamedev — desenvolvimento de jogos com a engine Godot. Ponto para o ecossistema.

Mas Grok 4.6 foi na contramão em três arenas distintas: caiu de #2 para #3 em agents-mobileapps e em models-uicomponent, e de #5 para #7 em models-3d. É um padrão: quando a tarefa pede acabamento visual — interface, modelo 3D, app mobile — o Grok 4.6 está cedendo espaço. Quando o trabalho é lógica de jogo, segura.

GLM 5.2 sobe sem fazer barulho

A movimentação mais quieta do dia é do GLM 5.2. O modelo subiu de #6 para #5 em duas arenas diferentes: models-3d e models-codecategories. Não é uma escalada explosiva, mas o fato de aparecer em dois painéis distintos no mesmo dia sugere consistência, não acaso. Em geração de código por categoria e em modelagem 3D, o GLM 5.2 está conquistando terreno centímetro por centímetro.

O Kimi K3 também mexeu — caiu de #2 para #3 em models-svg. Pequeno recuo, mas numa categoria onde a Anthropic acabou de chegar ao topo. Coincidência ou pressão direta? O painel não explica, só mede.

O que isso muda no seu próximo deploy

Três implicações práticas saem deste mapa de hoje.

Se você está rodando Claude Opus 4.8 ou Fable 5 em pipelines que entregam aplicação fullstack, vale testar concorrentes nas mesmas tarefas. O painel mostra que parte do mercado já fez isso — esperar para reagir é perder benchmark de produção.

Para dataviz com budget apertado, o Opus 5 virou referência de uso, não só de capacidade bruta. Mas o DeepSeek V4 Flash 0731 a US$ 0,18/M continua sendo a opção mais barata na faixa de IQ acima de 45 — a conta, e não o painel, vai dizer qual vale para o seu volume.

Em 3D, UI component e geração de código por categoria, o GLM 5.2 é o nome a acompanhar nas próximas semanas. Dois painéis mexendo ao mesmo tempo não é ruído estatístico.

O catálogo completo tem mais de 549 modelos ativos nesta data, vindos de 68 criadores diferentes, com 44 novidades nos últimos 30 dias. A ordem muda todo dia. O que conta é onde a mudança te atravessa.

Em uma frase

Antes do próximo deploy em fullstack ou dataviz, rode um A/B entre Claude Opus 5, alternativas mais baratas e os modelos que estão tomando as posições que Opus 4.8 e Fable 5 perderam.

Perguntas frequentes

O ranking de uso real das arenas mede o quê, exatamente?

Mede quais modelos as pessoas efetivamente escolhem para cada tipo de tarefa — gerar visualizações de dados, escrever aplicação fullstack, criar componentes de UI e assim por diante. Diferente de benchmark, que roda testes sintéticos, o ranking de uso reflete chamadas reais registradas no catálogo.

Claude Opus 5 é o melhor modelo para fazer dataviz?

É o mais usado hoje na arena de dataviz. Isso é diferente de 'melhor' no sentido absoluto — significa que, considerando custo, qualidade e o tipo de tarefa, foi o que mais gente efetivamente pediu nas últimas horas do recorte.

Vale manter Claude Opus 4.8 ou Fable 5 em agentes fullstack?

Os dois modelos caíram no ranking da arena agents-fullstack nesta data. Não quer dizer que deixaram de funcionar — quer dizer que parte do mercado migrou para outras opções. Vale rodar um teste A/B nas suas tarefas antes de decidir manter ou trocar.

Leia também