FalaVIP IA sexta-feira, 04 de setembro de 2026

Benchmarks

40 reportagens de benchmarks sobre modelos de inteligência artificial.

Benchmarks

1 milhão de tokens chega, mas o raciocínio ainda custa caro

Meta Muse Spark 1.3 e Google Gemini 3.8 Flash empatam no contexto, mas cobram preços e entregam níveis diferentes de inteligência, velocidade e desempenho agêntico.

Benchmarks

GLM-5.3-Flash estreia com 57,4 de IQ custando 105x menos que o topo

Seis modelos entraram no índice da Artificial Analysis hoje. O destaque é da Z.ai, que colocou um flash quase no top 5 por menos de um quarto de dólar por milhão de tokens de saída.

Benchmarks

DeepSeek V4 Flash Vision estreia a US$ 0,66 e empurra o índice de inteligência

Qwen3.8 27B entra junto, mas fica longe do pelotão intermediário. Enquanto isso, Claude Opus 5 segue no topo a US$ 25 por milhão de tokens.

Benchmarks

Grok 4.6 entra em três sabores no índice e cobra US$ 3 em todos

Versões xhigh, medium e low estreiam no Artificial Analysis com notas de inteligência entre 51 e 60; Qwen3.8 27B e o compacto LFM2.5-2.6B completam a leva.

Benchmarks

GLM-5.3 entra em 6º no índice cobrando 7x menos que Kimi K3

Modelo da chinesa Zhipu AI estreia com IQ 59.513 e US$ 2.15 por milhão de tokens de saída, preenchendo o espaço vago entre o topo caro e o barato funcional.

Benchmarks

Qwen3.8 27B entra no índice da Artificial Analysis com IQ 52 e preço não divulgado

Modelo chinês de 27 bilhões de parâmetros estreia na régua logo acima da fronteira dos 50 pontos, mas o catálogo não publicou preço de saída.

Benchmarks

Novo GLM é anunciado, mas os dados só confirmam o GLM 5.2

A promessa de um GLM 5.3 chinês mirando Claude e ChatGPT não aparece no catálogo consultado. O que está disponível é o GLM 5.2, com preço baixo, contexto amplo e desempenho mensurado — mas sem a pontuação citada no anúncio.

Benchmarks

Grok 4.6 marca 61 pontos e custa menos que rivais

O modelo da SpaceXAI empata com o GPT-5.6 Sol no índice de inteligência do Artificial Analysis, mas cobra bem menos por tokens de saída. A vantagem desaparece se sua prioridade for contexto maior ou desempenho agêntico.

Benchmarks

Quatro modelos estreiam no índice e custam menos de US$ 3 por milhão de tokens

Qwen3.8 2.4T A95B e três variantes do Gemini 3.7 Flash chegam à régua da Artificial Analysis com preços que apertam o meio do tabuleiro.

Benchmarks

Gemini 3.7 Flash chega a US$ 1,50 com três níveis de raciocínio

As versões low, medium e high estreiam com o mesmo preço no OpenRouter, mas entregam notas diferentes no índice do Artificial Analysis. A opção high marca 56 pontos de inteligência, abaixo dos líderes mais caros.

Benchmarks

Grok 4.6 alcança IQ 60,9, mas não lidera o ranking

O modelo da xAI estreia por US$ 3 por milhão e empata com o GPT-5.6 Sol, enquanto três versões do Claude Opus 5 ficam acima. Para agentes autônomos, o benchmark ainda não responde tudo.

Benchmarks

Ling 3.0 Tiny estreia com IQ 24,5 e preço zerado no índice

Modelo entra no Artificial Analysis com nota baixa e custo não publicado; o que isso diz sobre a régua de hoje.

Benchmarks

Muse Spark 1.2 estreia no índice com IQ 54 e Ling-3.0-flash cobra US$ 0,11

Dois modelos entraram hoje na régua do Artificial Analysis: um mira o meio do ranking, o outro disputa centavo por milhão de token.

Benchmarks

Cinco modelos estreiam no índice com IQ entre 11 e 46 — e só dois custam menos de US$ 1

Do topo da régua ao fundo do poço: Kimi K3 low e dois DeepSeek V4 Flash puxam a fila dos baratos, enquanto Celeris-1 entra com nota de um dígito.

Benchmarks

Cinco modelos pequenos reavaliados hoje — a régua dos baratos mexeu

Qwen3.5, Gemma 4 e Ministral 3 tiveram as notas revisadas pelo catálogo nesta segunda. Para quem escolhe pelo custo por chamada, a fila entre os modelos pequenos mexeu.

Benchmarks

Claude Opus 5 estreia em cinco variantes a US$ 10, com 10 pontos de IQ de distância

Adaptive Reasoning da Anthropic cobra o mesmo preço em cinco níveis de esforço; Max Effort empata com GPT-5.6 Sol e sai 60% mais barato que o topo do índice

Benchmarks

Agnes 2.5 Pro Alpha entra a US$ 0,56 por milhão, mas com QI 38,79

A nova entrada do índice da Artificial Analysis custa menos da metade do modelo mais barato acima de QI 45 — e a nota de intelligence mostra o tamanho do trade-off.

Benchmarks

Google põe duas variantes do Gemini Flash no índice e cobra caro pela mais forte

Gemini 3.6 Flash (high) estreia com IQ 50 e US$ 3 por milhão de tokens de saída; a versão Lite custa um terço, mas fica fora da régua dos modelos úteis.

Benchmarks

Quatro modelos do catálogo tiveram a nota de benchmark revisada; um deles caiu quase 26%,Quatro notas de benchmark foram revisadas em um dia: o que muda na sua escolha,Quatro modelos reavaliados: Trinity Large Thinking perdeu 6,3 pontos de IQ,Reavaliação do dia derruba nota do Trinity Large Thinking em quase 26%,Quatro modelos reavaliados pelo Artificial Analysis em 22 de julho de 2026,Trinity Large Thinking cai de 24,5 para 18,2 na reavaliação do Artificial Analysis,Quatro notas de benchmark revisadas: Trinity Large Thinking foi o que mais caiu,Reavaliação do Artificial Analysis mexe em quatro modelos do catálogo,Quatro modelos tiveram a régua de benchmark movida pelo Artificial Analysis,Quatro reavaliações do Artificial Analysis em um só dia: o que muda na sua pilha

Trinity Large Thinking perdeu quase 26% da nota em uma só revisão; Gemma 4 E4B e DeepSeek V4 Flash também foram recalibrados.

Benchmarks

Qwen3.5 perde ponto no índice da Artificial Analysis

Versão de 0,8B cai quase um ponto de IQ; a de 35B A3B sobe pouco. Quem já tinha escolhido pelo número precisa reabrir a planilha.

página 1 de 2 próximas →