FalaVIP IA o que os modelos custam,
medido todo dia
Benchmarks

K2 Horizon 375B estreia com IQ 47,3 e preço indefinido

O modelo de grande porte entrou no índice do Artificial Analysis, mas ainda não permite calcular custo-benefício. Na mesma rodada, opções menores e já precificadas aparecem à frente.

Redação FalaVIP IA 3 min de leitura
47,3pontuação IQ do K2 Horizon 375B A23B no Artificial Analysis
US$ 2por milhão de tokens do Muse Spark 1.3 no OpenRouter
50,2pontuação IQ do Kimi K3 (max) no Artificial Analysis

O K2 Horizon 375B A23B estreou no índice do Artificial Analysis com pontuação IQ de 47,3, mas sem preço definido. Para quem escolhe modelo olhando capacidade e fatura, essa é a informação central: há um novo nome de grande porte para testar, mas ainda não há como compará-lo de forma completa com as alternativas disponíveis no OpenRouter.

A estreia ocorreu em 4 de setembro de 2026. O nome registrado inclui “375B A23B”, mas os dados não informam parâmetros totais, parâmetros ativos, preços, desempenho em código ou capacidade agêntica. Por enquanto, o único sinal comparável é a nota de inteligência.

A nota coloca o K2 atrás de opções já precificadas

Com IQ 47,3, o K2 Horizon fica abaixo dos modelos listados pelo Artificial Analysis como melhores relações entre custo e desempenho. O Kimi K3 (max) aparece com 50,2 e preço de US$ 6 por milhão de tokens. O Grok 4.6 (high) marca 50,6 a US$ 3, enquanto o Muse Spark 1.3 (max) chega a 52,7 por US$ 2.

A comparação não prova que o K2 seja pior para toda tarefa. Ela mostra que, no indicador disponível, o modelo ainda não supera opções que já oferecem uma referência clara de custo. Se você paga por chamadas em produção, esse preço ausente impede estimar custo por requisição, margem ou impacto na fatura.

Também falta saber como o K2 se comporta em programação e fluxos agênticos. O Artificial Analysis informa essas métricas para alguns modelos do catálogo, mas não para a estreia do K2. Sem esses dados, a pontuação IQ não responde se o modelo serve melhor para geração de código, atendimento, análise de documentos ou execução de ferramentas.

O contraste com os modelos do topo

A distância aumenta quando a comparação muda para o topo da inteligência. O Claude Fable 5.1 aparece com IQ 56,8 e preço de US$ 20 por milhão de tokens. O GPT-6 Astra (max) registra 54,7 no topo listado pelo Artificial Analysis, também a US$ 20. O Claude Opus 5 marca 54,1 a US$ 10.

Há uma divergência importante dentro dos próprios registros do Artificial Analysis. Na lista de estreias do dia, o GPT-6 Astra (max) aparece com IQ 61,2, enquanto a lista de topo mostra 54,7. O K2, por sua vez, aparece com a mesma nota de 47,3 na estreia, sem outra classificação concorrente no material disponível.

Isso recomenda cautela ao tratar a pontuação como ranking absoluto. Configurações diferentes podem aparecer com nomes parecidos, e a lista de estreias não coincide integralmente com a lista de topo. Para uma decisão de compra, a nota deve ser lida junto do preço, da configuração usada e do tipo de tarefa.

O que o preço indefinido muda na prática

O OpenRouter lista preços para vários modelos comparáveis, mas não apresenta um valor para o K2 Horizon 375B A23B nos dados deste dia. Não dá para afirmar se ele será barato, caro ou gratuito quando chegar a uma rota comercial. Também não dá para projetar economia apenas porque o modelo tem uma arquitetura indicada no nome.

Esse ponto importa especialmente para equipes que avaliam modelos grandes para substituir uma opção atual. O Muse Spark 1.3 (max) tem nota de 52,7 e custa US$ 2 por milhão de tokens. O Grok 4.6 (high) tem 50,6 a US$ 3. O Kimi K3 (max) chega a 50,2 a US$ 6. Todos oferecem, portanto, uma referência simultânea de capacidade e preço que o K2 ainda não oferece.

Para quem faz pesquisa de capacidade bruta, a estreia vale acompanhar. O número de 47,3 coloca o modelo no radar e cria uma primeira linha de base. Para quem precisa decidir hoje qual modelo colocar em produção, a ausência de preço e de métricas de código ou agentes pesa mais do que o tamanho sugerido pelo nome.

Quem deve esperar e quem pode testar

O K2 interessa a equipes que mantêm uma bateria própria de avaliações, podem testar uma nova opção quando houver acesso e não precisam fechar o orçamento imediatamente. Também pode chamar atenção de quem procura modelos de grande porte fora dos nomes mais conhecidos do topo.

Ele muda pouco para quem já precisa escolher uma API com custo previsível. Nesse caso, modelos como Muse Spark 1.3, Grok 4.6 e Kimi K3 oferecem notas e preços publicados no Artificial Analysis e no OpenRouter, respectivamente. A comparação definitiva com o K2 só começa quando o preço e as métricas complementares aparecerem.

Até lá, a decisão racional é tratá-lo como candidato de benchmark, não como substituto pronto: reserve testes, mas não refaça a projeção da fatura com base apenas nos 47,3 pontos.

Em uma frase

Se você precisa escolher um modelo agora, mantenha o K2 Horizon 375B na fila de testes e espere o preço antes de considerá-lo para produção.

Perguntas frequentes

Qual foi a pontuação do K2 Horizon 375B no benchmark?

O K2 Horizon 375B A23B estreou com IQ de 47,3 no Artificial Analysis. A nota é a única métrica de capacidade disponível para o modelo nos dados de 4 de setembro de 2026.

Quanto custa o K2 Horizon 375B?

O preço ainda não está definido nos dados do OpenRouter. Sem o valor por milhão de tokens, não é possível calcular custo-benefício ou projetar o impacto do modelo na fatura.

O K2 Horizon 375B já é melhor que opções mais baratas?

Não há evidência disso na comparação disponível. O Muse Spark 1.3 (max) tem IQ 52,7 por US$ 2 por milhão de tokens, enquanto o K2 registra 47,3 e ainda não tem preço publicado.

Leia também

Benchmarks

K2 Horizon estreia com IQ 47,3, mas custo ainda é incógnita

O modelo de grande porte entra no índice do Artificial Analysis abaixo dos novos GPT-6 Astra. Sem preço listado no OpenRouter, ainda não dá para transformar o resultado em decisão de compra.

Benchmarks

GPT-6 Astra chega a 61,2, mas custa US$ 20

O novo modelo entra entre os melhores resultados do Artificial Analysis, mas não lidera o ranking. Para quem paga a API, a diferença de preço frente a alternativas mais baratas é o ponto central.

Benchmarks

Agnes 2.5 Pro Alpha entra a US$ 0,56 por milhão, mas com QI 38,79

A nova entrada do índice da Artificial Analysis custa menos da metade do modelo mais barato acima de QI 45 — e a nota de intelligence mostra o tamanho do trade-off.

Benchmarks

Quatro modelos do catálogo tiveram a nota de benchmark revisada; um deles caiu quase 26%,Quatro notas de benchmark foram revisadas em um dia: o que muda na sua escolha,Quatro modelos reavaliados: Trinity Large Thinking perdeu 6,3 pontos de IQ,Reavaliação do dia derruba nota do Trinity Large Thinking em quase 26%,Quatro modelos reavaliados pelo Artificial Analysis em 22 de julho de 2026,Trinity Large Thinking cai de 24,5 para 18,2 na reavaliação do Artificial Analysis,Quatro notas de benchmark revisadas: Trinity Large Thinking foi o que mais caiu,Reavaliação do Artificial Analysis mexe em quatro modelos do catálogo,Quatro modelos tiveram a régua de benchmark movida pelo Artificial Analysis,Quatro reavaliações do Artificial Analysis em um só dia: o que muda na sua pilha

Trinity Large Thinking perdeu quase 26% da nota em uma só revisão; Gemma 4 E4B e DeepSeek V4 Flash também foram recalibrados.