FalaVIP IA o que os modelos custam,
medido todo dia
Benchmarks

K2 Horizon estreia com IQ 47,3, mas custo ainda é incógnita

O modelo de grande porte entra no índice do Artificial Analysis abaixo dos novos GPT-6 Astra. Sem preço listado no OpenRouter, ainda não dá para transformar o resultado em decisão de compra.

Redação FalaVIP IA 3 min de leitura
IQ 47,3nota de estreia do K2 Horizon 375B A23B
IQ 61,2melhor resultado de estreia do GPT-6 Astra (max)
US$ 20preço associado às configurações do GPT-6 Astra no índice

O K2 Horizon 375B A23B estreou no benchmark com IQ 47,3. O número coloca o modelo imediatamente em uma faixa útil para comparação, mas ainda não responde à pergunta que pesa na fatura: quanto custa colocar esse desempenho em produção.

O modelo apareceu no índice do Artificial Analysis em 4 de setembro. Diferentemente dos novos GPT-6 Astra, não há preço associado à estreia do K2 Horizon no índice. Também não há, entre os dados de preços do OpenRouter, uma ficha correspondente ao modelo. Na prática, você já pode usar o resultado como referência de capacidade, mas ainda não consegue calcular custo por milhão de tokens, margem ou retorno sobre uma carga real.

A distância para o GPT-6 Astra

A estreia do K2 Horizon ficou abaixo das seis configurações do GPT-6 Astra que entraram no mesmo índice. O Astra (max) marcou 61,2, seguido por xhigh, com 61, high, com 60,3, medium, com 59,2, low, com 56,7, e non-reasoning, com 55,3.

A comparação mostra uma diferença de 13,9 pontos entre o K2 Horizon e o Astra (max). Ela não significa, sozinha, que o GPT-6 Astra será melhor em toda tarefa. Um índice de inteligência não substitui testes com o seu código, seus documentos, seu fluxo de ferramentas e seus critérios de erro. Serve, porém, para posicionar os modelos antes de gastar com uma bateria própria de avaliações.

Há uma ressalva importante nos próprios números do Artificial Analysis. A lista de estreias registra o Astra (max) com IQ 61,2, enquanto o quadro de topo de inteligência registra o mesmo nome com IQ 54,7. O Astra xhigh aparece com 61 na estreia e 54,3 no topo. As duas referências não estão alinhadas, portanto a posição relativa precisa ser lida com cautela. O resultado publicado para o K2 Horizon, por outro lado, é 47,3 nas duas listagens relevantes disponíveis para essa estreia.

O que o preço muda na comparação

No OpenRouter, o GPT-6 Astra custa US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. A versão batch aparece pela metade: US$ 5 na entrada e US$ 25 na saída. O contexto listado é de 1,05 milhão de tokens para as versões regular e batch.

Esses números não podem ser transferidos para o K2 Horizon. Não há tarifa do modelo disponível nos dados do OpenRouter, nem janela de contexto informada para ele. A conclusão operacional é direta: o K2 Horizon pode parecer competitivo ou caro em relação ao Astra, mas não há base para afirmar nenhuma das duas coisas.

Isso também impede uma conta simples de custo-benefício. O índice lista modelos com resultados próximos e preços conhecidos, como Muse Spark 1.3 (max), com IQ 53 e US$ 2, e Grok 4.6 (high), com IQ 50,6 e US$ 3. Kimi K3 (max) marca 50,2 a US$ 6. Essas referências ajudam a enxergar o mercado, mas não substituem o preço do K2 Horizon. Comparar somente o IQ pode levar você a escolher uma capacidade que custa mais por tarefa ou que não atende ao seu caso.

Para quem o resultado já serve

Se você seleciona modelos para pesquisa, o K2 Horizon ganha valor imediatamente. O IQ 47,3 cria uma nova âncora para modelos de grande porte e permite separar duas perguntas: o quanto o modelo raciocina e quanto a API cobra por esse raciocínio.

Se você mantém um produto em produção, o resultado ainda é insuficiente para uma troca. Faltam preço de entrada, preço de saída, contexto e métricas específicas de código ou uso agêntico. Sem esses dados, não dá para estimar latência financeira, custo mensal ou impacto em tarefas que exigem chamadas repetidas a ferramentas.

Para quem já paga pelo GPT-6 Astra, a estreia do K2 Horizon não cria uma alternativa comercial imediata. O Astra tem preço e contexto listados, além de várias configurações de esforço no benchmark. Para quem procura uma referência independente de desempenho, porém, o K2 Horizon passa a ocupar um espaço relevante abaixo dessa família.

A decisão que ainda não pode ser tomada

O próximo passo não é trocar de modelo com base no IQ 47,3. É esperar uma ficha de preço e submeter o K2 Horizon às mesmas tarefas usadas para medir custo por resposta, taxa de acerto, comprimento das saídas e necessidade de repetição.

Até lá, trate o número como referência de capacidade, não como recomendação de compra. Se você precisa decidir hoje, os modelos com preço no OpenRouter continuam sendo os únicos que permitem fechar a conta; o K2 Horizon serve para montar a próxima rodada de testes, quando houver uma tarifa comparável.

Em uma frase

O K2 Horizon 375B já é uma referência de desempenho com IQ 47,3, mas sem preço e contexto listados ainda não é uma opção calculável para produção.

Perguntas frequentes

Qual foi o IQ do K2 Horizon 375B A23B?

O K2 Horizon 375B A23B estreou no índice do Artificial Analysis com IQ 47,3. O resultado ficou abaixo das configurações do GPT-6 Astra registradas na mesma rodada.

Quanto custa usar o K2 Horizon no OpenRouter?

Não há preço do K2 Horizon listado nos dados do OpenRouter usados nesta comparação. Também não há janela de contexto informada, portanto não é possível calcular seu custo operacional.

O K2 Horizon é melhor que o GPT-6 Astra?

Pelo resultado de estreia no Artificial Analysis, não: o K2 Horizon marcou 47,3, enquanto o GPT-6 Astra (max) marcou 61,2. Ainda assim, a própria listagem apresenta valores diferentes para o Astra em outro quadro, e o benchmark não substitui testes com tarefas reais.

Leia também

Benchmarks

K2 Horizon 375B estreia com IQ 47,3 e preço indefinido

O modelo de grande porte entrou no índice do Artificial Analysis, mas ainda não permite calcular custo-benefício. Na mesma rodada, opções menores e já precificadas aparecem à frente.

Benchmarks

Agnes 2.5 Pro Alpha entra a US$ 0,56 por milhão, mas com QI 38,79

A nova entrada do índice da Artificial Analysis custa menos da metade do modelo mais barato acima de QI 45 — e a nota de intelligence mostra o tamanho do trade-off.

Benchmarks

Quatro modelos do catálogo tiveram a nota de benchmark revisada; um deles caiu quase 26%,Quatro notas de benchmark foram revisadas em um dia: o que muda na sua escolha,Quatro modelos reavaliados: Trinity Large Thinking perdeu 6,3 pontos de IQ,Reavaliação do dia derruba nota do Trinity Large Thinking em quase 26%,Quatro modelos reavaliados pelo Artificial Analysis em 22 de julho de 2026,Trinity Large Thinking cai de 24,5 para 18,2 na reavaliação do Artificial Analysis,Quatro notas de benchmark revisadas: Trinity Large Thinking foi o que mais caiu,Reavaliação do Artificial Analysis mexe em quatro modelos do catálogo,Quatro modelos tiveram a régua de benchmark movida pelo Artificial Analysis,Quatro reavaliações do Artificial Analysis em um só dia: o que muda na sua pilha

Trinity Large Thinking perdeu quase 26% da nota em uma só revisão; Gemma 4 E4B e DeepSeek V4 Flash também foram recalibrados.

Benchmarks

GPT-6 Astra chega a 61,2, mas custa US$ 20

O novo modelo entra entre os melhores resultados do Artificial Analysis, mas não lidera o ranking. Para quem paga a API, a diferença de preço frente a alternativas mais baratas é o ponto central.