FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Haiku 4.5 cobra 30 vezes mais caro que gpt-oss-120b — vale a diferença?

Anthropic vende fronteira a US$ 5 por milhão de tokens; OpenAI dá modelo aberto por US$ 0,17. O teste de hoje mostra em qual fila cada um entra.

Redação FalaVIP IA 3 min de leitura
US$ 5preço de saída por milhão de tokens do Haiku 4.5
US$ 0,17preço de saída por milhão de tokens do gpt-oss-120b
29,9 × 24,1índice de inteligência no comparativo de hoje

O anúncio e a conta no fim do mês

A Anthropic prometeu um Haiku “quase fronteira” e entregou um índice de inteligência de 29,9 — acima de qualquer modelo aberto que aparece no catálogo. Só que esse quase custa caro: US$ 5 por milhão de tokens saindo da API. A OpenAI, na outra ponta, colocou no ar em agosto um MoE de 117B parâmetros com pesos abertos e cobra US$ 0,17 pela mesma unidade. Não é diferença de centavos. É uma diferença de 29 vezes.

Para um produto que gera, digamos, 200 milhões de tokens de saída por mês, isso é US$ 1.000 no gpt-oss-120b contra US$ 1.000 no Haiku 4.5 — a conta anda na casa dos milhares, e aí o “quase fronteira” precisa provar que faz a diferença toda que a fatura sugere.

O que cada número entrega de verdade

Índice de inteligência (Artificial Analysis)
Claude Haiku 4.529,9gpt-oss-120b24,1índice
Fonte: Artificial Analysis

O índice do Artificial Analysis mede capacidade geral, não só codar. Haiku 4.5 marca 29,9 e o gpt-oss-120b fica em 24,1. Em tarefas de código, a distância aumenta: 43,9 contra 30,4. Em agentic, 16,5 contra 13,4. Em todo lugar que tem benchmark, o Haiku ganha — a questão é quanto essa margem paga o preço.

Em velocidade, o jogo vira: o gpt-oss-120b entrega 155 tokens por segundo contra 90 do Haiku. É quase o dobro. Em produtos sensíveis a latência — chat ao vivo, pipelines em tempo real — isso importa tanto quanto o índice bruto.

Preço é só metade da conta

Preço de saída (US$ por milhão de tokens)
Claude Haiku 4.55gpt-oss-120b0,17US$/M
Fonte: OpenRouter

O preço de entrada do gpt-oss-120b é US$ 0,037 por milhão de tokens — três centavos. O do Haiku 4.5 é US$ 1, ou 27 vezes mais. Mas existe um detalhe que muda a aritmética: o Haiku tem cache hit a US$ 0,10 por milhão, o que derruba parte do custo em workloads com prompts repetidos (RAG, system prompts longos). O gpt-oss-120b não publica cache price — ou seja, você não sabe otimizar esse caminho. E como os pesos são abertos, você pode hospedar o gpt-oss-120b em infraestrutura própria e zerar o custo marginal, trocando gasto de API por gasto de GPU.

Claude Haiku 4.5 × gpt-oss-120b
CritérioClaude Haiku 4.5gpt-oss-120b
Índice de inteligência29.924.1
Entrada US$/M10.037
Saída US$/M50.17
Contexto200k131k
Pesos abertosnãosim
Velocidade (tok/s)90155
Índice de código43.930.4
Índice agêntico16.513.4

Para quem cada um é a escolha certa

Haiku 4.5 ganha quando: você precisa de capacidade próxima da fronteira, multimodal (texto+imagem+arquivo) e não quer operar cluster de GPU. Produtos SaaS com prompt grande, agentes que leem PDFs, classificação complexa, code review sofisticado — tudo onde a diferença de 6 pontos no índice geral muda resultado de usuário.

gpt-oss-120b ganha quando: o caso de uso é texto puro, o volume é alto e a margem é apertada. Chatbots de alto tráfego, geração em lote, pipelines internos, qualquer coisa em que a velocidade de 155 tps e o custo de US$ 0,17/milhão sejam mais decisivos que o salto de qualidade do Haiku. E vence de novo se você quer inspecionar, ajustar ou hospedar o modelo — coisa que OpenAI não permite com a família fechada.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 261 modelos disponíveis no catálogo nesta data.

O tabuleiro hoje

No catálogo de 261 modelos ativos, o o3 da OpenAI lidera em inteligência com 31,1 — e cobra US$ 8 por milhão de saída, mais caro que o próprio Haiku. O Haiku 4.5 entra em segundo lugar absoluto e oferece o melhor custo por ponto de índice entre os não-abertos. O gpt-oss-120b, por sua vez, ocupa o terceiro lugar geral e é disparado o modelo aberto mais capaz do ranking. Dois americanos, duas filosofias opostas de cobrança: API premium de um lado, pesos abertos do outro.

O que muda na sua decisão

Se você está migrando workload do Haiku 3.5 ou do Sonnet para cortar custo, o gpt-oss-120b não é substituto — está 6 pontos abaixo no índice geral e quase 14 em código. Mas se você está pagando API de modelo pequeno fechado para fazer volume, o gpt-oss-120b hospedado ou via API entrega 70% do Haiku 4.5 por 3% do preço. É aí que a conta muda de figura.

E tem uma terceira via que vale testar antes de decidir: rodar os dois em paralelo durante uma semana, medir taxa de retrabalho do usuário e custo total por tarefa concluída — não por token. É nessa métrica que o Haiku cobra o seu prêmio ou perde o argumento.

Em uma frase

Use Haiku 4.5 quando o índice geral e a multimodalidade mudam o produto; use gpt-oss-120b quando o volume de tokens é o que destrói a margem — e meça sempre custo por tarefa concluída, nunca por token.

Perguntas frequentes

Claude Haiku 4.5 ou gpt-oss-120b para chatbot de alto tráfego?

gpt-oss-120b. A velocidade de 155 tokens por segundo e o custo de US$ 0,17 por milhão de saída pesam mais do que os 6 pontos de diferença no índice geral quando o gargalo é volume e latência.

Posso rodar o gpt-oss-120b na minha própria infraestrutura?

Sim. Os pesos são abertos e o modelo tem 117B parâmetros totais com 5,1B ativos por inferência (MoE). Isso permite hospedar em cluster próprio e cortar o custo marginal de API, em troca de gastar com GPU.

Por que o Haiku 4.5 cobra US$ 5 por milhão se é só "Haiku"?

Apesar do nome, o Haiku 4.5 é o segundo modelo mais inteligente do catálogo hoje (índice 29,9), só atrás do o3. A Anthropic reposicionou a linha: é "o menor" da família, mas já opera perto da fronteira, e o preço acompanha.

Leia também