Haiku 4.5 cobra 30 vezes mais caro que gpt-oss-120b — vale a diferença?
Anthropic vende fronteira a US$ 5 por milhão de tokens; OpenAI dá modelo aberto por US$ 0,17. O teste de hoje mostra em qual fila cada um entra.
O anúncio e a conta no fim do mês
A Anthropic prometeu um Haiku “quase fronteira” e entregou um índice de inteligência de 29,9 — acima de qualquer modelo aberto que aparece no catálogo. Só que esse quase custa caro: US$ 5 por milhão de tokens saindo da API. A OpenAI, na outra ponta, colocou no ar em agosto um MoE de 117B parâmetros com pesos abertos e cobra US$ 0,17 pela mesma unidade. Não é diferença de centavos. É uma diferença de 29 vezes.
Para um produto que gera, digamos, 200 milhões de tokens de saída por mês, isso é US$ 1.000 no gpt-oss-120b contra US$ 1.000 no Haiku 4.5 — a conta anda na casa dos milhares, e aí o “quase fronteira” precisa provar que faz a diferença toda que a fatura sugere.
O que cada número entrega de verdade
O índice do Artificial Analysis mede capacidade geral, não só codar. Haiku 4.5 marca 29,9 e o gpt-oss-120b fica em 24,1. Em tarefas de código, a distância aumenta: 43,9 contra 30,4. Em agentic, 16,5 contra 13,4. Em todo lugar que tem benchmark, o Haiku ganha — a questão é quanto essa margem paga o preço.
Em velocidade, o jogo vira: o gpt-oss-120b entrega 155 tokens por segundo contra 90 do Haiku. É quase o dobro. Em produtos sensíveis a latência — chat ao vivo, pipelines em tempo real — isso importa tanto quanto o índice bruto.
Preço é só metade da conta
O preço de entrada do gpt-oss-120b é US$ 0,037 por milhão de tokens — três centavos. O do Haiku 4.5 é US$ 1, ou 27 vezes mais. Mas existe um detalhe que muda a aritmética: o Haiku tem cache hit a US$ 0,10 por milhão, o que derruba parte do custo em workloads com prompts repetidos (RAG, system prompts longos). O gpt-oss-120b não publica cache price — ou seja, você não sabe otimizar esse caminho. E como os pesos são abertos, você pode hospedar o gpt-oss-120b em infraestrutura própria e zerar o custo marginal, trocando gasto de API por gasto de GPU.
| Critério | Claude Haiku 4.5 | gpt-oss-120b |
|---|---|---|
| Índice de inteligência | 29.9 | 24.1 |
| Entrada US$/M | 1 | 0.037 |
| Saída US$/M | 5 | 0.17 |
| Contexto | 200k | 131k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 90 | 155 |
| Índice de código | 43.9 | 30.4 |
| Índice agêntico | 16.5 | 13.4 |
Para quem cada um é a escolha certa
Haiku 4.5 ganha quando: você precisa de capacidade próxima da fronteira, multimodal (texto+imagem+arquivo) e não quer operar cluster de GPU. Produtos SaaS com prompt grande, agentes que leem PDFs, classificação complexa, code review sofisticado — tudo onde a diferença de 6 pontos no índice geral muda resultado de usuário.
gpt-oss-120b ganha quando: o caso de uso é texto puro, o volume é alto e a margem é apertada. Chatbots de alto tráfego, geração em lote, pipelines internos, qualquer coisa em que a velocidade de 155 tps e o custo de US$ 0,17/milhão sejam mais decisivos que o salto de qualidade do Haiku. E vence de novo se você quer inspecionar, ajustar ou hospedar o modelo — coisa que OpenAI não permite com a família fechada.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O tabuleiro hoje
No catálogo de 261 modelos ativos, o o3 da OpenAI lidera em inteligência com 31,1 — e cobra US$ 8 por milhão de saída, mais caro que o próprio Haiku. O Haiku 4.5 entra em segundo lugar absoluto e oferece o melhor custo por ponto de índice entre os não-abertos. O gpt-oss-120b, por sua vez, ocupa o terceiro lugar geral e é disparado o modelo aberto mais capaz do ranking. Dois americanos, duas filosofias opostas de cobrança: API premium de um lado, pesos abertos do outro.
O que muda na sua decisão
Se você está migrando workload do Haiku 3.5 ou do Sonnet para cortar custo, o gpt-oss-120b não é substituto — está 6 pontos abaixo no índice geral e quase 14 em código. Mas se você está pagando API de modelo pequeno fechado para fazer volume, o gpt-oss-120b hospedado ou via API entrega 70% do Haiku 4.5 por 3% do preço. É aí que a conta muda de figura.
E tem uma terceira via que vale testar antes de decidir: rodar os dois em paralelo durante uma semana, medir taxa de retrabalho do usuário e custo total por tarefa concluída — não por token. É nessa métrica que o Haiku cobra o seu prêmio ou perde o argumento.
Use Haiku 4.5 quando o índice geral e a multimodalidade mudam o produto; use gpt-oss-120b quando o volume de tokens é o que destrói a margem — e meça sempre custo por tarefa concluída, nunca por token.
Perguntas frequentes
Claude Haiku 4.5 ou gpt-oss-120b para chatbot de alto tráfego?
gpt-oss-120b. A velocidade de 155 tokens por segundo e o custo de US$ 0,17 por milhão de saída pesam mais do que os 6 pontos de diferença no índice geral quando o gargalo é volume e latência.
Posso rodar o gpt-oss-120b na minha própria infraestrutura?
Sim. Os pesos são abertos e o modelo tem 117B parâmetros totais com 5,1B ativos por inferência (MoE). Isso permite hospedar em cluster próprio e cortar o custo marginal de API, em troca de gastar com GPU.
Por que o Haiku 4.5 cobra US$ 5 por milhão se é só "Haiku"?
Apesar do nome, o Haiku 4.5 é o segundo modelo mais inteligente do catálogo hoje (índice 29,9), só atrás do o3. A Anthropic reposicionou a linha: é "o menor" da família, mas já opera perto da fronteira, e o preço acompanha.