Haiku 4.5 cobra 4× mais que o Qwen 3.5-35B e lidera em código
A diferença é 5,6 pontos no índice geral e 6,9 no benchmark de código. O Haiku também tem raciocínio. O Qwen cobra um quarto, roda quase o dobro da velocidade e abre os pesos.
O Haiku se vende barato. Mas mais barato que o quê?
A Anthropic apresentou o Haiku 4.5 como "near-frontier intelligence at a fraction of the cost". Em relação aos irmãos maiores da casa, a conta fecha: o Sonnet 4.6 listado hoje no catálogo cobra US$ 15 por milhão de tokens de saída, e o Haiku 4.5 cobra US$ 5. Mas coloque ele do lado do Qwen3.5-35B-A3B — 35 bilhões de parâmetros com só 3 bilhões ativos, lançado em fevereiro — e o discurso muda. O modelo da Qwen, vindo da China, cobra US$ 1,25 de saída. Quatro vezes menos que o Haiku e doze vezes menos que o Sonnet.
A conta na fatura
Em preço misto na proporção que o catálogo usa como blended, o Haiku sai por US$ 2,00 por milhão de tokens e o Qwen por US$ 0,69. A diferença se mantém no input puro: US$ 1,00 contra US$ 0,25 — de novo quatro vezes. Em um produto que consome 10 milhões de tokens por mês majoritariamente lendo, são US$ 2,50 no Qwen contra US$ 10,00 no Haiku só de entrada. Some a saída e a diferença se repete todo mês. Para quem roda agentes que combinam leitura longa com geração curta, o Qwen também leva vantagem em contexto: 262 mil tokens contra 200 mil do Haiku.
Inteligência e código: o Haiku lidera, mas a diferença é menor que o preço sugere
No índice geral do catálogo, o Haiku marca 29,9 e o Qwen 24,3. São 5,6 pontos de distância — real, mas nenhum dos dois chega perto do topo: o Gemini 3.1 Pro Preview lidera com 47,7, e o Qwen3.5 397B maior da própria casa aparece em quarto com 34,3. Em benchmark de código, a vantagem do Haiku vai para 6,9 pontos (43,9 contra 36,9). Em tarefas agentic, 4,6 (16,5 contra 11,8). O Haiku também suporta raciocínio explícito; o Qwen 35B-A3B não.
O que o preço baixo do Qwen não entrega
Três coisas. A primeira é raciocínio: o Haiku tem modo de raciocínio, o Qwen 35B-A3B não. Em problemas que pedem cadeia de pensamento explícita, isso pesa. A segunda é operação: o Qwen é open weights, então se a latência da API ou o volume estourar, você pode hospedar os 36B em um cluster próprio e o custo marginal vira o do seu hardware. A terceira é velocidade: 167 tokens por segundo contra 90 do Haiku — quase o dobro, o que aparece em fluxos com muito texto gerado e em produtos onde cada bloco de latência conta.
| Critério | Claude Haiku 4.5 | Qwen3.5-35B-A3B |
|---|---|---|
| Índice de inteligência | 29.9 | 24.3 |
| Entrada US$/M | 1 | 0.25 |
| Saída US$/M | 5 | 1.25 |
| Contexto | 200k | 262k |
| Pesos abertos | não | sim |
| Velocidade (tok/s) | 90 | 168 |
| Índice de código | 43.9 | 37.0 |
| Índice agêntico | 16.5 | 11.8 |
Quem leva em qual cenário
Haiku 4.5 ganha quando você precisa de raciocínio encadeado, quer a melhor nota em código da faixa barata e prefere deixar a operação com a Anthropic. Codegen em múltiplos passos, agentes que planejam antes de agir, fluxos em que erro custa caro. Para essas cargas, o dólar extra compensa.
Qwen3.5-35B-A3B ganha quando o volume é alto, a latência importa mais que o ponto de IQ e existe a opção de self-host. Roteamento de tickets, classificação, sumarização em massa, pré-processamento para um modelo mais forte na etapa seguinte. Também é a escolha se você quer inspecionar ou ajustar os pesos.
Não muda nada para quem já roda em cima do Sonnet 4.6 ou do Gemini 3.1 Pro Preview — subir ou descer nessa faixa não altera o resultado do produto final, e qualquer migração custa mais caro do que o que se economiza.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| GPT-5.3-Codex | 45.5 | 14 |
| Claude Sonnet 4.6 | 35.1 | 15 |
| Qwen3.5 397B A17B | 34.3 | 3.5 |
| MiMo-V2-Flash | 34.0 | 0.3 |
Se os 5,6 pontos no índice cabem no seu orçamento, a conta do Haiku fecha. Se não cabem, a saída é o que o catálogo sugere para a maioria dos projetos em produção: use o Qwen 3.5 pequeno no grosso do trabalho por um terço do custo e deixe um modelo mais forte resolver os casos em que ele não basta.
Para codegen agentic com raciocínio, vá de Claude Haiku 4.5; para volume alto com opção de self-host, vá de Qwen3.5-35B-A3B — e a maioria dos produtos em produção se dá bem roteando entre os dois.
Perguntas frequentes
Claude Haiku 4.5 vale a pena sobre o Qwen 3.5-35B-A3B?
Para codegen agentic com raciocínio encadeado, o Haiku 4.5 entrega 6,9 pontos a mais no benchmark de código e tem modo de raciocínio. Para volume alto e latência apertada, o Qwen 3.5-35B-A3B cobra um quarto do preço e roda quase o dobro da velocidade. A maioria dos produtos em produção se dá bem usando os dois em camadas.
O Qwen 3.5-35B-A3B é open weights?
Sim. O modelo tem 36 bilhões de parâmetros totais com 3 bilhões ativos, é distribuído em pesos abertos e não tem modo de raciocínio nativo. Você pode consumir pela API da Qwen ou hospedar em cluster próprio, o que faz o custo marginal cair para o do seu hardware quando o volume aumenta.
Qual a diferença de preço entre Claude Haiku 4.5 e Qwen 3.5-35B-A3B?
O Haiku cobra US$ 5 por milhão de tokens de saída contra US$ 1,25 do Qwen — quatro vezes mais. No input, a proporção é a mesma: US$ 1 contra US$ 0,25. No preço blended do catálogo, o Haiku sai por US$ 2,00 e o Qwen por US$ 0,69.