FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Haiku 4.5 cobra 4× mais que o Qwen 3.5-35B e lidera em código

A diferença é 5,6 pontos no índice geral e 6,9 no benchmark de código. O Haiku também tem raciocínio. O Qwen cobra um quarto, roda quase o dobro da velocidade e abre os pesos.

Redação FalaVIP IA 3 min de leitura
US$ 5preço por milhão de tokens de saída do Haiku 4.5
US$ 1,25preço por milhão de tokens de saída do Qwen 3.5-35B
multiplicador de preço entre os dois no input e no output

O Haiku se vende barato. Mas mais barato que o quê?

A Anthropic apresentou o Haiku 4.5 como "near-frontier intelligence at a fraction of the cost". Em relação aos irmãos maiores da casa, a conta fecha: o Sonnet 4.6 listado hoje no catálogo cobra US$ 15 por milhão de tokens de saída, e o Haiku 4.5 cobra US$ 5. Mas coloque ele do lado do Qwen3.5-35B-A3B — 35 bilhões de parâmetros com só 3 bilhões ativos, lançado em fevereiro — e o discurso muda. O modelo da Qwen, vindo da China, cobra US$ 1,25 de saída. Quatro vezes menos que o Haiku e doze vezes menos que o Sonnet.

A conta na fatura

Em preço misto na proporção que o catálogo usa como blended, o Haiku sai por US$ 2,00 por milhão de tokens e o Qwen por US$ 0,69. A diferença se mantém no input puro: US$ 1,00 contra US$ 0,25 — de novo quatro vezes. Em um produto que consome 10 milhões de tokens por mês majoritariamente lendo, são US$ 2,50 no Qwen contra US$ 10,00 no Haiku só de entrada. Some a saída e a diferença se repete todo mês. Para quem roda agentes que combinam leitura longa com geração curta, o Qwen também leva vantagem em contexto: 262 mil tokens contra 200 mil do Haiku.

Preço de saída (US$ por milhão de tokens)
Claude Haiku 4.55Qwen3.5-35B-A3B1,25US$/M
Fonte: OpenRouter

Inteligência e código: o Haiku lidera, mas a diferença é menor que o preço sugere

No índice geral do catálogo, o Haiku marca 29,9 e o Qwen 24,3. São 5,6 pontos de distância — real, mas nenhum dos dois chega perto do topo: o Gemini 3.1 Pro Preview lidera com 47,7, e o Qwen3.5 397B maior da própria casa aparece em quarto com 34,3. Em benchmark de código, a vantagem do Haiku vai para 6,9 pontos (43,9 contra 36,9). Em tarefas agentic, 4,6 (16,5 contra 11,8). O Haiku também suporta raciocínio explícito; o Qwen 35B-A3B não.

Índice de inteligência (Artificial Analysis)
Claude Haiku 4.529,9Qwen3.5-35B-A3B24,3índice
Fonte: Artificial Analysis

O que o preço baixo do Qwen não entrega

Três coisas. A primeira é raciocínio: o Haiku tem modo de raciocínio, o Qwen 35B-A3B não. Em problemas que pedem cadeia de pensamento explícita, isso pesa. A segunda é operação: o Qwen é open weights, então se a latência da API ou o volume estourar, você pode hospedar os 36B em um cluster próprio e o custo marginal vira o do seu hardware. A terceira é velocidade: 167 tokens por segundo contra 90 do Haiku — quase o dobro, o que aparece em fluxos com muito texto gerado e em produtos onde cada bloco de latência conta.

Claude Haiku 4.5 × Qwen3.5-35B-A3B
CritérioClaude Haiku 4.5Qwen3.5-35B-A3B
Índice de inteligência29.924.3
Entrada US$/M10.25
Saída US$/M51.25
Contexto200k262k
Pesos abertosnãosim
Velocidade (tok/s)90168
Índice de código43.937.0
Índice agêntico16.511.8

Quem leva em qual cenário

Haiku 4.5 ganha quando você precisa de raciocínio encadeado, quer a melhor nota em código da faixa barata e prefere deixar a operação com a Anthropic. Codegen em múltiplos passos, agentes que planejam antes de agir, fluxos em que erro custa caro. Para essas cargas, o dólar extra compensa.

Qwen3.5-35B-A3B ganha quando o volume é alto, a latência importa mais que o ponto de IQ e existe a opção de self-host. Roteamento de tickets, classificação, sumarização em massa, pré-processamento para um modelo mais forte na etapa seguinte. Também é a escolha se você quer inspecionar ou ajustar os pesos.

Não muda nada para quem já roda em cima do Sonnet 4.6 ou do Gemini 3.1 Pro Preview — subir ou descer nessa faixa não altera o resultado do produto final, e qualquer migração custa mais caro do que o que se economiza.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Gemini 3.1 Pro Preview47.712
GPT-5.3-Codex45.514
Claude Sonnet 4.635.115
Qwen3.5 397B A17B34.33.5
MiMo-V2-Flash34.00.3
Entre os 362 modelos disponíveis no catálogo nesta data.

Se os 5,6 pontos no índice cabem no seu orçamento, a conta do Haiku fecha. Se não cabem, a saída é o que o catálogo sugere para a maioria dos projetos em produção: use o Qwen 3.5 pequeno no grosso do trabalho por um terço do custo e deixe um modelo mais forte resolver os casos em que ele não basta.

Em uma frase

Para codegen agentic com raciocínio, vá de Claude Haiku 4.5; para volume alto com opção de self-host, vá de Qwen3.5-35B-A3B — e a maioria dos produtos em produção se dá bem roteando entre os dois.

Perguntas frequentes

Claude Haiku 4.5 vale a pena sobre o Qwen 3.5-35B-A3B?

Para codegen agentic com raciocínio encadeado, o Haiku 4.5 entrega 6,9 pontos a mais no benchmark de código e tem modo de raciocínio. Para volume alto e latência apertada, o Qwen 3.5-35B-A3B cobra um quarto do preço e roda quase o dobro da velocidade. A maioria dos produtos em produção se dá bem usando os dois em camadas.

O Qwen 3.5-35B-A3B é open weights?

Sim. O modelo tem 36 bilhões de parâmetros totais com 3 bilhões ativos, é distribuído em pesos abertos e não tem modo de raciocínio nativo. Você pode consumir pela API da Qwen ou hospedar em cluster próprio, o que faz o custo marginal cair para o do seu hardware quando o volume aumenta.

Qual a diferença de preço entre Claude Haiku 4.5 e Qwen 3.5-35B-A3B?

O Haiku cobra US$ 5 por milhão de tokens de saída contra US$ 1,25 do Qwen — quatro vezes mais. No input, a proporção é a mesma: US$ 1 contra US$ 0,25. No preço blended do catálogo, o Haiku sai por US$ 2,00 e o Qwen por US$ 0,69.

Leia também