Qwen3 Thinking quase 15x mais caro em um dia, Sonnet Latest derruba preço
Seis reajustes para cima e três para baixo mexem no cardápio desta terça; o que muda de verdade na conta de quem já roda Qwen ou Sonnet em produção.
O número que assusta: 14,95x de uma vez
Você abriu o painel de billing e o Qwen3 235B A22B Thinking está 14,95 vezes mais caro do que ontem. Não é erro de arredondamento, é tabela nova. O preço de saída saltou de US$ 0,10 para US$ 1,495 por milhão de tokens, e o de entrada foi de US$ 0,10 para US$ 0,1495. Em um único movimento, o modelo deixa de ser a pechincha que muita gente usava para raciocínio pesado e vira um item de prateleira intermediária.
A conta é simples: um workload que custava US$ 100 no fim do mês para gerar respostas longas agora passa de US$ 1.490 se o volume for o mesmo. Para quem colocou Qwen Thinking em produção achando que o preço era o argumento, esse é o tipo de mudança que obriga a repensar o pipeline.
Quem ficou mais caro (e quem nem tanto)
Dos dez reajustes do dia, seis foram para cima. O caso mais agressivo é o do Qwen3 235B A22B Thinking, mas o irmão menor também subiu forte: o Qwen3 30B A3B Thinking saltou 3,9x no preço de saída (de US$ 0,40 para US$ 1,56 por milhão de tokens). Já o Qwen3 8B, modelo pequeno da mesma família, subiu "só" 14% na saída — quase um aviso de que o reajuste está concentrando-se nas variantes de raciocínio.
Completam a lista de altas o MiniMax M2.1 (alta de 26% na saída, para US$ 1,20 por milhão) e o DeepSeek V4 Flash, que subiu 9% em uma janela curta e depois voltou 8% — ou seja, alguém clicou errado e corrigiu no mesmo dia.
Quem ficou mais barato: Sonnet Latest abre mão de margem
A notícia boa do dia vem da Anthropic. O Claude Sonnet Latest caiu de US$ 15 para US$ 10 por milhão de tokens de saída, e a entrada foi de US$ 3 para US$ 2. É um corte de 33% em ambas as pontas. Para quem roda o Sonnet como modelo padrão em produto pago, a fatura de julho já vai chegar mais leve sem trocar uma linha de código.
Esse movimento reposiciona o Sonnet em um patamar intermediário dentro do próprio catálogo da Anthropic: ainda acima do que qualquer modelo chinês de topo entrega em preço, mas mais competitivo frente ao Claude Fable 5 (US$ 50 por milhão de saída) e ao Sonnet 5 (US$ 10 por milhão). A Anthropic está claramente brigando pelo volume que pode escorrer para alternativas baratas quando o Qwen Thinking deixar de ser pechincha.
| Modelo | Saída antes US$/M | Saída depois US$/M | Variação |
|---|---|---|---|
| Qwen3 235B A22B Thinking 250 | 0.1 | 1.495 | +1395% |
| Qwen3 30B A3B Thinking 2507 | 0.4 | 1.56 | +290% |
| Anthropic Claude Sonnet Late | 15 | 10 | -33% |
| MiniMax M2.1 | 0.95 | 1.2 | +26% |
| Qwen3 8B | 0.4 | 0.455 | +14% |
| DeepSeek V4 Flash 0423 | 0.18 | 0.196 | +9% |
| DeepSeek V4 Flash 0423 | 0.196 | 0.18 | -8% |
| MiniMax M2 | 1 | 1.02 | +2% |
O tabuleiro depois do reajuste
Olhando o topo do mercado por inteligência medida hoje, a foto é esta: Claude Fable 5 lidera com IQ 62,073 e custa US$ 50 por milhão de saída; Claude Sonnet 5 vem logo abaixo com IQ 55,261 e US$ 10; GLM 5.2 da Z.ai aparece em terceiro com IQ 52,641 e US$ 3,036 — o chinês mais barato entre os modelos fortes. Gemini 3.1 Pro Preview e Gemini 3.5 Flash fecham o top 5 com IQ na casa de 47 e preços entre US$ 9 e US$ 12.
Para quem precisa de IQ acima de 45 sem estourar o orçamento, a régua de hoje tem três nomes: MiniMax M3 (IQ 45,397 a US$ 1,20 de saída), DeepSeek V4 Pro (IQ 45,268 a US$ 1,74) e o próprio GLM 5.2 (IQ 52,641 a US$ 3,036). Repare que o GLM paga US$ 0,60 a mais por milhão de tokens de saída para entregar cerca de 7 pontos a mais de IQ.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| Claude Fable 5 | 62.1 | 50 |
| Claude Sonnet 5 | 55.3 | 10 |
| GLM 5.2 | 52.6 | 3.036 |
| Gemini 3.1 Pro Preview | 47.7 | 12 |
| Gemini 3.5 Flash | 46.7 | 9 |
Para quem isso muda algo — e para quem não muda
Muda para quem: colocou Qwen3 Thinking em produção por causa do preço, especialmente o 235B. O custo por resposta longa multiplicou por quase 15, então a conta de julho vai exigir revisão imediata ou troca para GLM 5.2, DeepSeek V4 Pro ou Sonnet 5, dependendo do piso de qualidade que você aceita.
Muda para quem: roda Claude Sonnet Latest como padrão. O corte de 33% é dinheiro que volta sem migração. Vale rodar um teste A/B rápido para confirmar que nada no produto depende de comportamento específico da versão antiga.
Não muda para quem: já usa Claude Fable 5, Sonnet 5 ou os modelos Gemini Pro/Flash — nenhum desses foi tocado hoje. Também não muda para quem está na faixa do MiniMax M3 ou DeepSeek V4 Pro: ambos seguem com os mesmos preços de US$ 1,20 e US$ 1,74 por milhão de saída, respectivamente.
O que fazer agora
Pegue a fatura de junho, separe o gasto por modelo e calcule o impacto do reajuste do Qwen Thinking no seu caso. Se a resposta for "não cabe no orçamento", a migração natural é para o GLM 5.2 (IQ 52,6 a US$ 3,036) ou para o Sonnet 5 (IQ 55,2 a US$ 10). Se você já está no Sonnet Latest,恭喜: aproveite os 33% de corte e meça se a qualidade se mantém antes de comemorar de verdade.
Revise hoje a fatura por modelo: Qwen3 Thinking ficou quase 15x mais caro, Sonnet Latest ficou 33% mais barato, e a escolha entre GLM 5.2, Sonnet 5 e DeepSeek V4 Pro voltou a ser a decisão que define o custo do mês.
Perguntas frequentes
O Qwen3 235B A22B Thinking realmente ficou 15 vezes mais caro?
Sim, no preço de saída: foi de US$ 0,10 para US$ 1,495 por milhão de tokens, um salto de 14,95x. O preço de entrada também subiu, de US$ 0,10 para US$ 0,1495 por milhão.
Quais modelos ficaram mais baratos hoje?
Apenas três: Claude Sonnet Latest (33% mais barato em entrada e saída), DeepSeek V4 Flash (recuo de 8% após uma alta de 9% no mesmo dia) e MiniMax M2 (ajuste de 2% na saída, para US$ 1,02 por milhão).
Vale trocar o Qwen Thinking pelo GLM 5.2?
Depende do seu piso de qualidade. O GLM 5.2 custa US$ 3,036 por milhão de tokens de saída e tem IQ 52,6 medido hoje — acima do Qwen Thinking por uma larga margem em inteligência, e mais barato que o novo preço do Qwen 235B. Se o seu workload exige raciocínio forte, é a primeira alternativa a testar.