FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Qwen3 14B salta 279% no preço de saída em um único dia

Cinco modelos da família Qwen mudaram de preço nas últimas 24 horas. NVIDIA cortou. Veja o que muda na fatura de quem gera muito texto.

Redação FalaVIP IA 3 min de leitura
US$ 0,91novo preço por milhão de tokens de saída do Qwen3 14B
3,79xmultiplicador do preço de saída do Qwen3 14B em 24 horas
US$ 1,20preço de saída por milhão de tokens do GPT-5.6 Luna, alternativa direta

Seu script rodava no Qwen3 14B porque era barato. Ontem ele custava US$ 0,24 por milhão de tokens de saída. Hoje, US$ 0,91. Em um único dia, ficou 3,79 vezes mais caro na ponta que mais consome — a geração. Se o seu produto depende de resposta longa, chatbot, agente ou código, a conta de julho vai doer.

Não é caso isolado. A Qwen reprecificou cinco modelos da família em 24 horas. O Qwen3 14B foi o mais agressivo, mas não está sozinho: o Qwen3.6 27B subiu de US$ 2,70 para US$ 3,60 no token de saída, o Qwen3 VL 30B A3B Instruct foi de US$ 0,52 para US$ 0,60, e o Qwen3 Next 80B A3B Instruct passou de US$ 1,10 para US$ 1,20. É a família inteira recebendo o mesmo tratamento.

Variação do preço de saída (%)
Qwen3 14B279Qwen3.5-27B-40Nemotron 3 Ultra-39Gemma 3 27B50Qwen3.6 27B33Qwen3 VL 30B A3B Instruct15Qwen3 Next 80B A3B Instruct9Gemma 4 31B-5%

Mas não foi só alta. O Qwen3.5-27B, que tinha saída a US$ 2,60, agora sai por US$ 1,56 — corte de 40%. O NVIDIA Nemotron 3 Ultra, gigante de 550 bilhões de parâmetros, também ficou mais barato: saída de US$ 3,60 para US$ 2,20. A leitura é direta: a Qwen está redistribuindo preços dentro do próprio catálogo, empurrando trabalho para os modelos intermediários. A pergunta para você é se o seu caso de uso consegue pular junto.

O que exatamente ficou mais caro

A diferença está no token de saída, não na entrada. O Qwen3 14B era um modelo pequeno denso — do tipo que equipes usavam para classificação, extração, RAG e respostas curtas. Nessas tarefas, o token de entrada paga a maior parte da conta. Mas se você roda um agente, um chatbot que conversa, geração de código ou resumo longo, o token de saída domina — e foi exatamente isso que subiu. A entrada também subiu (de US$ 0,12 para US$ 0,2275), mas o peso proporcional é menor.

Preços que mudaram no dia
ModeloSaída antes US$/MSaída depois US$/MVariação
Qwen3 14B0.240.91+279%
Qwen3.5-27B2.61.56-40%
Nemotron 3 Ultra3.62.2-39%
Gemma 3 27B0.30.45+50%
Qwen3.6 27B2.73.6+33%
Qwen3 VL 30B A3B Instruct0.520.6+15%
Qwen3 Next 80B A3B Instruct1.11.2+9%
Gemma 4 31B0.370.35-5%
Comparação entre duas capturas consecutivas do catálogo (2x/dia).

Vale notar o caso do Google Gemma 3 27B: entrada caiu (US$ 0,10 → US$ 0,08), mas a saída subiu (US$ 0,30 → US$ 0,45). É o oposto do 14B — fica barato para tarefas de indexação e caro para geração. Quem rodar o Gemma 3 para embeddings vai gostar; quem rodar para conteúdo vai repensar.

Onde o 14B se encaixa hoje

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
Claude Fable 562.150
GPT-5.6 Sol60.910
Kimi K359.715
GPT-5.6 Terra56.612
Grok 4.555.86
Entre os 518 modelos disponíveis no catálogo nesta data.

Olhando o topo do mercado agora, a elite segue cara e distante: Claude Fable 5 lidera com índice 62,073, seguido de GPT-5.6 Sol (60,93), Kimi K3 (59,699), GPT-5.6 Terra (56,576) e Grok 4.5 (55,759). O Qwen3 14B nunca concorreu com nenhum desses. Ele concorria na faixa de baixo custo, a mesma onde o GPT-5.6 Luna e o MiniMax M3 estacionam em US$ 1,20 por milhão de saída, e o DeepSeek V4 Pro 0423 em US$ 1,74.

Com o novo preço de US$ 0,91 para saída, o 14B perde a vantagem de preço que justificava escolhê-lo. Ele agora custa quase o mesmo que os concorrentes de baixo custo e entrega um índice de inteligência menor (o Luna, por exemplo, marca 52,318). A escolha racional muda — a menos que você dependa de uma característica específica que só ele tem, como idioma, latência ou formato de saída.

Para quem nada muda

Se sua operação roda majoritariamente nos modelos de topo (Claude Fable 5, GPT-5.6, Kimi K3, Grok 4.5), não mexeu em nada. Se você está no NVIDIA Nemotron 3 Ultra ou no Qwen3.5-27B, o caminho é o oposto — barateou. E se você nunca usou o Qwen3 14B, essa notícia é só curiosidade.

O que fazer agora

Pegue seu último mês de uso do Qwen3 14B, separe input e output, e multiplique o output pelo fator 3,79. Se a diferença for ruído, ignore. Se for relevante, compare o custo total com GPT-5.6 Luna (US$ 1,20 por milhão de saída, índice 52,318) e MiniMax M3 (US$ 1,20 por milhão, índice 45,397). A migração vale o teste sempre que a conta mensal passa de algumas centenas de dólares — e mais ainda se você descobrir que o Luna, mesmo tecnicamente mais caro no output, te dá qualidade suficiente para reduzir retries.

Em uma frase

Se você usa Qwen3 14B para gerar muito texto, refaça a conta multiplicando o output por 3,79 e compare com GPT-5.6 Luna ou MiniMax M3 — ambos na casa dos US$ 1,20 por milhão de tokens de saída.

Perguntas frequentes

Por que o Qwen3 14B ficou tão mais caro de uma hora para outra?

Não há explicação oficial nos dados de hoje — só o registro da mudança. O que dá para ler é que a Qwen reposicionou o modelo dentro do próprio catálogo, ficando mais barato no Qwen3.5-27B e mais caro no 14B, além de mexer em outros três modelos da família. O ajuste foi concentrado em 23 de julho de 2026.

Qual modelo substitui o Qwen3 14B pelo mesmo preço?

Hoje, dois modelos ficam na mesma faixa de preço de saída (US$ 1,20 por milhão): o GPT-5.6 Luna, com índice de inteligência 52,318, e o MiniMax M3, com índice 45,397. O DeepSeek V4 Pro 0423 também é alternativa barata (US$ 1,74 por milhão), mas com índice mais baixo, 45,268.

Essa mudança afeta quem usa Claude ou GPT-5?

Não. Os cinco modelos com maior índice hoje — Claude Fable 5, GPT-5.6 Sol, Kimi K3, GPT-5.6 Terra e Grok 4.5 — não tiveram alteração de preço em 23 de julho de 2026. O movimento ficou concentrado em Qwen, NVIDIA e Gemma.

Leia também