FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Qwen3 14B sobe 279,2%; Llama 3.3 70B cai 54,9%

Os preços listados no OpenRouter mudaram radicalmente em modelos médios e grandes. Enquanto o Qwen3 14B ficou quase quatro vezes mais caro, o Llama 3.3 70B ficou menos da metade do preço anterior.

Redação FalaVIP IA 4 min de leitura
US$ 0,24 → US$ 0,91preço listado por milhão de tokens do Qwen3 14B
US$ 0,71 → US$ 0,32preço listado por milhão de tokens do Llama 3.3 70B Instruct
279,2% e -54,9%variações registradas para Qwen3 14B e Llama 3.3 70B

Se você usa o Qwen3 14B em produção, o custo listado por milhão de tokens saltou de US$ 0,24 para US$ 0,91 em 3 de setembro. A alta foi de 279,2%, quase quatro vezes o preço anterior. No movimento oposto, o Meta: Llama 3.3 70B Instruct caiu de US$ 0,71 para US$ 0,32, recuo de 54,9%.

A diferença muda a escolha de modelo sem que o desempenho do software tenha mudado. O preço do Qwen3 14B ficou mais próximo de opções que antes ocupavam uma faixa superior, enquanto o Llama 3.3 70B passou a custar menos da metade do valor anterior. Os preços são os listados no OpenRouter.

A conta virou para quem roda modelos médios

O Qwen3 14B é o caso mais agressivo do dia entre os ajustes registrados. Uma aplicação que manteve o mesmo volume de chamadas e trocou o preço antigo pelo novo passou a considerar uma tarifa quase quatro vezes maior no planejamento de produção. Isso afeta especialmente serviços com alto volume, respostas longas ou pouca margem para repassar custo ao cliente.

O Llama 3.3 70B segue a direção contrária. A redução de 54,9% pode abrir espaço para usar um modelo maior em fluxos que antes precisavam de limites rígidos de tokens. Mas preço menor não elimina a necessidade de testar qualidade, latência, disponibilidade e comportamento em tarefas específicas. O ajuste, sozinho, não informa se a resposta melhorou ou piorou.

Para quem mantém uma camada de roteamento, a mudança é prática: o modelo que parecia barato pode deixar de ser a opção padrão, e o que parecia caro pode voltar ao conjunto de candidatos. Para quem hospeda os modelos por conta própria, esses preços de API não mudam diretamente a fatura de infraestrutura.

Não houve apenas alta

O OpenRouter registrou 20 mudanças de preço na janela de um dia. Além do Qwen3 14B, o Gemini 3.7 Flash (batch) dobrou de US$ 0,938 para US$ 1,875. O DeepSeek V4 Flash Vision Exp aparece com uma alta de 100%, de US$ 0,66 para US$ 1,32, e também com uma redução de 50%, de US$ 1,32 para US$ 0,66, em registros do mesmo dia.

O DeepSeek V4 Pro 0813 também aparece em movimentos diferentes: uma entrada registra alta de 69%, de US$ 1,98 para US$ 3,346, enquanto outra registra queda de 40,8%, de US$ 3,346 para US$ 1,98. O Tencent Hy3 tem registros de alta de 60% e queda de 37,5%, com valores entre US$ 0,33 e US$ 0,528.

Essas reversões tornam perigoso tomar uma decisão com base em uma única leitura de preço. Antes de alterar uma rota de produção, você precisa conferir qual tarifa está ativa para o identificador usado pela aplicação e observar se há variantes, como batch.

Os lançamentos aumentam a pressão competitiva

Dois modelos lançados em 2 de setembro chegaram com janela de contexto de 1.048.576 tokens: Meta: Muse Spark 1.3 e Google: Gemini 3.8 Flash. O Muse Spark 1.3 custa US$ 1,25 por milhão de tokens de entrada e US$ 4,25 por milhão de saída. O Gemini 3.8 Flash custa US$ 0,75 na entrada e US$ 3,75 na saída.

As notas do Artificial Analysis colocam o Muse Spark 1.3 com índice de inteligência de 60,8, nota de código de 76,45 e nota agêntica de 56,052. O Gemini 3.8 Flash aparece com 58,7 em inteligência, 76,29 em código e 49,999 em tarefas agênticas. Portanto, a comparação não é apenas entre o preço antigo e o novo: há alternativas recentes, mas elas têm estruturas de entrada e saída diferentes.

Também existem variantes mais baratas. O Muse Spark 1.3 Contributor custa US$ 0,10 na entrada e US$ 0,20 na saída. O Gemini 3.8 Flash em batch custa US$ 0,375 na entrada e US$ 1,875 na saída. Nenhuma dessas variantes recebeu notas de inteligência, código ou agêntico nos registros do Artificial Analysis.

Para quem muda e para quem não muda

A mudança é relevante para você se a aplicação chama Qwen3 14B ou Llama 3.3 70B por API, usa roteamento automático ou opera com orçamento sensível a variações diárias. Também interessa a quem processa tarefas em lote, porque o Gemini 3.8 Flash batch tem preço próprio e porque outros modelos batch também mudaram.

Para quem usa exclusivamente o Muse Spark 1.3, o Gemini 3.8 Flash ou modelos sem alteração na lista, o ajuste do Qwen e do Llama não muda a tarifa diretamente. Para quem roda modelos localmente, a variação no OpenRouter também não altera o custo de hardware, energia ou hospedagem.

Na prática, a decisão agora é revisar o roteador e a projeção de custo: mantenha o Llama 3.3 70B como candidato de economia, trate o Qwen3 14B como uma opção que exige nova validação financeira e confirme a tarifa ativa antes de liberar tráfego significativo.

Em uma frase

Se sua produção usa Qwen3 14B ou Llama 3.3 70B, revise hoje o roteamento e a previsão de gastos, porque a diferença de preço pode alterar completamente a opção mais econômica.

Perguntas frequentes

Quanto subiu o preço do Qwen3 14B no OpenRouter?

O preço listado passou de US$ 0,24 para US$ 0,91 por milhão de tokens. A variação registrada foi de 279,2% em 3 de setembro de 2026.

O Llama 3.3 70B ficou mais barato na API?

Sim. O preço listado do Meta: Llama 3.3 70B Instruct caiu de US$ 0,71 para US$ 0,32 por milhão de tokens, uma redução de 54,9%.

Leia também