FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Qwen3 Next 80B estreou ontem e já perde do gpt-oss-120b em preço e IQ

Mesmo na corrida do open-weight, a conta fecha a favor da OpenAI: o gpt-oss-120b custa US$ 0,17 por milhão de tokens de saída e pontua mais em raciocínio, código e agentic.

Redação FalaVIP IA 3 min de leitura
US$ 0,17por milhão de tokens de saída no gpt-oss-120b
7xmais caro no Qwen3 Next para o mesmo volume de saída
262.144tokens de contexto no Qwen3, o dobro do gpt-oss-120b

O Qwen3 Next 80B A3B Thinking entrou no catálogo ontem, dia 11 de setembro. Um dia depois, a conta da API já entrega o veredito: o gpt-oss-120b, lançado em 5 de agosto, custa US$ 0,17 por milhão de tokens de saída — o Qwen3 Next cobra US$ 1,20 pelo mesmo volume. São sete vezes mais caro para entregar um índice de inteligência menor.

Preço de saída (US$ por milhão de tokens)
gpt-oss-120b0,17Qwen3 Next 80B A3B Thinking1,2US$/M
Fonte: OpenRouter

Num catálogo com mais de 227 modelos ativos hoje, vindos de 38 criadores diferentes, e com 14 novidades nos últimos 30 dias, a disputa entre dois "open weights" de raciocínio parece menor do que é. A diferença de preço é grande; a diferença de capacidade também.

A diferença em três pontuações

A disputa no papel é entre dois MoE abertos: o gpt-oss-120b ativa 5,1 bilhões de parâmetros em uma arquitetura de 117 bilhões; o Qwen3 Next ativa 3 bilhões em 80 bilhões. No teste, o que importa é o que sai do outro lado.

Índice de inteligência (Artificial Analysis)
gpt-oss-120b24,1Qwen3 Next 80B A3B Thinking16,9índice
Fonte: Artificial Analysis

Em raciocínio geral, o índice da Artificial Analysis marca 24,1 para o gpt-oss-120b e 16,9 para o Qwen3 Next — uma diferença de 43% a favor do modelo da OpenAI. Em codificação, a distância aumenta: 30,4 contra 17,4, quase 75% a mais. Em tarefas agentic, o abismo é maior ainda: 13,4 contra 2,06. O Qwen3 Next é um modelo de raciocínio, mas o gpt-oss-120b pontua mais alto nas três frentes medidas pelo catálogo.

O que o release do Qwen3 não diz

A apresentação do Qwen3 fala em "math proofs, code synthesis, debugging, logic, agentic". O preço, convenientemente, fica em segundo plano. Quando você coloca os dois lado a lado, a aritmética fica assim:

gpt-oss-120b × Qwen3 Next 80B A3B Thinking
Critériogpt-oss-120bQwen3 Next 80B A3B Thinking
Índice de inteligência24.116.9
Entrada US$/M0.0370.15
Saída US$/M0.171.2
Contexto131k262k
Pesos abertossimsim
Velocidade (tok/s)155197
Índice de código30.417.4
Índice agêntico13.42.1
  • Entrada: US$ 0,037 por milhão (gpt-oss-120b) contra US$ 0,15 (Qwen3 Next) — quatro vezes mais caro no Qwen.
  • Saída: US$ 0,17 contra US$ 1,20 — sete vezes mais caro.
  • Blended: US$ 0,2625 contra US$ 0,4125 — o Qwen cobra 57% a mais por token médio.

Para um sistema que processa, digamos, 100 milhões de tokens de saída por mês, a diferença entre os dois é de cerca de US$ 103 — e a favor do gpt-oss-120b.

Onde o Qwen3 Next contra-ataca

Não é só preço. Três pontos colocam o modelo chinês à frente em cenários específicos:

  • Janela de contexto: 262.144 tokens no Qwen3, contra 131.072 no gpt-oss-120b. Quem joga livros inteiros, bases de código longas ou transcrições de reunião no prompt tem o dobro de espaço no Qwen.
  • Velocidade bruta: 196,94 tokens por segundo no Qwen3, contra 155,22 no gpt-oss-120b. Em chamadas sensíveis a latência, isso é cerca de 27% mais rápido.
  • Knowledge cutoff: 30 de setembro de 2025 no Qwen3, contra 30 de junho de 2024 no gpt-oss-120b — quase quinze meses de informação a mais.
O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 227 modelos disponíveis no catálogo nesta data.

Para quem vale cada um (de verdade)

Escolha o gpt-oss-120b se você roda agente em produção, faz code review em massa, automatiza fluxo de suporte ou qualquer carga onde a conta da API pesa no fim do mês. Ele entrega mais raciocínio, mais código correto e mais capacidade agentic — por uma fração do preço.

Escolha o Qwen3 Next 80B A3B Thinking se o seu gargalo é a janela de contexto (documentos longos, repositórios inteiros), se a velocidade de resposta importa mais que o custo unitário, ou se você precisa de informação posterior a junho de 2024. A nota de agentic baixa sugere que ele não é a melhor escolha para workflows que dependem de tool-use pesado.

Se a sua próxima sprint envolve decidir o que servir em produção, comece pelo gpt-oss-120b. O Qwen3 Next só entra quando a janela de 131K de contexto, a latência de 155 tokens/s ou o corte de conhecimento em junho de 2024 travam a entrega — o que, para a maioria esmagadora das cargas, não é o caso.

Em uma frase

Para a maioria das cargas com agente, código ou raciocínio, gpt-oss-120b ganha do Qwen3 Next em preço, IQ e agentic — a única razão para escolher o Qwen3 é precisar de 262K de contexto, ~27% mais velocidade ou conhecimento pós-junho/2024.

Perguntas frequentes

Qual a diferença de preço entre gpt-oss-120b e Qwen3 Next 80B?

Na saída, o gpt-oss-120b custa US$ 0,17 por milhão de tokens, contra US$ 1,20 do Qwen3 Next — sete vezes mais barato. Na entrada, a diferença cai para quatro vezes (US$ 0,037 contra US$ 0,15). No preço blended, o Qwen3 cobra 57% a mais.

Qual dos dois tem mais contexto?

O Qwen3 Next 80B A3B Thinking aceita 262.144 tokens por chamada, o dobro dos 131.072 do gpt-oss-120b. Para documentos muito longos, transcrições inteiras ou repositórios completos, o Qwen3 é a escolha.

Ambos são open weights — dá para rodar localmente?

Sim, os dois publicam pesos. O gpt-oss-120b tem 117 bilhões de parâmetros totais e ativa 5,1 bilhões por passagem; o Qwen3 Next tem 80 bilhões totais e ativa 3 bilhões. Em ambos os casos, você precisa de GPUs com VRAM suficiente para servir o modelo — o que continua sendo o gargalo real do open weight em produção.

Leia também