Qwen3 Next 80B estreou ontem e já perde do gpt-oss-120b em preço e IQ
Mesmo na corrida do open-weight, a conta fecha a favor da OpenAI: o gpt-oss-120b custa US$ 0,17 por milhão de tokens de saída e pontua mais em raciocínio, código e agentic.
O Qwen3 Next 80B A3B Thinking entrou no catálogo ontem, dia 11 de setembro. Um dia depois, a conta da API já entrega o veredito: o gpt-oss-120b, lançado em 5 de agosto, custa US$ 0,17 por milhão de tokens de saída — o Qwen3 Next cobra US$ 1,20 pelo mesmo volume. São sete vezes mais caro para entregar um índice de inteligência menor.
Num catálogo com mais de 227 modelos ativos hoje, vindos de 38 criadores diferentes, e com 14 novidades nos últimos 30 dias, a disputa entre dois "open weights" de raciocínio parece menor do que é. A diferença de preço é grande; a diferença de capacidade também.
A diferença em três pontuações
A disputa no papel é entre dois MoE abertos: o gpt-oss-120b ativa 5,1 bilhões de parâmetros em uma arquitetura de 117 bilhões; o Qwen3 Next ativa 3 bilhões em 80 bilhões. No teste, o que importa é o que sai do outro lado.
Em raciocínio geral, o índice da Artificial Analysis marca 24,1 para o gpt-oss-120b e 16,9 para o Qwen3 Next — uma diferença de 43% a favor do modelo da OpenAI. Em codificação, a distância aumenta: 30,4 contra 17,4, quase 75% a mais. Em tarefas agentic, o abismo é maior ainda: 13,4 contra 2,06. O Qwen3 Next é um modelo de raciocínio, mas o gpt-oss-120b pontua mais alto nas três frentes medidas pelo catálogo.
O que o release do Qwen3 não diz
A apresentação do Qwen3 fala em "math proofs, code synthesis, debugging, logic, agentic". O preço, convenientemente, fica em segundo plano. Quando você coloca os dois lado a lado, a aritmética fica assim:
| Critério | gpt-oss-120b | Qwen3 Next 80B A3B Thinking |
|---|---|---|
| Índice de inteligência | 24.1 | 16.9 |
| Entrada US$/M | 0.037 | 0.15 |
| Saída US$/M | 0.17 | 1.2 |
| Contexto | 131k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 155 | 197 |
| Índice de código | 30.4 | 17.4 |
| Índice agêntico | 13.4 | 2.1 |
- Entrada: US$ 0,037 por milhão (gpt-oss-120b) contra US$ 0,15 (Qwen3 Next) — quatro vezes mais caro no Qwen.
- Saída: US$ 0,17 contra US$ 1,20 — sete vezes mais caro.
- Blended: US$ 0,2625 contra US$ 0,4125 — o Qwen cobra 57% a mais por token médio.
Para um sistema que processa, digamos, 100 milhões de tokens de saída por mês, a diferença entre os dois é de cerca de US$ 103 — e a favor do gpt-oss-120b.
Onde o Qwen3 Next contra-ataca
Não é só preço. Três pontos colocam o modelo chinês à frente em cenários específicos:
- Janela de contexto: 262.144 tokens no Qwen3, contra 131.072 no gpt-oss-120b. Quem joga livros inteiros, bases de código longas ou transcrições de reunião no prompt tem o dobro de espaço no Qwen.
- Velocidade bruta: 196,94 tokens por segundo no Qwen3, contra 155,22 no gpt-oss-120b. Em chamadas sensíveis a latência, isso é cerca de 27% mais rápido.
- Knowledge cutoff: 30 de setembro de 2025 no Qwen3, contra 30 de junho de 2024 no gpt-oss-120b — quase quinze meses de informação a mais.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Para quem vale cada um (de verdade)
Escolha o gpt-oss-120b se você roda agente em produção, faz code review em massa, automatiza fluxo de suporte ou qualquer carga onde a conta da API pesa no fim do mês. Ele entrega mais raciocínio, mais código correto e mais capacidade agentic — por uma fração do preço.
Escolha o Qwen3 Next 80B A3B Thinking se o seu gargalo é a janela de contexto (documentos longos, repositórios inteiros), se a velocidade de resposta importa mais que o custo unitário, ou se você precisa de informação posterior a junho de 2024. A nota de agentic baixa sugere que ele não é a melhor escolha para workflows que dependem de tool-use pesado.
Se a sua próxima sprint envolve decidir o que servir em produção, comece pelo gpt-oss-120b. O Qwen3 Next só entra quando a janela de 131K de contexto, a latência de 155 tokens/s ou o corte de conhecimento em junho de 2024 travam a entrega — o que, para a maioria esmagadora das cargas, não é o caso.
Para a maioria das cargas com agente, código ou raciocínio, gpt-oss-120b ganha do Qwen3 Next em preço, IQ e agentic — a única razão para escolher o Qwen3 é precisar de 262K de contexto, ~27% mais velocidade ou conhecimento pós-junho/2024.
Perguntas frequentes
Qual a diferença de preço entre gpt-oss-120b e Qwen3 Next 80B?
Na saída, o gpt-oss-120b custa US$ 0,17 por milhão de tokens, contra US$ 1,20 do Qwen3 Next — sete vezes mais barato. Na entrada, a diferença cai para quatro vezes (US$ 0,037 contra US$ 0,15). No preço blended, o Qwen3 cobra 57% a mais.
Qual dos dois tem mais contexto?
O Qwen3 Next 80B A3B Thinking aceita 262.144 tokens por chamada, o dobro dos 131.072 do gpt-oss-120b. Para documentos muito longos, transcrições inteiras ou repositórios completos, o Qwen3 é a escolha.
Ambos são open weights — dá para rodar localmente?
Sim, os dois publicam pesos. O gpt-oss-120b tem 117 bilhões de parâmetros totais e ativa 5,1 bilhões por passagem; o Qwen3 Next tem 80 bilhões totais e ativa 3 bilhões. Em ambos os casos, você precisa de GPUs com VRAM suficiente para servir o modelo — o que continua sendo o gargalo real do open weight em produção.