Qwen3 Coder Next lidera em código, mas cobra 4,7x mais na saída
Lançado ontem pela Qwen, o modelo open-weight estreia com 36,2 em coding e contexto de 262 mil tokens — só que o gpt-oss-120b da OpenAI ainda responde por quase um quinto do preço de geração.
O lançamento de ontem e a conta de hoje
A Qwen soltou ontem um modelo que, no papel, parece feito para ofuscar o open-weight da OpenAI. O Qwen3 Coder Next estreou no catálogo com 36,2 pontos em coding — quase seis a mais que o gpt-oss-120b, que marcou 30,4. Só que esse mesmo modelo chinês chega cobrando US$ 0,80 por milhão de tokens de saída, contra US$ 0,17 do americano. Na fatura, a geração fica quase 4,7 vezes mais cara.
Antes de cravar um vencedor, vale olhar o que cada número está medindo.
Inteligência geral: inverte a favor do gpt-oss
No índice geral de inteligência medido pelo Artificial Analysis, a história muda. O gpt-oss-120b marca 24,1 contra 21,3 do Qwen3 Coder Next — quase 3 pontos de vantagem para o modelo da OpenAI, lançado em agosto de 2025 e ainda competitivo seis meses depois.
A diferença fica ainda mais feia em tarefas agentic. Quando o modelo precisa orquestrar ferramentas, navegar em etapas múltiplas e tomar decisões em sequência, o gpt-oss-120b alcança 13,4 pontos. O Qwen3 Coder Next para em 8,9. Quem está montando agente de produção que faz mais do que completar código precisa colocar isso na conta antes de trocar.
Preço de saída: onde a diferença morde
A diferença de preço é a mais fácil de explicar e a mais difícil de engolir em escala. Para cada milhão de tokens de saída, o gpt-oss-120b custa US$ 0,17 e o Qwen3 Coder Next custa US$ 0,80. Na entrada, a proporção se repete: US$ 0,037 contra US$ 0,12.
Para um sistema que gasta, digamos, 100 milhões de tokens de saída por mês em geração de código, a diferença é de US$ 63 mensais. Em 12 meses, US$ 756 que não voltam. Vale notar que o Qwen publicou preço de cache (US$ 0,07 por milhão), enquanto o gpt-oss-120b não publicou — o que significa que, em produção pesada com prompts repetidos, a economia real do chinês pode ser maior do que a tabela mostra, e a do americano, menor.
Contexto e arquitetura: a vantagem chinesa
Onde o Qwen3 Coder Next devolve o golpe é no resto da ficha técnica. Contexto de 262.144 tokens, o dobro dos 131.072 do gpt-oss-120b. Para quem trabalha com repositórios inteiros dentro de uma única janela, ou com documentação longa que precisa caber inteira no prompt, isso muda a régua do jogo.
| Critério | gpt-oss-120b | Qwen3 Coder Next |
|---|---|---|
| Índice de inteligência | 24.1 | 21.3 |
| Entrada US$/M | 0.037 | 0.12 |
| Saída US$/M | 0.17 | 0.8 |
| Contexto | 131k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 155 | 130 |
| Índice de código | 30.4 | 36.2 |
| Índice agêntico | 13.4 | 8.9 |
Em arquitetura, os dois são Mixture-of Experts com poucos parâmetros ativos por passada. O gpt-oss-120b tem 117B totais e 5,1B ativos. O Qwen3 Coder Next tem 79,7B totais e 3B ativos. Na prática, os dois rodam barato em inferência — e o americano entrega mais velocidade bruta: 155 tokens por segundo contra 129,5 do chinês. O gpt-oss-120b também é um modelo de raciocínio, enquanto o Qwen3 Coder Next não é.
Onde eles se encaixam no mercado
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Coder Next | 21.3 | 0.8 |
No ranking atual do catálogo, o gpt-oss-120b está em quarto no índice geral de inteligência, abaixo do Xiaomi MiMo-V2-Flash (34,0) e do o3 (31,1). O Qwen3 Coder Next aparece em quinto. Os dois entregam open-weights — diferentemente do Claude Haiku 4.5, que é fechado e custa cinco vezes mais na saída que o gpt-oss-120b. Hoje, o catálogo não tem nenhum modelo acima de IQ 45 publicado; o topo real está em 34.
Então, qual escolher
Se o seu gargalo é gerar código em um agente de desenvolvimento e você pode esticar a janela para 262 mil tokens, o Qwen3 Coder Next vence: melhor coding score entre os modelos abertos do catálogo, contexto generoso e a vantagem de ser lançamento de ontem, com a expectativa de iteração rápida da Qwen.
Se o seu problema é orquestração agentic, raciocínio geral ou volume mensal alto de tokens, o gpt-oss-120b ganha em quase tudo: custa quase 5 vezes menos para gerar, é mais rápido, tem IQ maior e pontua 50% a mais em agentic. Para times rodando produção contínua, a conta fecha do lado americano.
E um alerta: nenhum dos dois é o melhor modelo do mercado em inteligência bruta — o trono, hoje, pertence ao Xiaomi MiMo-V2-Flash. A disputa aqui é entre dois open-weights com perfis complementares, não pela coroa geral.
Use o Qwen3 Coder Next quando o coding score e o contexto de 262K forem o gargalo; use o gpt-oss-120b quando o que pesa é custo de geração, velocidade e raciocínio agentic em produção contínua.
Perguntas frequentes
Qual é mais barato, gpt-oss-120b ou Qwen3 Coder Next?
O gpt-oss-120b é mais barato em quase todas as métricas: US$ 0,037 por milhão de tokens de entrada e US$ 0,17 de saída, contra US$ 0,12 e US$ 0,80 do Qwen3 Coder Next. O chinês só publicou preço de cache (US$ 0,07), o que pode equilibrar a conta em workloads com prompts repetidos.
Qual tem contexto maior?
O Qwen3 Coder Next, com 262.144 tokens — o dobro dos 131.072 do gpt-oss-120b. Isso faz diferença para quem precisa colocar repositórios inteiros ou documentação longa em uma única janela.
Qual é melhor para coding agent?
Para coding agent puro, o Qwen3 Coder Next leva: 36,2 pontos contra 30,4 do gpt-oss-120b, mais o dobro de contexto. Para agente que orquestra ferramentas e toma decisões em múltiplas etapas, o gpt-oss-120b pontua 13,4 contra 8,9 e vale o preço menor.