gpt-oss-20b custa 8,5 vezes menos que o Qwen3 Next 80B Instruct
Dois modelos abertos com MoE. A diferença mora no preço, na janela de contexto e em quem pensa antes de responder.
Oito vezes e meia no token de saída
A conta chega em milissegundos. O gpt-oss-20b cobra US$ 0,13 por milhão de tokens de saída. O Qwen3 Next 80B A3B Instruct cobra US$ 1,10 pela mesma unidade. São 8,5 vezes a mais no boleto — e isso só na linha de saída, que é onde mora a maior parte do custo de quem roda LLM em produção.
O detalhe que pouca gente nota: a versão "Instruct" do Qwen3 Next 80B é justamente a variante sem traços de raciocínio. Ela responde direto, sem aquele passo intermediário que consome tokens pensando antes de falar. Em tese, deveria ser mais barata. Não é. O cache de leitura também pesa mais no da Qwen: US$ 0,07 contra US$ 0,03 do gpt-oss-20b. Se você reaproveita prompt em chamadas sucessivas — e todo mundo faz isso — isso entra no boleto.
Quem senta onde no tabuleiro
Ambos têm pesos abertos. Os dois usam Mixture-of-Experts: pense num restaurante enorme, com 21 chefs no quadro do gpt-oss-20b e 80 no do Qwen, mas só 3 a 4 entram na cozinha a cada pedido. É essa combinação que permite despejar bilhões de parâmetros sem destruir a fatura de GPU.
Onde eles se separam de cara é na janela de contexto: o Qwen3 Next 80B A3B Instruct aguenta 262.144 tokens, o dobro dos 131.072 do gpt-oss-20b. Em velocidade, o Instruct também passa na frente: 173 tokens por segundo contra 112 do gpt-oss-20b, segundo o índice do catálogo. Se o que importa para você é resposta que chega rápido, é o Qwen.
| Critério | gpt-oss-20b | Qwen3 Next 80B A3B Instruct |
|---|---|---|
| Índice de inteligência | 15.2 | 13.8 |
| Entrada US$/M | 0.03 | 0.1 |
| Saída US$/M | 0.13 | 1.1 |
| Contexto | 131k | 262k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 113 | 173 |
| Índice de código | 20.7 | — |
| Índice agêntico | 3.1 | — |
Inteligência e código: o gpt-oss-20b leva
Aqui a história inverte. O índice de inteligência do catálogo dá 15,225 ao gpt-oss-20b e 13,754 ao Qwen Instruct — não é goleada, mas é vantagem clara no agregado. Para situar: o gpt-oss-20b é o 4º colocado, atrás do o3, do gpt-oss-120b e do Qwen3 Next 80B Thinking (outro modelo da Qwen, esse sim com traços de raciocínio). O Instruct da mesma família vem logo atrás, fora do top 5.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Em tarefas de código, a diferença abre de verdade: 20,697 para o da OpenAI, contra dado não publicado no Instruct. Em tarefas agentic — onde o modelo precisa chamar ferramentas e decidir em sequência — o gpt-oss-20b marca 3,103. O Instruct também não tem nota publicada nesse quesito.
E tem um detalhe que pesa: o gpt-oss-20b é modelo de raciocínio, ou seja, gasta tokens pensando antes de devolver a resposta final. O Qwen Instruct é justamente a versão da família Qwen3 Next 80B podada para não pensar. Para problemas que pedem cadeia de raciocínio longa — planejamento, debug, matemática — o da OpenAI chega mais longe por token gasto.
Conhecimento: 15 meses de defasagem
Knowledge cutoff do gpt-oss-20b: junho de 2024. Do Qwen3 Next 80B A3B Instruct: setembro de 2025. São 15 meses de diferença. Se o seu produto depende de eventos recentes — APIs novas, regulamentações, preços de mercado, notícias — a distância do modelo da OpenAI vira problema. O da Qwen fala até de ontem. Para RAG com base de conhecimento volátil, isso é decisivo.
Quando cada um ganha
O gpt-oss-20b ganha quando: você roda em volume, precisa de raciocínio, e cada centavo por token entra na planilha. Tarefas de código, agentes que chamam ferramentas, classificação complexa, debug de lógica. É o que entregaria para um bot de suporte que resolve problema de verdade sem te custar um rim por mês.
O Qwen3 Next 80B A3B Instruct ganha quando: você precisa enfiar 200 mil tokens de PDF em uma única chamada, quer respostas rápidas sem latência de raciocínio, e lida com conteúdo que muda toda semana. RAG pesado, sumarização de documentos grandes, chatbots de alta vazão que não toleram pensar antes de falar.
Pagar US$ 1,10 por milhão de tokens de saída em troca de contexto 2x maior e 54% mais velocidade não é absurdo — é uma escolha de arquitetura. Mas não escolha achando que está pagando o mesmo preço por mais qualidade. Está pagando 8,5x mais caro por trade-offs diferentes.
Use gpt-oss-20b quando volume e raciocínio mandam na planilha; use Qwen3 Next 80B A3B Instruct quando a chamada precisa caber 262K tokens ou responder sem latência de pensamento.
Perguntas frequentes
Qual é mais barato, gpt-oss-20b ou Qwen3 Next 80B A3B Instruct?
O gpt-oss-20b. Cobra US$ 0,13 por milhão de tokens de saída contra US$ 1,10 do Instruct — 8,5 vezes menos. No preço blended (entrada + saída + cache), a vantagem também fica com o da OpenAI: US$ 0,0925 contra US$ 0,4125 por milhão.
O gpt-oss-20b é modelo de raciocínio?
Sim. Ele gasta tokens pensando antes de devolver a resposta final. O Qwen3 Next 80B A3B Instruct é justamente a variante da família Qwen3 Next 80B otimizada para responder sem esses traços de raciocínio, mirando velocidade.
Qual dos dois tem a maior janela de contexto?
O Qwen3 Next 80B A3B Instruct, com 262.144 tokens — o dobro dos 131.072 do gpt-oss-20b. É a vantagem mais clara dele em tarefas como RAG pesado e sumarização de documentos grandes.