FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

gpt-oss-20b custa 8,5 vezes menos que o Qwen3 Next 80B Instruct

Dois modelos abertos com MoE. A diferença mora no preço, na janela de contexto e em quem pensa antes de responder.

Redação FalaVIP IA 3 min de leitura
US$ 0,13por milhão de tokens de saída no gpt-oss-20b
US$ 1,10por milhão de tokens de saída no Qwen3 Next 80B Instruct
262.144 tokensde contexto no Qwen, o dobro do gpt-oss-20b

Oito vezes e meia no token de saída

A conta chega em milissegundos. O gpt-oss-20b cobra US$ 0,13 por milhão de tokens de saída. O Qwen3 Next 80B A3B Instruct cobra US$ 1,10 pela mesma unidade. São 8,5 vezes a mais no boleto — e isso só na linha de saída, que é onde mora a maior parte do custo de quem roda LLM em produção.

Preço de saída (US$ por milhão de tokens)
gpt-oss-20b0,13Qwen3 Next 80B A3B Instruct1,1US$/M
Fonte: OpenRouter

O detalhe que pouca gente nota: a versão "Instruct" do Qwen3 Next 80B é justamente a variante sem traços de raciocínio. Ela responde direto, sem aquele passo intermediário que consome tokens pensando antes de falar. Em tese, deveria ser mais barata. Não é. O cache de leitura também pesa mais no da Qwen: US$ 0,07 contra US$ 0,03 do gpt-oss-20b. Se você reaproveita prompt em chamadas sucessivas — e todo mundo faz isso — isso entra no boleto.

Quem senta onde no tabuleiro

Ambos têm pesos abertos. Os dois usam Mixture-of-Experts: pense num restaurante enorme, com 21 chefs no quadro do gpt-oss-20b e 80 no do Qwen, mas só 3 a 4 entram na cozinha a cada pedido. É essa combinação que permite despejar bilhões de parâmetros sem destruir a fatura de GPU.

Onde eles se separam de cara é na janela de contexto: o Qwen3 Next 80B A3B Instruct aguenta 262.144 tokens, o dobro dos 131.072 do gpt-oss-20b. Em velocidade, o Instruct também passa na frente: 173 tokens por segundo contra 112 do gpt-oss-20b, segundo o índice do catálogo. Se o que importa para você é resposta que chega rápido, é o Qwen.

gpt-oss-20b × Qwen3 Next 80B A3B Instruct
Critériogpt-oss-20bQwen3 Next 80B A3B Instruct
Índice de inteligência15.213.8
Entrada US$/M0.030.1
Saída US$/M0.131.1
Contexto131k262k
Pesos abertossimsim
Velocidade (tok/s)113173
Índice de código20.7
Índice agêntico3.1

Inteligência e código: o gpt-oss-20b leva

Aqui a história inverte. O índice de inteligência do catálogo dá 15,225 ao gpt-oss-20b e 13,754 ao Qwen Instruct — não é goleada, mas é vantagem clara no agregado. Para situar: o gpt-oss-20b é o 4º colocado, atrás do o3, do gpt-oss-120b e do Qwen3 Next 80B Thinking (outro modelo da Qwen, esse sim com traços de raciocínio). O Instruct da mesma família vem logo atrás, fora do top 5.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Entre os 237 modelos disponíveis no catálogo nesta data.

Em tarefas de código, a diferença abre de verdade: 20,697 para o da OpenAI, contra dado não publicado no Instruct. Em tarefas agentic — onde o modelo precisa chamar ferramentas e decidir em sequência — o gpt-oss-20b marca 3,103. O Instruct também não tem nota publicada nesse quesito.

E tem um detalhe que pesa: o gpt-oss-20b é modelo de raciocínio, ou seja, gasta tokens pensando antes de devolver a resposta final. O Qwen Instruct é justamente a versão da família Qwen3 Next 80B podada para não pensar. Para problemas que pedem cadeia de raciocínio longa — planejamento, debug, matemática — o da OpenAI chega mais longe por token gasto.

Conhecimento: 15 meses de defasagem

Knowledge cutoff do gpt-oss-20b: junho de 2024. Do Qwen3 Next 80B A3B Instruct: setembro de 2025. São 15 meses de diferença. Se o seu produto depende de eventos recentes — APIs novas, regulamentações, preços de mercado, notícias — a distância do modelo da OpenAI vira problema. O da Qwen fala até de ontem. Para RAG com base de conhecimento volátil, isso é decisivo.

Quando cada um ganha

O gpt-oss-20b ganha quando: você roda em volume, precisa de raciocínio, e cada centavo por token entra na planilha. Tarefas de código, agentes que chamam ferramentas, classificação complexa, debug de lógica. É o que entregaria para um bot de suporte que resolve problema de verdade sem te custar um rim por mês.

O Qwen3 Next 80B A3B Instruct ganha quando: você precisa enfiar 200 mil tokens de PDF em uma única chamada, quer respostas rápidas sem latência de raciocínio, e lida com conteúdo que muda toda semana. RAG pesado, sumarização de documentos grandes, chatbots de alta vazão que não toleram pensar antes de falar.

Pagar US$ 1,10 por milhão de tokens de saída em troca de contexto 2x maior e 54% mais velocidade não é absurdo — é uma escolha de arquitetura. Mas não escolha achando que está pagando o mesmo preço por mais qualidade. Está pagando 8,5x mais caro por trade-offs diferentes.

Em uma frase

Use gpt-oss-20b quando volume e raciocínio mandam na planilha; use Qwen3 Next 80B A3B Instruct quando a chamada precisa caber 262K tokens ou responder sem latência de pensamento.

Perguntas frequentes

Qual é mais barato, gpt-oss-20b ou Qwen3 Next 80B A3B Instruct?

O gpt-oss-20b. Cobra US$ 0,13 por milhão de tokens de saída contra US$ 1,10 do Instruct — 8,5 vezes menos. No preço blended (entrada + saída + cache), a vantagem também fica com o da OpenAI: US$ 0,0925 contra US$ 0,4125 por milhão.

O gpt-oss-20b é modelo de raciocínio?

Sim. Ele gasta tokens pensando antes de devolver a resposta final. O Qwen3 Next 80B A3B Instruct é justamente a variante da família Qwen3 Next 80B otimizada para responder sem esses traços de raciocínio, mirando velocidade.

Qual dos dois tem a maior janela de contexto?

O Qwen3 Next 80B A3B Instruct, com 262.144 tokens — o dobro dos 131.072 do gpt-oss-20b. É a vantagem mais clara dele em tarefas como RAG pesado e sumarização de documentos grandes.

Leia também