gpt-oss-20b cobra US$ 0,13 e entrega 2x a inteligência do Command A
Comparativo frente a frente entre o modelo aberto da OpenAI e o canadense da Cohere, com 76x de diferença no preço de saída.
O contraste que aparece antes mesmo de você rodar um prompt
Em 1º de outubro de 2025, o catálogo de modelos de linguagem soma 244 opções listadas, vindas de 40 criadores diferentes. Dentro desse cardápio, dois modelos abertos chamam atenção por motivos opostos. O gpt-oss-20b, da OpenAI, custa US$ 0,13 por milhão de tokens de saída. O Command A, da Cohere, custa US$ 0,13 também. Brincadeira — custa US$ 10,00. Isso é 76,9 vezes mais caro no papel de saída. E, segundo o índice de inteligência da Artificial Analysis medido hoje, o modelo da OpenAI entrega mais que o dobro da nota do canadense.
Quanto custa, de verdade, cada token que sai
A conta que importa para quem paga API é a de saída, porque é onde mora o custo do trabalho útil — gerar código, redigir resposta, devolver JSON. O gpt-oss-20b cobra US$ 0,03 por milhão de tokens de entrada, US$ 0,03 com cache e US$ 0,13 por milhão na saída. O Command A cobra US$ 2,50 de entrada e US$ 10,00 de saída, e não publicou preço de cache.
Traduzindo o marketing: se você processa um lote de 10 milhões de tokens de saída por mês — volume modesto para um agente em produção —, a conta no gpt-oss-20b fica em US$ 1,30. No Command A, US$ 100,00. Para uma startup queimando 100 milhões de tokens de saída mensais, a diferença entre as duas faturas é de quase US$ 10 mil por mês. É o tipo de número que define se o projeto roda ou se você volta para um modelo menor.
| Critério | gpt-oss-20b | Command A |
|---|---|---|
| Índice de inteligência | 15.2 | 7.5 |
| Entrada US$/M | 0.03 | 2.5 |
| Saída US$/M | 0.13 | 10 |
| Contexto | 131k | 256k |
| Pesos abertos | sim | sim |
| Velocidade (tok/s) | 113 | 58 |
| Índice de código | 20.7 | — |
| Índice agêntico | 3.1 | — |
Inteligência não é conversa de bar: é número
O índice de inteligência medido hoje atribui 15,225 ao gpt-oss-20b e 7,463 ao Command A — uma diferença de 2,04x a favor do modelo da OpenAI. Em coding, o gpt-oss-20b marca 20,697; o Command A não publicou nota nesse recorte. Em agentic, 3,103 contra dado ausente. Quando o catálogo não informa, o honesto é dizer que não tem, e não inventar.
Para situar no tabuleiro: o topo do mercado hoje é o o3 da OpenAI, com 31,096 no índice e cobrança de US$ 8,00 por milhão na saída — ou seja, o gpt-oss-20b custa 1,6% do preço do o3 e entrega metade da inteligência medida. O Command A aparece bem abaixo disso, na faixa dos modelos abertos mais baratos.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
Tamanho, contexto e velocidade: o resto da ficha
O gpt-oss-20b é um modelo de 21 bilhões de parâmetros totais com arquitetura Mixture-of-Experts, mas só 3,6 bilhões ativos por passagem — é como um restaurante com 21 cozinheiros no quadro, mas só 3,6 cozinham ao mesmo tempo. O Command A é denso: 111 bilhões ativos em cada forward pass. Mais parâmetros geralmente significa mais memória de GPU e mais latência de inferência, e a ficha confirma: o gpt-oss-20b processa 112,6 tokens por segundo contra 58,44 do Command A.
Janela de contexto também difere: 131.072 tokens no gpt-oss-20b, 256.000 no Command A. Para resumir PDFs enormes ou alimentar agentes com históricos longos, a janela maior do canadense é uma vantagem concreta. O gpt-oss-20b, por outro lado, tem modo de raciocínio ligado; o Command A, não. Em tarefas que pedem cadeia de pensamento explícita, isso pesa.
Os dois são open weights sob Apache 2.0, então dá para rodar localmente, fazer fine-tuning ou hospedar onde quiser. O gpt-oss-20b foi lançado em 5 de agosto de 2025; o Command A, em 13 de março do mesmo ano.
Para quem cada um ganha — sem "depende"
O gpt-oss-20b ganha quando você quer o melhor equilíbrio entre custo, inteligência e velocidade em workloads de texto, com a opção de raciocínio ativado. É a escolha natural para agentes, geração de código e qualquer fluxo onde a fatura da API é variável sensível.
O Command A ganha quando você precisa de janela de contexto de 256k tokens — pipelines que ingerem documentos longos inteiros — e está disposto a pagar US$ 10 por milhão de tokens de saída por isso. Fora desse caso de uso específico, a conta não fecha frente ao concorrente.
O que você faz com isso hoje
Se você está pagando API no Command A e seu workload cabe em 131k de contexto, migre para o gpt-oss-20b e meça o índice de inteligência na sua tarefa antes de fechar a porteira — a economia é grande demais para ignorar sem testar. Se você precisa da janela de 256k, o Command A continua sendo a opção aberta com esse encaixe, e o custo é o preço que se paga por ela.
Troque Command A por gpt-oss-20b em qualquer workload que caiba em 131k de contexto; a fatura cai 76x e a inteligência medida sobe 2x.
Perguntas frequentes
gpt-oss-20b é realmente mais barato que Command A?
Sim, em todos os eixos publicados. Custa US$ 0,03 por milhão de tokens de entrada e US$ 0,13 de saída, contra US$ 2,50 e US$ 10,00 do Command A. Por 10 milhões de tokens de saída, a diferença vai de US$ 1,30 para US$ 100,00.
Qual dos dois tem a maior janela de contexto?
O Command A, com 256.000 tokens. O gpt-oss-20b suporta 131.072 tokens. Se seu pipeline depende de janelas acima de 131k, o canadense ainda é a opção aberta com esse encaixe.
Os dois modelos são mesmo open weight?
Sim, ambos publicados sob Apache 2.0. O gpt-oss-20b tem 21B de parâmetros totais com 3,6B ativos por forward pass (MoE); o Command A é denso, com 111B ativos por passagem.