Por 1/47 do preço do o3: a faixa barata do catálogo tem 77 modelos
Mais de um quarto dos 281 modelos listados cobra menos de US$ 0,50 por milhão de tokens de saída. O detalhe é o que se entrega por esse preço — e por que a geografia do fornecedor já está decidida.
A conta da API no fim do mês pode estar sendo decidida por um recorte que muita gente ignora. Dos 281 modelos listados hoje no catálogo, 77 — mais de um em cada quatro — cobram menos de US$ 0,50 por milhão de tokens de saída. É uma faixa inteira de mercado, não um cantinho de nicho. A pergunta prática é simples: o que se entrega por esse preço, e onde a conta compensa.
O topo custa quanto, e o fundo quanto
O o3, da OpenAI, lidera o ranking de inteligência do catálogo nesta data com IQ 31,1 e preço de US$ 8 por milhão de tokens de saída. O Claude Haiku 4.5 vem logo atrás a US$ 5. Quando você desce para a faixa barata, o cenário muda de proporção: o gpt-oss-120b, também da OpenAI, cobra US$ 0,17 de saída e marca IQ 24,1. São 47 vezes mais barato que o o3, com IQ cerca de 28% menor. A razão entre capacidade e custo não é linear — e é exatamente aí que mora a decisão.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
O ponto fora da curva é da própria OpenAI
O dado que puxa o debate é justamente o gpt-oss-120b. É open-weight, foi lançado em agosto de 2025 e roda com 117 bilhões de parâmetros totais — mas só 5,1 bilhões ficam ativos a cada passagem. É a arquitetura MoE funcionando como um restaurante com cardápio enorme onde só alguns cozinheiros entram em ação por vez. Resultado: capacidade quando precisa, custo de operação quando não.
A nota de coding dele é 30,4 e a de agentic é 13,4. Não é a elite do mercado — para isso existem os modelos do topo da tabela. Mas é o suficiente para a maior parte das chamadas de produção que lotam a fatura no fim do mês.
A geografia e a licença já estão decididas
Olhando os oito destaques da faixa barata, o que chama atenção é quem está lá. OpenAI ocupa duas posições (gpt-oss-120b e gpt-oss-20b). NVIDIA aparece duas vezes (Nemotron Super 49B e Nano 9B V2). Meta, Amazon e IBM completam a lista com Llama 4 Scout, Nova Micro 1.0, Llama 3.2 11B Vision e Granite 4.0 Micro. Todos os oito têm criador americano. Na faixa barata do catálogo, o fornecedor já está definido.
Sete dos oito são open-weight. Se você roda local, faz fine-tuning ou precisa de soberania de dados, a barreira de entrada da faixa barata é regulatória — não técnica.
Velocidade é um bônus inesperado
Um dado que costuma passar batido: o Amazon Nova Micro 1.0, a US$ 0,14 de saída, processa 261 tokens por segundo. É mais que o dobro da velocidade do gpt-oss-120b e quase sete vezes mais rápido que o Llama 3.2 11B Vision. Em pipelines onde latência importa mais que nuance — geração de descrições, respostas de FAQ, sumarização em massa — ele entrega volume que modelos maiores não alcançam.
No outro extremo, o Granite 4.0 Micro da IBM é a opção mais barata absoluta do recorte: US$ 0,017 de entrada e US$ 0,112 de saída, com IQ 1,95. É o tipo de modelo que se usa para classificar texto e gastar quase nada — não para conversar.
O que se ganha e o que se perde
Para alta volumetria — classificação, RAG simples, geração de JSON, extração de entidades, chatbots de primeira linha — a faixa de hoje é uma redução imediata de 30x a 60x sobre o topo. A conta fecha.
Para coding agentic de verdade, planejamento multi-step ou análise de dados ambígua, a lacuna continua aberta. A nota de agentic do gpt-oss-20b, por exemplo, é 3,1 — é onde o modelo pequeno cobra barato porque também faz menos. A diferença não está só no preço; está no tipo de tarefa que cada faixa resolve.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Llama 3.3 Nemotron Super 49B | nvidia | 12.4 | 0.4 | 131k |
| Llama 4 Scout | meta-llama | 10.3 | 0.3 | 1.31M |
| Llama 3.3 70B Instruct | meta-llama | 9.3 | 0.32 | 131k |
| Nemotron Nano 9B V2 | nvidia | 8.7 | 0.16 | 131k |
| Nova Micro 1.0 | amazon | 4.4 | 0.14 | 128k |
| Llama 3.2 11B Vision Instruc | meta-llama | 3.0 | 0.345 | 131k |
Para quem vale, e para quem não muda nada
Se a sua fatura de API é dominada por tarefas repetitivas, em alto volume, com tolerância a erro de 5-10%, a faixa de novembro de 2025 é uma economia imediata e vale migrar hoje. Se você está construindo um agente que precisa planejar, depurar código real ou navegar ambiguidade, o topo ainda é o topo — e o preço ainda é o preço. A faixa barata não fechou a distância, mas encostou o suficiente para repensar o default de produção.
Rode o gpt-oss-120b como default em alto volume e reserve um modelo topo de linha só para as chamadas que realmente precisam de raciocínio profundo — a diferença de custo é de 30x a 60x.
Perguntas frequentes
Qual o modelo mais barato do catálogo hoje, entre os destaques?
É o Granite 4.0 Micro da IBM, a US$ 0,112 por milhão de tokens de saída e US$ 0,017 de entrada. Tem IQ 1,95 — serve para classificação e tarefas simples, não para raciocínio.
O gpt-oss-120b vale a pena para colocar em produção?
Para alto volume e tarefas com tolerância a erro de 5-10% — RAG, extração de entidades, JSON estruturado, chatbots de primeira linha — vale. Sai 47 vezes mais barato que o o3 e marca IQ 24,1, cerca de 77% do topo. Para coding agentic e raciocínio multi-step, o topo ainda entrega mais.
A faixa barata tem modelos open-weight?
Sim. Dos 8 modelos do recorte mostrado, 7 são open-weight — só o Amazon Nova Micro 1.0 é fechado. E todos os 8 vêm de criadores americanos (OpenAI, NVIDIA, Meta, Amazon, IBM).