FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

Por 1/47 do preço do o3: a faixa barata do catálogo tem 77 modelos

Mais de um quarto dos 281 modelos listados cobra menos de US$ 0,50 por milhão de tokens de saída. O detalhe é o que se entrega por esse preço — e por que a geografia do fornecedor já está decidida.

Redação FalaVIP IA 3 min de leitura
77modelos na faixa barata (de 281 no catálogo)
US$ 0,17por milhão de tokens de saída do gpt-oss-120b
47xdiferença de preço entre o o3 e o gpt-oss-120b

A conta da API no fim do mês pode estar sendo decidida por um recorte que muita gente ignora. Dos 281 modelos listados hoje no catálogo, 77 — mais de um em cada quatro — cobram menos de US$ 0,50 por milhão de tokens de saída. É uma faixa inteira de mercado, não um cantinho de nicho. A pergunta prática é simples: o que se entrega por esse preço, e onde a conta compensa.

O topo custa quanto, e o fundo quanto

O o3, da OpenAI, lidera o ranking de inteligência do catálogo nesta data com IQ 31,1 e preço de US$ 8 por milhão de tokens de saída. O Claude Haiku 4.5 vem logo atrás a US$ 5. Quando você desce para a faixa barata, o cenário muda de proporção: o gpt-oss-120b, também da OpenAI, cobra US$ 0,17 de saída e marca IQ 24,1. São 47 vezes mais barato que o o3, com IQ cerca de 28% menor. A razão entre capacidade e custo não é linear — e é exatamente aí que mora a decisão.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 281 modelos disponíveis no catálogo nesta data.

O ponto fora da curva é da própria OpenAI

O dado que puxa o debate é justamente o gpt-oss-120b. É open-weight, foi lançado em agosto de 2025 e roda com 117 bilhões de parâmetros totais — mas só 5,1 bilhões ficam ativos a cada passagem. É a arquitetura MoE funcionando como um restaurante com cardápio enorme onde só alguns cozinheiros entram em ação por vez. Resultado: capacidade quando precisa, custo de operação quando não.

A nota de coding dele é 30,4 e a de agentic é 13,4. Não é a elite do mercado — para isso existem os modelos do topo da tabela. Mas é o suficiente para a maior parte das chamadas de produção que lotam a fatura no fim do mês.

A geografia e a licença já estão decididas

Olhando os oito destaques da faixa barata, o que chama atenção é quem está lá. OpenAI ocupa duas posições (gpt-oss-120b e gpt-oss-20b). NVIDIA aparece duas vezes (Nemotron Super 49B e Nano 9B V2). Meta, Amazon e IBM completam a lista com Llama 4 Scout, Nova Micro 1.0, Llama 3.2 11B Vision e Granite 4.0 Micro. Todos os oito têm criador americano. Na faixa barata do catálogo, o fornecedor já está definido.

Sete dos oito são open-weight. Se você roda local, faz fine-tuning ou precisa de soberania de dados, a barreira de entrada da faixa barata é regulatória — não técnica.

Velocidade é um bônus inesperado

Um dado que costuma passar batido: o Amazon Nova Micro 1.0, a US$ 0,14 de saída, processa 261 tokens por segundo. É mais que o dobro da velocidade do gpt-oss-120b e quase sete vezes mais rápido que o Llama 3.2 11B Vision. Em pipelines onde latência importa mais que nuance — geração de descrições, respostas de FAQ, sumarização em massa — ele entrega volume que modelos maiores não alcançam.

No outro extremo, o Granite 4.0 Micro da IBM é a opção mais barata absoluta do recorte: US$ 0,017 de entrada e US$ 0,112 de saída, com IQ 1,95. É o tipo de modelo que se usa para classificar texto e gastar quase nada — não para conversar.

Inteligência × preço no recorte
gpt-oss-120bgpt-oss-20bLlama 3.3 Nemotron Super 49BLlama 4 ScoutLlama 3.3 70B InstructNemotron Nano 9B V2Nova Micro 1.0Llama 3.2 11B Vision InstrucUS$ por milhão (saída, escala log)índice de inteligência

O que se ganha e o que se perde

Para alta volumetria — classificação, RAG simples, geração de JSON, extração de entidades, chatbots de primeira linha — a faixa de hoje é uma redução imediata de 30x a 60x sobre o topo. A conta fecha.

Para coding agentic de verdade, planejamento multi-step ou análise de dados ambígua, a lacuna continua aberta. A nota de agentic do gpt-oss-20b, por exemplo, é 3,1 — é onde o modelo pequeno cobra barato porque também faz menos. A diferença não está só no preço; está no tipo de tarefa que cada faixa resolve.

Destaques do recorte: a faixa barata
ModeloCriadorInteligênciaSaída US$/MContexto
gpt-oss-120bopenai24.10.17131k
gpt-oss-20bopenai15.20.13131k
Llama 3.3 Nemotron Super 49Bnvidia12.40.4131k
Llama 4 Scoutmeta-llama10.30.31.31M
Llama 3.3 70B Instructmeta-llama9.30.32131k
Nemotron Nano 9B V2nvidia8.70.16131k
Nova Micro 1.0amazon4.40.14128k
Llama 3.2 11B Vision Instrucmeta-llama3.00.345131k

Para quem vale, e para quem não muda nada

Se a sua fatura de API é dominada por tarefas repetitivas, em alto volume, com tolerância a erro de 5-10%, a faixa de novembro de 2025 é uma economia imediata e vale migrar hoje. Se você está construindo um agente que precisa planejar, depurar código real ou navegar ambiguidade, o topo ainda é o topo — e o preço ainda é o preço. A faixa barata não fechou a distância, mas encostou o suficiente para repensar o default de produção.

Em uma frase

Rode o gpt-oss-120b como default em alto volume e reserve um modelo topo de linha só para as chamadas que realmente precisam de raciocínio profundo — a diferença de custo é de 30x a 60x.

Perguntas frequentes

Qual o modelo mais barato do catálogo hoje, entre os destaques?

É o Granite 4.0 Micro da IBM, a US$ 0,112 por milhão de tokens de saída e US$ 0,017 de entrada. Tem IQ 1,95 — serve para classificação e tarefas simples, não para raciocínio.

O gpt-oss-120b vale a pena para colocar em produção?

Para alto volume e tarefas com tolerância a erro de 5-10% — RAG, extração de entidades, JSON estruturado, chatbots de primeira linha — vale. Sai 47 vezes mais barato que o o3 e marca IQ 24,1, cerca de 77% do topo. Para coding agentic e raciocínio multi-step, o topo ainda entrega mais.

A faixa barata tem modelos open-weight?

Sim. Dos 8 modelos do recorte mostrado, 7 são open-weight — só o Amazon Nova Micro 1.0 é fechado. E todos os 8 vêm de criadores americanos (OpenAI, NVIDIA, Meta, Amazon, IBM).

Leia também