FalaVIP IA quinta-feira, 03 de setembro de 2026
Preços

75 modelos abaixo de US$ 0,40: o que a faixa barata do catálogo entrega hoje

Mais de um quarto dos modelos do catálogo custa menos de US$ 0,40 por milhão de tokens de saída. A pergunta é quanto de inteligência você leva por esse dinheiro.

Redação FalaVIP IA 3 min de leitura
75modelos abaixo de US$ 0,40 por milhão de tokens de saída
US$ 0,17preço de saída do GPT-OSS-120B por milhão de tokens
24,126índice de inteligência do GPT-OSS-120B

O barato já não é o mesmo de antes

Você olha a fatura da API e vê um número pequeno por milhão de tokens. Aí testa o modelo e percebe que ele não acompanha o que a conta sugere. Essa é a primeira coisa que aparece quando se abre o recorte de 75 modelos abaixo de US$ 0,40 por milhão de tokens de saída no catálogo hoje: a faixa barata existe, mas não é uma faixa homogênea. Tem reasoning, tem multimodal, tem modelo de 3 bilhões de parâmetros e tem um MoE de 117B que cobra US$ 0,17 por saída.

Destaques do recorte: a faixa barata
ModeloCriadorInteligênciaSaída US$/MContexto
gpt-oss-120bopenai24.10.17131k
gpt-oss-20bopenai15.20.13131k
Llama 3.3 Nemotron Super 49Bnvidia12.40.4131k
Llama 4 Scoutmeta-llama10.30.31.31M
Llama 3.3 70B Instructmeta-llama9.30.32131k
Nemotron Nano 9B V2nvidia8.70.16131k
Nova Micro 1.0amazon4.40.14128k
Llama 3.2 11B Vision Instrucmeta-llama3.00.345131k

O que está no topo da faixa barata

O modelo mais inteligente do recorte é o GPT-OSS-120B, da OpenAI, lançado em agosto. Ele cobra US$ 0,037 por entrada e US$ 0,17 por saída por milhão de tokens, com 128K de contexto, raciocínio ativado e pesos abertos. No índice de inteligência atual, marca 24,126 — acima de modelos como Qwen3 Next 80B A3B Thinking (16,867) e GPT-OSS-20B (15,225), que aparece logo abaixo com US$ 0,13 de saída. Em outras palavras: o topo da faixa barata hoje é um modelo da OpenAI que custa menos de um quinto do preço de saída do o3, que lidera o catálogo inteiro com 31,096.

Imediatamente atrás vem o GPT-OSS-20B, mesmo criador, mesma data, mesma arquitetura MoE com 3,6B ativos. É a versão mais enxuta da família, e o preço cai para US$ 0,03 de entrada e US$ 0,13 de saída. A diferença de inteligência entre os dois (24,126 contra 15,225) é grande, mas a diferença de preço é pequena — então a conta é: vale pagar US$ 0,04 a mais por saída para subir quase 9 pontos de IQ?

Inteligência × preço no recorte
gpt-oss-120bgpt-oss-20bLlama 3.3 Nemotron Super 49BLlama 4 ScoutLlama 3.3 70B InstructNemotron Nano 9B V2Nova Micro 1.0Llama 3.2 11B Vision InstrucUS$ por milhão (saída, escala log)índice de inteligência

Onde o barato começa a ficar barato de verdade

Descendo a tabela, o Llama 4 Scout, da Meta, entra com US$ 0,30 de saída, multimodal (aceita imagem), contexto de 1,3 milhão de tokens e 17B parâmetros ativos em 109B totais. É o único do recorte com esse tamanho de contexto. O preço não é o mais baixo do grupo, mas a combinação de multimodal + contexto gigante + US$ 0,30 coloca ele numa categoria própria: não é o mais barato, é o mais flexível por esse dinheiro.

Depois dele, dois modelos da NVIDIA: o Nemotron Nano 9B V2 (US$ 0,16 de saída, raciocínio, 128K) e o Llama 3.3 Nemotron Super 49B V1.5 (US$ 0,40, raciocínio, 128K, lançado em outubro). O Nano é a aposta de velocidade da faixa — 147 tokens por segundo. O Super é o mais caro do recorte e também o mais lento.

Atrás deles, três modelos que custam pouco mas entregam pouco: Amazon Nova Micro 1.0 (US$ 0,14 de saída, 4,416 de IQ, o mais rápido do recorte a 261 tokens/s), Llama 3.2 11B Vision Instruct (US$ 0,345, multimodal, IQ 2,952) e Granite 4.0 Micro, da IBM, lançado em outubro, com US$ 0,112 de saída e IQ de 1,952 — o mais barato do recorte, mas também o de menor índice.

Para quem isso vale e para quem não muda nada

Se você roda volume — classificação, extração, RAG simples, geração de rascunho, agentes baratos — a faixa entrega opções reais. O GPT-OSS-120B, em particular, é o caso em que o marketing e a conta batem perto: reasoning, 128K, IQ acima de 20, e ainda assim US$ 0,17 por saída. O Granite 4.0 Micro e o Nova Micro são casos de uso específicos: tarefas onde velocidade e preço importam mais do que capacidade de raciocínio.

Se você precisa do topo absoluto do catálogo — o o3, o Claude Haiku 4.5, raciocínio pesado, agentic de verdade — nenhum modelo abaixo de US$ 0,40 entrega isso hoje. O recorte barato não é onde mora a inteligência máxima; é onde mora o volume sustentável.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 269 modelos disponíveis no catálogo nesta data.

O que fazer com isso

Comece pelo GPT-OSS-120B como default barato. Se o caso de uso for multimodal ou exigir contexto longo, troque para o Llama 4 Scout. Se for tarefa de baixa complexidade e alta frequência, desça para Nova Micro ou Granite 4.0 Micro. E meça: a diferença entre US$ 0,13 e US$ 0,17 por milhão de tokens é pequena por chamada, mas multiplica por volume.

Em uma frase

Na faixa abaixo de US$ 0,40, o GPT-OSS-120B é o padrão de fato: reasoning, 128K e IQ 24 por US$ 0,17 de saída — use-o como default e só troque quando multimodal, contexto longo ou velocidade extrema pedirem.

Perguntas frequentes

Qual é o modelo mais barato do catálogo hoje?

Dentro do recorte abaixo de US$ 0,40 por milhão de tokens de saída, o mais barato é o Granite 4.0 Micro, da IBM, a US$ 0,112 por saída. O mais barato com reasoning ativado é o GPT-OSS-20B, a US$ 0,13.

Modelos baratos valem para agentes e raciocínio?

O GPT-OSS-120B é o único do recorte com índice de agentic acima de 10 (13,425) e reasoning ativado. Para tarefas agentic pesadas, porém, o topo do catálogo (o3, Claude Haiku 4.5) segue fora dessa faixa.

Por que o Llama 4 Scout custa mais que outros modelos do recorte?

Ele é multimodal (aceita imagem) e tem 1,3 milhão de tokens de contexto — dez vezes mais que os demais do recorte. O preço de US$ 0,30 por saída reflete esse diferencial, não a contagem de parâmetros.

Leia também