FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Oito modelos de raciocínio custam de US$ 0,07 a US$ 3,50 por milhão de tokens

A fronteira é OpenAI e Anthropic. O melhor custo por ponto de inteligência está nos pesos abertos — e três dos oito são da NVIDIA.

Redação FalaVIP IA 3 min de leitura
US$ 3,50por milhão de tokens no preço blended do OpenAI o3
US$ 0,07por milhão de tokens no preço blended do Nemotron Nano 9B V2
13xrazão entre o3 e gpt-oss-120b no preço blended

Raciocínio virou prateleira curta — e cara nos topos

São 8 dos mais de 269 modelos do catálogo de hoje. Três por cento. Mas quem entra na lista de "raciocínio" entra em duas categorias bem separadas: os que custam caro, e os que custam troco.

Destaques do recorte: modelos de raciocínio
ModeloCriadorInteligênciaSaída US$/MContexto
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
gpt-oss-120bopenai24.10.17131k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
gpt-oss-20bopenai15.20.13131k
Llama 3.3 Nemotron Super 49Bnvidia12.40.4131k
Nemotron Nano 12B 2 VLnvidia8.80.6131k
Nemotron Nano 9B V2nvidia8.70.16131k

"Raciocínio" aqui é um marcador explícito do catálogo: o modelo é ajustado para emitir cadeias de pensamento antes da resposta final. É o tipo de saída que ajuda em matemática, código e planejamento multi-etapa. Boa parte dos 25 modelos lançados nos últimos 30 dias entrou nesse clube.

O topo: dois modelos, duas contas salgadas

OpenAI o3 lidera em inteligência (IQ 31,096) cobrando US$ 8 por milhão de tokens de saída — ou US$ 3,50 no preço "blended", que mistura entrada, saída e cache numa média efetiva por milhão. Claude Haiku 4.5 vem logo atrás (IQ 29,892) cobrando US$ 5 de saída e US$ 2 blended.

Os dois são multimodais (texto, imagem, arquivo). Os dois são fechados. Os dois são americanos. Pagar a fronteira significa abrir mão do código-fonte e aceitar a fatura no topo — o que faz sentido quando o seu workload depende do melhor IQ absoluto e não cabe migração.

O salto de 13x vem logo depois

O terceiro colocado do recorte, gpt-oss-120b da OpenAI, já é 13 vezes mais barato que o o3 no blended: US$ 0,2625 por milhão. É peso aberto, MoE de 117 bilhões de parâmetros totais que só ativa 5,1 bilhões por passada. É justamente essa arquitetura que derruba o custo de inferência.

Inteligência × preço no recorte
o3Claude Haiku 4.5gpt-oss-120bQwen3 Next 80B A3B Thinkinggpt-oss-20bLlama 3.3 Nemotron Super 49BNemotron Nano 12B 2 VLNemotron Nano 9B V2US$ por milhão (saída, escala log)índice de inteligência

Em IQ por dólar, o salto é brutal: você sai de cerca de 9 IQ points por dólar (o3) para quase 92 com o gpt-oss-120b. Não é margem de negociação — é mudança de ordem de grandeza. O irmão caçula, gpt-oss-20b, vai além: cerca de 165 IQ points por dólar, o melhor do recorte inteiro.

NVIDIA domina o chão do recorte

A NVIDIA colocou três modelos no recorte, todos abertos, todos americanos, todos lançados em pouco mais de 50 dias entre setembro e outubro de 2025. É a aposta mais concentrada do recorte.

  • Nemotron Super 49B V1.5: IQ 12,401, US$ 0,40 blended, foco em agente e RAG
  • Nemotron Nano 12B 2 VL: IQ 8,801, US$ 0,30 blended, multimodal com vídeo incluso e arquitetura híbrida Transformer-Mamba
  • Nemotron Nano 9B V2: IQ 8,677, US$ 0,07 blended — o mais barato do recorte

O Nano 9B V2 sozinho entrega cerca de 124 pontos de IQ por dólar. Não é o mais inteligente, mas é onde cada centavo rende mais raciocínio. A família inteira cabe em preços abaixo de US$ 0,50 blended.

A única voz chinesa

O Qwen3 Next 80B A3B Thinking entra como o único modelo não-americano do recorte. IQ 16,867 — acima dos três Nemotron —, US$ 0,4125 blended, contexto de 262 mil tokens, o maior da lista. Para workloads que exigem contexto muito longo, vale testar. Não supera os pesos abertos da NVIDIA em custo por ponto, mas é a alternativa chinesa real.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 269 modelos disponíveis no catálogo nesta data.

Para quem muda, para quem não muda

Muda a conta se você roda tarefas de raciocínio em volume, pode hospedar modelo aberto ou tem parceria com provedor de inferência, e quer sair do lock-in com OpenAI e Anthropic.

Não muda nada se você já está com API fechada e a fatura cabe — migrar para ganhar 13x de custo exige engenharia, GPU e alguém para manter a operação. Ou se você precisa do topo absoluto em IQ multimodal — o o3 ainda lidera sozinho nesse recorte, e o Haiku 4.5 vem logo atrás.

O que sobra

A conta de raciocínio em novembro de 2025 cabe em duas trilhas bem marcadas. A primeira entrega o topo da régua por preço de fronteira — útil quando o melhor IQ absoluto muda o produto. A segunda entrega de 30% a 80% do IQ do topo por 2% a 12% do custo — útil quando o orçamento manda e o ganho marginal de inteligência não se traduz em receita.

A pergunta certa não é "qual é o melhor modelo", mas "qual é o melhor dentro do meu orçamento". Se a resposta for "máximo de inteligência por dólar", gpt-oss-20b devolve cerca de 165 IQ points por dólar — o melhor do recorte. Se a resposta for "máximo absoluto, sem olhar preço", o3 continua sozinho no topo.

Em uma frase

Raciocínio em novembro de 2025 tem dois andares: fronteira fechada cara, pesos abertos baratos. Escolha pelo orçamento, não pelo número de IQ isolado.

Perguntas frequentes

O que é um modelo de raciocínio?

É um modelo ajustado para emitir cadeias de pensamento explícitas antes da resposta final — útil para matemática, código e planejamento multi-etapa. No catálogo, essa característica aparece como reasoning: true.

Qual o modelo de raciocínio mais barato hoje?

Pelo preço blended, o NVIDIA Nemotron Nano 9B V2 lidera com US$ 0,07 por milhão de tokens. Pelo preço de saída, o gpt-oss-20b da OpenAI ganha com US$ 0,13 por milhão. Os dois são pesos abertos.

Vale a pena trocar o OpenAI o3 por um modelo aberto?

Depende do volume e da infraestrutura. O gpt-oss-120b custa cerca de 13 vezes menos no blended, mas perde em IQ absoluto (24,1 contra 31,1) e exige hospedagem ou inferência própria. Para workloads com muita saída por token, a economia pode pagar a migração em semanas.

Leia também