Oito modelos de raciocínio custam de US$ 0,07 a US$ 3,50 por milhão de tokens
A fronteira é OpenAI e Anthropic. O melhor custo por ponto de inteligência está nos pesos abertos — e três dos oito são da NVIDIA.
Raciocínio virou prateleira curta — e cara nos topos
São 8 dos mais de 269 modelos do catálogo de hoje. Três por cento. Mas quem entra na lista de "raciocínio" entra em duas categorias bem separadas: os que custam caro, e os que custam troco.
| Modelo | Criador | Inteligência | Saída US$/M | Contexto |
|---|---|---|---|---|
| o3 | openai | 31.1 | 8 | 200k |
| Claude Haiku 4.5 | anthropic | 29.9 | 5 | 200k |
| gpt-oss-120b | openai | 24.1 | 0.17 | 131k |
| Qwen3 Next 80B A3B Thinking | qwen | 16.9 | 1.2 | 262k |
| gpt-oss-20b | openai | 15.2 | 0.13 | 131k |
| Llama 3.3 Nemotron Super 49B | nvidia | 12.4 | 0.4 | 131k |
| Nemotron Nano 12B 2 VL | nvidia | 8.8 | 0.6 | 131k |
| Nemotron Nano 9B V2 | nvidia | 8.7 | 0.16 | 131k |
"Raciocínio" aqui é um marcador explícito do catálogo: o modelo é ajustado para emitir cadeias de pensamento antes da resposta final. É o tipo de saída que ajuda em matemática, código e planejamento multi-etapa. Boa parte dos 25 modelos lançados nos últimos 30 dias entrou nesse clube.
O topo: dois modelos, duas contas salgadas
OpenAI o3 lidera em inteligência (IQ 31,096) cobrando US$ 8 por milhão de tokens de saída — ou US$ 3,50 no preço "blended", que mistura entrada, saída e cache numa média efetiva por milhão. Claude Haiku 4.5 vem logo atrás (IQ 29,892) cobrando US$ 5 de saída e US$ 2 blended.
Os dois são multimodais (texto, imagem, arquivo). Os dois são fechados. Os dois são americanos. Pagar a fronteira significa abrir mão do código-fonte e aceitar a fatura no topo — o que faz sentido quando o seu workload depende do melhor IQ absoluto e não cabe migração.
O salto de 13x vem logo depois
O terceiro colocado do recorte, gpt-oss-120b da OpenAI, já é 13 vezes mais barato que o o3 no blended: US$ 0,2625 por milhão. É peso aberto, MoE de 117 bilhões de parâmetros totais que só ativa 5,1 bilhões por passada. É justamente essa arquitetura que derruba o custo de inferência.
Em IQ por dólar, o salto é brutal: você sai de cerca de 9 IQ points por dólar (o3) para quase 92 com o gpt-oss-120b. Não é margem de negociação — é mudança de ordem de grandeza. O irmão caçula, gpt-oss-20b, vai além: cerca de 165 IQ points por dólar, o melhor do recorte inteiro.
NVIDIA domina o chão do recorte
A NVIDIA colocou três modelos no recorte, todos abertos, todos americanos, todos lançados em pouco mais de 50 dias entre setembro e outubro de 2025. É a aposta mais concentrada do recorte.
- Nemotron Super 49B V1.5: IQ 12,401, US$ 0,40 blended, foco em agente e RAG
- Nemotron Nano 12B 2 VL: IQ 8,801, US$ 0,30 blended, multimodal com vídeo incluso e arquitetura híbrida Transformer-Mamba
- Nemotron Nano 9B V2: IQ 8,677, US$ 0,07 blended — o mais barato do recorte
O Nano 9B V2 sozinho entrega cerca de 124 pontos de IQ por dólar. Não é o mais inteligente, mas é onde cada centavo rende mais raciocínio. A família inteira cabe em preços abaixo de US$ 0,50 blended.
A única voz chinesa
O Qwen3 Next 80B A3B Thinking entra como o único modelo não-americano do recorte. IQ 16,867 — acima dos três Nemotron —, US$ 0,4125 blended, contexto de 262 mil tokens, o maior da lista. Para workloads que exigem contexto muito longo, vale testar. Não supera os pesos abertos da NVIDIA em custo por ponto, mas é a alternativa chinesa real.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Qwen3 Next 80B A3B Thinking | 16.9 | 1.2 |
| gpt-oss-20b | 15.2 | 0.13 |
Para quem muda, para quem não muda
Muda a conta se você roda tarefas de raciocínio em volume, pode hospedar modelo aberto ou tem parceria com provedor de inferência, e quer sair do lock-in com OpenAI e Anthropic.
Não muda nada se você já está com API fechada e a fatura cabe — migrar para ganhar 13x de custo exige engenharia, GPU e alguém para manter a operação. Ou se você precisa do topo absoluto em IQ multimodal — o o3 ainda lidera sozinho nesse recorte, e o Haiku 4.5 vem logo atrás.
O que sobra
A conta de raciocínio em novembro de 2025 cabe em duas trilhas bem marcadas. A primeira entrega o topo da régua por preço de fronteira — útil quando o melhor IQ absoluto muda o produto. A segunda entrega de 30% a 80% do IQ do topo por 2% a 12% do custo — útil quando o orçamento manda e o ganho marginal de inteligência não se traduz em receita.
A pergunta certa não é "qual é o melhor modelo", mas "qual é o melhor dentro do meu orçamento". Se a resposta for "máximo de inteligência por dólar", gpt-oss-20b devolve cerca de 165 IQ points por dólar — o melhor do recorte. Se a resposta for "máximo absoluto, sem olhar preço", o3 continua sozinho no topo.
Raciocínio em novembro de 2025 tem dois andares: fronteira fechada cara, pesos abertos baratos. Escolha pelo orçamento, não pelo número de IQ isolado.
Perguntas frequentes
O que é um modelo de raciocínio?
É um modelo ajustado para emitir cadeias de pensamento explícitas antes da resposta final — útil para matemática, código e planejamento multi-etapa. No catálogo, essa característica aparece como reasoning: true.
Qual o modelo de raciocínio mais barato hoje?
Pelo preço blended, o NVIDIA Nemotron Nano 9B V2 lidera com US$ 0,07 por milhão de tokens. Pelo preço de saída, o gpt-oss-20b da OpenAI ganha com US$ 0,13 por milhão. Os dois são pesos abertos.
Vale a pena trocar o OpenAI o3 por um modelo aberto?
Depende do volume e da infraestrutura. O gpt-oss-120b custa cerca de 13 vezes menos no blended, mas perde em IQ absoluto (24,1 contra 31,1) e exige hospedagem ou inferência própria. Para workloads com muita saída por token, a economia pode pagar a migração em semanas.