FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

Raciocínio de US$ 8 por milhão de tokens: o3 lidera um recorte de oito

O catálogo guarda 279 modelos; só oito são de raciocínio. Metade vem dos EUA, três são da NVIDIA, e o preço de saída varia 62 vezes.

Redação FalaVIP IA 4 min de leitura
62xdiferença entre o modelo de saída mais caro e o mais barato do recorte
US$ 8por milhão de tokens de saída no OpenAI o3 (o mais caro do recorte)
US$ 0,13por milhão de tokens de saída no gpt-oss-20b (o mais barato entre os que valem a conta)

Oito modelos num catálogo de 279

Dos 279 modelos que o catálogo ainda lista hoje, só oito carregam a etiqueta de raciocínio. É um recorte estreito, mas é onde mora o dinheiro: a fatura explode justamente quando o modelo começa a “pensar em voz alta” antes de responder, porque cada token de pensamento cobrado é token de saída que sai do seu bolso.

Destaques do recorte: modelos de raciocínio
ModeloCriadorInteligênciaSaída US$/MContexto
o3openai31.18200k
Claude Haiku 4.5anthropic29.95200k
gpt-oss-120bopenai24.10.17131k
Qwen3 Next 80B A3B Thinkingqwen16.91.2262k
gpt-oss-20bopenai15.20.13131k
Llama 3.3 Nemotron Super 49Bnvidia12.40.4131k
Nemotron Nano 12B 2 VLnvidia8.80.6131k
Nemotron Nano 9B V2nvidia8.70.16131k

A média do recorte é de 3,08 dólares por milhão de tokens de saída, mas a média mente: o topo é US$ 8 e a base é US$ 0,13. Isso é uma diferença de 62 vezes entre o mais caro e o mais barato do mesmo grupo funcional.

O topo é caro — e nem sempre vale

O OpenAI o3 (lançado em abril, knowledge cutoff de junho de 2024) custa US$ 2 de entrada e US$ 8 de saída por milhão de tokens. É o mais caro do recorte e também o de maior nota de inteligência: 31,096. Logo atrás vem o Claude Haiku 4.5 da Anthropic, de outubro, com IQ 29,892 e saída a US$ 5 — 37% mais barato que o o3 para entrega de inteligência quase equivalente.

Para a maioria das empresas que botam modelo em produção, esse é o ponto de decisão: a diferença entre o3 e Haiku 4.5 não justifica, em geral, pagar 60% a mais. Você só escolhe o3 quando a tarefa realmente exige aquela faixa de IQ — matemática pesada, ciência, raciocínio visual — e quando cada chamada vale o preço de um lanche.

A turma dos US$ 0,13 a US$ 0,40: onde mora o custo-benefício

Inteligência × preço no recorte
o3Claude Haiku 4.5gpt-oss-120bQwen3 Next 80B A3B Thinkinggpt-oss-20bLlama 3.3 Nemotron Super 49BNemotron Nano 12B 2 VLNemotron Nano 9B V2US$ por milhão (saída, escala log)índice de inteligência

Olha o gráfico de inteligência × preço e a história muda. O gpt-oss-20b, da própria OpenAI, é open weights, Apache 2.0, e custa US$ 0,13 de saída — 61 vezes mais barato que o o3. O IQ cai para 15,225, mas para uma tarefa média de produto isso é, na prática, dinheiro no bolso.

Mais embaixo ainda, dois modelos chamam atenção pela relação.

  • NVIDIA Llama 3.3 Nemotron Super 49B V1.5: 49B parâmetros, open weights, derivado do Llama 3.3 da Meta. Custa US$ 0,40 de entrada e US$ 0,40 de saída — preço achatado, raro no mercado. IQ 12,401, contexto de 128K.
  • NVIDIA Nemotron Nano 9B V2: 9B parâmetros, lançado em setembro, IQ 8,677, mas US$ 0,16 de saída. Velocidade de 147 tokens por segundo, bem acima da média do recorte.

Já o gpt-oss-120b (117B total, 5,1B ativos por passada) é a aposta séria da OpenAI para reasoning local: IQ 24,126 por US$ 0,17 de saída. É o melhor “banco” do recorte se você não precisa de fronteira absoluta.

Quem decide comprar o quê

Vale pagar caro: se você roda benchmark interno de matemática, código competitivo ou auditoria onde cada ponto de IQ se traduz em receita, o o3 e o Haiku 4.5 entregam onde os outros não chegam.

Vale pagar barato: se você está instrumentando um agente que faz RAG, tool calling, raciocínio encadeado sobre documentos da empresa, os modelos open weights da NVIDIA e da própria OpenAI (gpt-oss) cobrem 80% do uso por uma fração do custo.

Não muda nada para você: se o seu caso é sumarização simples, classificação ou geração de texto curto, nenhum desses modelos deveria estar na sua fila — você está pagando pela capacidade de raciocinar para uma tarefa que não raciocina.

O tabuleiro

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Qwen3 Next 80B A3B Thinking16.91.2
gpt-oss-20b15.20.13
Entre os 279 modelos disponíveis no catálogo nesta data.

Dos oito, quatro são da OpenAI ou da Anthropic, fechados, americanos. Três são da NVIDIA, todos open weights, lançados entre setembro e outubro de 2025. Um é da Qwen, chinês, open weights, o único fora do eixo EUA do recorte.

Repare: a NVIDIA não treina do zero uma família frontier, ela pisa em cima do Llama da Meta e pós-treina para raciocínio. É uma estratégia de ocupa-espaço — e funciona: três das oito vagas do recorte já são dela. A OpenAI, por outro lado, faz o movimento duplo de vender o topo (o3) e a base (gpt-oss), tentando capturar toda a faixa de preço.

A Qwen entra com o único modelo do grupo que tem conhecimento até setembro de 2025 — todo o resto do recorte trava em março ou junho de 2024. Para quem precisa de informação mais fresca, essa é uma vantagem concreta.

O que fazer com isso hoje

Se você está escolhendo modelo de raciocínio agora, a regra de bolso é: comece pelo gpt-oss-120b ou pelo Haiku 4.5. Pague o o3 só quando o benchmark interno mostrar que os dois não passam. E se o seu orçamento é apertado de verdade, o gpt-oss-20b a US$ 0,13 de saída ainda coloca o raciocínio encadeado ao alcance de qualquer protótipo.

Em uma frase

Para a maioria dos produtos, raciocínio de fronteira não se justifica: o Haiku 4.5 cobre 95% do o3 por 37% menos; o gpt-oss-120b cobre o resto por uma fração do preço.

Perguntas frequentes

Qual o modelo de raciocínio mais barato do catálogo hoje?

Entre os oito modelos de raciocínio listados, o mais barato por milhão de tokens de saída é o gpt-oss-20b, da OpenAI, a US$ 0,13 — 61 vezes mais barato que o o3. Pelo lado da entrada, o gpt-oss-20b também lidera a US$ 0,03.

OpenAI o3 ou Claude Haiku 4.5: qual escolher?

O o3 tem IQ 31,096 e custa US$ 8 de saída por milhão de tokens; o Haiku 4.5 tem IQ 29,892 e custa US$ 5. A diferença de inteligência é pequena, mas o Haiku é cerca de 37% mais barato — vale trocar, salvo em matemática pesada ou raciocínio visual.

Vale a pena usar modelo de raciocínio para tarefas simples?

Não. Modelos de raciocínio cobram todos os tokens de pensamento como tokens de saída, então uma sumarização ou classificação que não precisa “pensar” antes de responder sai mais barata e mais rápida num modelo convencional.

Leia também