FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GPT-4o Audio custa US$ 10 por milhão de saída e não tem nota de IQ

Modelo multimodal de áudio da OpenAI estreou em agosto sem benchmark de inteligência publicado e cobra 25 vezes mais que o o3 para gerar áudio.

Redação FalaVIP IA 3 min de leitura
US$ 10por milhão de tokens de saída do GPT-4o Audio
US$ 2,50por milhão de tokens de entrada
US$ 0,40por milhão de tokens de saída do o3, o modelo mais barato da OpenAI no topo do ranking

O áudio da OpenAI cobra 25 vezes mais que o texto

Você já viu o preço do o3 e calculou que dá para gastar pouco. Pois é: quando o mesmo laboratório te oferece áudio, a conta muda de figura. O GPT-4o Audio, listado em 15 de agosto, sai por US$ 2,50 o milhão de tokens de entrada e US$ 10 o milhão de tokens de saída. Compare com o o3, que lidera o ranking de inteligência do catálogo hoje: US$ 8 para entrar e US$ 0,40 para sair. Para cada bloco de áudio gerado, você paga 25 vezes mais do que pagaria para o modelo mais barato da própria OpenAI no topo.

A diferença não é detalhe técnico: é a fronteira entre "posso colocar isso num produto" e "isso é demo para investidor". Se o seu caso de uso é gerar voz em escala, o multiplicador de 25x aparece antes do segundo mês de fatura.

Ficha técnica — GPT-4o Audio
CampoValor
Identificadoropenai/gpt-4o-audio-preview
Criadoropenai
Preço de entradaUS$ 2.50 / M tokens
Preço de saídaUS$ 10.00 / M tokens
Janela de contexto128k
Modalidadetext+audio->text+audio

O que o modelo faz e o que ele não diz que faz

A descrição oficial é direta: o gpt-4o-audio-preview aceita áudio como entrada e devolve áudio como saída, além de texto nos dois lados. A promessa é captar nuances em gravações — sotaque, emoção, ruído de fundo — e devolver fala natural. Janela de contexto de 128 mil tokens, mesma do GPT-4o texto. Knowledge cutoff em outubro de 2023, o que já é antigo para qualquer coisa que dependa de atualidades.

O catálogo, porém, não publica índice de inteligência, nota de codificação, nota agentic nem velocidade para esse modelo. Todos esses campos estão vazios. Isso não é falha do dado: é a realidade. Você está comprando um multimodal de áudio sem referência pública de qualidade. Para texto, dá para benchmarkar contra o o3 ou contra um Llama. Para áudio, o comparativo honesto é ouvir e pagar.

Onde ele se encaixa no tabuleiro

O topo do mercado hoje, por índice de inteligência, é todo da OpenAI e da Meta: o3 (31,096), gpt-oss-120b (24,126), gpt-oss-20b (15,225), Llama 4 Maverick (14,477) e Llama 4 Scout (10,256). O GPT-4o Audio não aparece nessa lista porque não tem nota. O o3 custa US$ 0,40 por milhão de saída de texto. O Maverick, US$ 0,696. O Scout, US$ 0,30. Nenhum deles fala; nenhum deles ouve. A conta é simples: se você precisa de áudio, paga caro; se não precisa, paga barato.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
o331.18
gpt-oss-120b24.10.17
gpt-oss-20b15.20.13
Llama 4 Maverick14.50.696
Llama 4 Scout10.30.3
Entre os 220 modelos disponíveis no catálogo nesta data.

O catálogo tem 220 modelos listados hoje, vindos de 38 criadores, com 20 lançamentos nos últimos 30 dias. O GPT-4o Audio é um deles, mas é o único multimodal de áudio nativo da OpenAI no índice.

Para quem vale e para quem não muda nada

Vale para você se o seu produto precisa entender fala do mundo real — central de atendimento que transcreve e responde com voz, ferramenta de acessibilidade, app de idioma que escuta o usuário e devolve pronúncia. Nesses casos, o áudio não é enfeite: é o produto. O custo por minuto de áudio gerado é alto, mas o alternativo é montar um pipeline STT + LLM + TTS, que tem latência maior e duas contas para somar.

Não muda nada para você se o seu caso é texto puro, código ou agentes. O o3 continua sendo a referência da casa por uma fração do preço. Se você quer multimodal de imagem, o catálogo tem outras opções mais baratas. E se o que você precisa é só transcrever áudio, um Whisper dedicado custa ordens de grandeza menos.

O que fazer com isso hoje

Antes de colocar o GPT-4o Audio num fluxo de produção, meça o consumo em minutos de áudio por usuário e multiplique pelo preço de saída. Se a conta fechar, teste com prompts reais do seu domínio e compare com um pipeline montado em peças separadas. Se a conta não fechar, o modelo existe, mas não é para o seu bolso — ainda.

Em uma frase

Use o GPT-4o Audio só quando o áudio for o produto; para qualquer coisa que termine em texto, o o3 entrega mais por 25 vezes menos.

Perguntas frequentes

Quanto custa o GPT-4o Audio na API?

US$ 2,50 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, segundo o catálogo. Não há preço de cache publicado.

O GPT-4o Audio tem benchmark de inteligência?

Não. O catálogo não publica índice de IQ, nota de codificação nem velocidade para esse modelo. A avaliação de qualidade depende de teste próprio com áudio real do seu domínio.

Quando o GPT-4o Audio vale a pena em vez de um modelo de texto?

Quando o produto precisa ouvir e falar — atendimento por voz, acessibilidade, pronúncia. Para texto, código ou agentes, o o3 da própria OpenAI entrega por US$ 0,40 por milhão de tokens de saída.

Leia também