GPT-4o Audio custa US$ 10 por milhão de saída e não tem nota de IQ
Modelo multimodal de áudio da OpenAI estreou em agosto sem benchmark de inteligência publicado e cobra 25 vezes mais que o o3 para gerar áudio.
O áudio da OpenAI cobra 25 vezes mais que o texto
Você já viu o preço do o3 e calculou que dá para gastar pouco. Pois é: quando o mesmo laboratório te oferece áudio, a conta muda de figura. O GPT-4o Audio, listado em 15 de agosto, sai por US$ 2,50 o milhão de tokens de entrada e US$ 10 o milhão de tokens de saída. Compare com o o3, que lidera o ranking de inteligência do catálogo hoje: US$ 8 para entrar e US$ 0,40 para sair. Para cada bloco de áudio gerado, você paga 25 vezes mais do que pagaria para o modelo mais barato da própria OpenAI no topo.
A diferença não é detalhe técnico: é a fronteira entre "posso colocar isso num produto" e "isso é demo para investidor". Se o seu caso de uso é gerar voz em escala, o multiplicador de 25x aparece antes do segundo mês de fatura.
| Campo | Valor |
|---|---|
| Identificador | openai/gpt-4o-audio-preview |
| Criador | openai |
| Preço de entrada | US$ 2.50 / M tokens |
| Preço de saída | US$ 10.00 / M tokens |
| Janela de contexto | 128k |
| Modalidade | text+audio->text+audio |
O que o modelo faz e o que ele não diz que faz
A descrição oficial é direta: o gpt-4o-audio-preview aceita áudio como entrada e devolve áudio como saída, além de texto nos dois lados. A promessa é captar nuances em gravações — sotaque, emoção, ruído de fundo — e devolver fala natural. Janela de contexto de 128 mil tokens, mesma do GPT-4o texto. Knowledge cutoff em outubro de 2023, o que já é antigo para qualquer coisa que dependa de atualidades.
O catálogo, porém, não publica índice de inteligência, nota de codificação, nota agentic nem velocidade para esse modelo. Todos esses campos estão vazios. Isso não é falha do dado: é a realidade. Você está comprando um multimodal de áudio sem referência pública de qualidade. Para texto, dá para benchmarkar contra o o3 ou contra um Llama. Para áudio, o comparativo honesto é ouvir e pagar.
Onde ele se encaixa no tabuleiro
O topo do mercado hoje, por índice de inteligência, é todo da OpenAI e da Meta: o3 (31,096), gpt-oss-120b (24,126), gpt-oss-20b (15,225), Llama 4 Maverick (14,477) e Llama 4 Scout (10,256). O GPT-4o Audio não aparece nessa lista porque não tem nota. O o3 custa US$ 0,40 por milhão de saída de texto. O Maverick, US$ 0,696. O Scout, US$ 0,30. Nenhum deles fala; nenhum deles ouve. A conta é simples: se você precisa de áudio, paga caro; se não precisa, paga barato.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| o3 | 31.1 | 8 |
| gpt-oss-120b | 24.1 | 0.17 |
| gpt-oss-20b | 15.2 | 0.13 |
| Llama 4 Maverick | 14.5 | 0.696 |
| Llama 4 Scout | 10.3 | 0.3 |
O catálogo tem 220 modelos listados hoje, vindos de 38 criadores, com 20 lançamentos nos últimos 30 dias. O GPT-4o Audio é um deles, mas é o único multimodal de áudio nativo da OpenAI no índice.
Para quem vale e para quem não muda nada
Vale para você se o seu produto precisa entender fala do mundo real — central de atendimento que transcreve e responde com voz, ferramenta de acessibilidade, app de idioma que escuta o usuário e devolve pronúncia. Nesses casos, o áudio não é enfeite: é o produto. O custo por minuto de áudio gerado é alto, mas o alternativo é montar um pipeline STT + LLM + TTS, que tem latência maior e duas contas para somar.
Não muda nada para você se o seu caso é texto puro, código ou agentes. O o3 continua sendo a referência da casa por uma fração do preço. Se você quer multimodal de imagem, o catálogo tem outras opções mais baratas. E se o que você precisa é só transcrever áudio, um Whisper dedicado custa ordens de grandeza menos.
O que fazer com isso hoje
Antes de colocar o GPT-4o Audio num fluxo de produção, meça o consumo em minutos de áudio por usuário e multiplique pelo preço de saída. Se a conta fechar, teste com prompts reais do seu domínio e compare com um pipeline montado em peças separadas. Se a conta não fechar, o modelo existe, mas não é para o seu bolso — ainda.
Use o GPT-4o Audio só quando o áudio for o produto; para qualquer coisa que termine em texto, o o3 entrega mais por 25 vezes menos.
Perguntas frequentes
Quanto custa o GPT-4o Audio na API?
US$ 2,50 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, segundo o catálogo. Não há preço de cache publicado.
O GPT-4o Audio tem benchmark de inteligência?
Não. O catálogo não publica índice de IQ, nota de codificação nem velocidade para esse modelo. A avaliação de qualidade depende de teste próprio com áudio real do seu domínio.
Quando o GPT-4o Audio vale a pena em vez de um modelo de texto?
Quando o produto precisa ouvir e falar — atendimento por voz, acessibilidade, pronúncia. Para texto, código ou agentes, o o3 da própria OpenAI entrega por US$ 0,40 por milhão de tokens de saída.