GPT Audio da OpenAI entra em GA cobrando US$ 10 por milhão de saída
Primeiro modelo de áudio em disponibilidade geral da OpenAI traz decodificador reformulado. A versão Mini sai por um quarto do preço.
US$ 10 por milhão de tokens de saída. É o que a OpenAI está cobrando pelo GPT Audio, o primeiro modelo de áudio em disponibilidade geral da casa. E esse número importa mais do que a parte "vozes mais naturais" do release, porque é ele que decide se você integra o modelo no atendimento automatizado agora ou deixa para o próximo trimestre.
O que o "GA" realmente esconde
A OpenAI não está partindo do zero. A descrição do modelo fala em "decodificador reformulado" e em "consistência de voz melhorada" — esse linguajar só faz sentido se já existia um decodificador anterior. O GPT Audio é a evolução de algo que já atendia clientes em versão preview. A diferença prática para quem paga a API é que agora existe SLA, preço tabelado e suporte formal: US$ 2,50 por milhão para entrar, US$ 10 por milhão para sair, com janela de contexto de 128 mil tokens.
O modelo é multimodal nos dois lados — aceita texto e áudio como entrada e devolve texto e áudio como saída. Isso destrava fluxos que a combinação Whisper + LLM textual + TTS genérico nunca entregou bem. Pense em agente que ouve o cliente numa chamada, raciocina sobre o que foi dito, consulta a base interna e responde com entonação consistente em vez do timbre metálico de sempre. Ou em apps de acessibilidade que leem em voz natural e ao mesmo tempo entendem comandos falados dentro do mesmo turno.
O Mini é onde a maioria das contas vai parar
No mesmo pacote, a OpenAI soltou o GPT Audio Mini: US$ 0,60 por milhão de tokens de entrada e US$ 2,40 por milhão de saída. É um quarto do preço do irmão maior no output. Para transcrição com resposta curta, comandos de voz no app ou atendimento que não exige voz cinematográfica, é aqui que o seu custo provavelmente vai parar — e provavelmente resolve 80% dos casos.
| Modelo | Entrada US$/M | Saída US$/M | Contexto |
|---|---|---|---|
| GPT Audio Mini | 0.6 | 2.4 | 128k |
Onde isso se encaixa no resto do catálogo
A conta de áudio não conversa direto com a conta de inteligência textual — são problemas diferentes, e o catálogo não publica benchmark de áudio comparável ao índice geral de inteligência. Mas se você olhar o que a própria OpenAI cobra em texto puro, o o3 sai por US$ 8 por milhão de tokens de output. O GPT Audio é US$ 10. Em outras palavras, a casa está cobrando mais barato pela capacidade bruta de raciocínio do que pelo áudio premium.
O catálogo hoje reúne mais de 318 modelos de 48 criadores, e 9 deles foram lançados nos últimos 30 dias. O GPT Audio entra num espaço onde os índices que aparecem no topo do ranking — Xiaomi MiMo-V2-Flash, OpenAI o3, Anthropic Claude Haiku 4.5 — medem outra coisa. Não há nota pública de inteligência, codificação ou agentic para o GPT Audio; comparar 1 a 1 com os modelos textuais é comparar laranjas com amplificadores.
Para quem vale, para quem não muda nada
Vale se você precisa de voz de saída com controle de entonação e contexto longo, e está disposto a pagar US$ 10 por milhão por isso. Vale para assistentes que ouvem o cliente em tempo real e respondem com naturalidade. Vale para integrações em que Whisper + LLM textual deixava o áudio final com cara de robô, e agora você pode dispensar a etapa de TTS separada.
Não muda nada se você só transcreve áudio para texto — Whisper segue sendo a referência de custo para STT puro, e nada no anúncio da OpenAI indica que o GPT Audio substitui essa frente. Não muda nada se a sua aplicação já usa TTS de outro fornecedor que te atende bem. E não muda nada se você precisa rodar local: o GPT Audio é modelo fechado, sem pesos publicados.
| Campo | Valor |
|---|---|
| Identificador | openai/gpt-audio |
| Criador | openai |
| Preço de entrada | US$ 2.50 / M tokens |
| Preço de saída | US$ 10.00 / M tokens |
| Janela de contexto | 128k |
| Modalidade | text+audio->text+audio |
Se voz sintética era gargalo no seu produto, a estratégia pragmática é começar pelo Mini em produção e usar o GPT Audio cheio só como fallback para os casos em que a voz ainda soa artificial. O salto de US$ 2,40 para US$ 10 por milhão de saída é o tipo de diferença que aparece na fatura em três meses — então meça antes de migrar em massa.
Comece pelo GPT Audio Mini em produção a US$ 2,40/M de saída e só escale para o GPT Audio cheio nos fluxos em que a voz do Mini ainda soar artificial; meça a conta por turno de chamada antes de assumir que a naturalidade compensa o salto de 4x no output.
Perguntas frequentes
Quanto custa o GPT Audio da OpenAI?
O GPT Audio sai por US$ 2,50 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com janela de contexto de 128 mil tokens. O GPT Audio Mini, lançado no mesmo pacote, custa US$ 0,60 de entrada e US$ 2,40 de saída por milhão de tokens.
Qual a diferença entre GPT Audio e GPT Audio Mini?
A diferença declarada é preço e, pela lógica da família, qualidade da voz. O Mini custa cerca de um quarto no output (US$ 2,40 contra US$ 10 por milhão) e tende a resolver a maior parte dos casos de atendimento; o modelo cheio fica reservado para situações em que a voz do Mini ainda soa artificial.
O GPT Audio substitui o Whisper?
Não. Whisper continua sendo a referência de custo-benefício para transcrição pura de áudio para texto. O GPT Audio é voltado a agentes completos que precisam ouvir, raciocinar e responder em voz no mesmo modelo, com entrada e saída multimodais.