FalaVIP IA quinta-feira, 03 de setembro de 2026
Lançamentos

GPT Audio da OpenAI entra em GA cobrando US$ 10 por milhão de saída

Primeiro modelo de áudio em disponibilidade geral da OpenAI traz decodificador reformulado. A versão Mini sai por um quarto do preço.

Redação FalaVIP IA 3 min de leitura
US$ 10por milhão de tokens de saída no GPT Audio
US$ 2,40por milhão de tokens de saída no GPT Audio Mini
128.000tokens de contexto, mesmo nas duas versões

US$ 10 por milhão de tokens de saída. É o que a OpenAI está cobrando pelo GPT Audio, o primeiro modelo de áudio em disponibilidade geral da casa. E esse número importa mais do que a parte "vozes mais naturais" do release, porque é ele que decide se você integra o modelo no atendimento automatizado agora ou deixa para o próximo trimestre.

O que o "GA" realmente esconde

A OpenAI não está partindo do zero. A descrição do modelo fala em "decodificador reformulado" e em "consistência de voz melhorada" — esse linguajar só faz sentido se já existia um decodificador anterior. O GPT Audio é a evolução de algo que já atendia clientes em versão preview. A diferença prática para quem paga a API é que agora existe SLA, preço tabelado e suporte formal: US$ 2,50 por milhão para entrar, US$ 10 por milhão para sair, com janela de contexto de 128 mil tokens.

O modelo é multimodal nos dois lados — aceita texto e áudio como entrada e devolve texto e áudio como saída. Isso destrava fluxos que a combinação Whisper + LLM textual + TTS genérico nunca entregou bem. Pense em agente que ouve o cliente numa chamada, raciocina sobre o que foi dito, consulta a base interna e responde com entonação consistente em vez do timbre metálico de sempre. Ou em apps de acessibilidade que leem em voz natural e ao mesmo tempo entendem comandos falados dentro do mesmo turno.

O Mini é onde a maioria das contas vai parar

No mesmo pacote, a OpenAI soltou o GPT Audio Mini: US$ 0,60 por milhão de tokens de entrada e US$ 2,40 por milhão de saída. É um quarto do preço do irmão maior no output. Para transcrição com resposta curta, comandos de voz no app ou atendimento que não exige voz cinematográfica, é aqui que o seu custo provavelmente vai parar — e provavelmente resolve 80% dos casos.

Os outros modelos anunciados no mesmo dia
ModeloEntrada US$/MSaída US$/MContexto
GPT Audio Mini0.62.4128k

Onde isso se encaixa no resto do catálogo

A conta de áudio não conversa direto com a conta de inteligência textual — são problemas diferentes, e o catálogo não publica benchmark de áudio comparável ao índice geral de inteligência. Mas se você olhar o que a própria OpenAI cobra em texto puro, o o3 sai por US$ 8 por milhão de tokens de output. O GPT Audio é US$ 10. Em outras palavras, a casa está cobrando mais barato pela capacidade bruta de raciocínio do que pelo áudio premium.

Preço de saída (US$ por milhão de tokens)
GPT Audio10MiMo-V2-Flash0,3o38Claude Haiku 4.55US$/M
Fonte: OpenRouter

O catálogo hoje reúne mais de 318 modelos de 48 criadores, e 9 deles foram lançados nos últimos 30 dias. O GPT Audio entra num espaço onde os índices que aparecem no topo do ranking — Xiaomi MiMo-V2-Flash, OpenAI o3, Anthropic Claude Haiku 4.5 — medem outra coisa. Não há nota pública de inteligência, codificação ou agentic para o GPT Audio; comparar 1 a 1 com os modelos textuais é comparar laranjas com amplificadores.

Para quem vale, para quem não muda nada

Vale se você precisa de voz de saída com controle de entonação e contexto longo, e está disposto a pagar US$ 10 por milhão por isso. Vale para assistentes que ouvem o cliente em tempo real e respondem com naturalidade. Vale para integrações em que Whisper + LLM textual deixava o áudio final com cara de robô, e agora você pode dispensar a etapa de TTS separada.

Não muda nada se você só transcreve áudio para texto — Whisper segue sendo a referência de custo para STT puro, e nada no anúncio da OpenAI indica que o GPT Audio substitui essa frente. Não muda nada se a sua aplicação já usa TTS de outro fornecedor que te atende bem. E não muda nada se você precisa rodar local: o GPT Audio é modelo fechado, sem pesos publicados.

Ficha técnica — GPT Audio
CampoValor
Identificadoropenai/gpt-audio
Criadoropenai
Preço de entradaUS$ 2.50 / M tokens
Preço de saídaUS$ 10.00 / M tokens
Janela de contexto128k
Modalidadetext+audio->text+audio

Se voz sintética era gargalo no seu produto, a estratégia pragmática é começar pelo Mini em produção e usar o GPT Audio cheio só como fallback para os casos em que a voz ainda soa artificial. O salto de US$ 2,40 para US$ 10 por milhão de saída é o tipo de diferença que aparece na fatura em três meses — então meça antes de migrar em massa.

Em uma frase

Comece pelo GPT Audio Mini em produção a US$ 2,40/M de saída e só escale para o GPT Audio cheio nos fluxos em que a voz do Mini ainda soar artificial; meça a conta por turno de chamada antes de assumir que a naturalidade compensa o salto de 4x no output.

Perguntas frequentes

Quanto custa o GPT Audio da OpenAI?

O GPT Audio sai por US$ 2,50 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com janela de contexto de 128 mil tokens. O GPT Audio Mini, lançado no mesmo pacote, custa US$ 0,60 de entrada e US$ 2,40 de saída por milhão de tokens.

Qual a diferença entre GPT Audio e GPT Audio Mini?

A diferença declarada é preço e, pela lógica da família, qualidade da voz. O Mini custa cerca de um quarto no output (US$ 2,40 contra US$ 10 por milhão) e tende a resolver a maior parte dos casos de atendimento; o modelo cheio fica reservado para situações em que a voz do Mini ainda soa artificial.

O GPT Audio substitui o Whisper?

Não. Whisper continua sendo a referência de custo-benefício para transcrição pura de áudio para texto. O GPT Audio é voltado a agentes completos que precisam ouvir, raciocinar e responder em voz no mesmo modelo, com entrada e saída multimodais.

Leia também