FalaVIP IA quinta-feira, 03 de setembro de 2026
Análise

GPT Audio da OpenAI custa US$ 10 por milhão e só fala inglês bem

Modelo de áudio chega cinco dias depois do anúncio, com voz mais natural e preço dez vezes maior que o GPT-4o mini em texto.

Redação FalaVIP IA 3 min de leitura
US$ 10por milhão de tokens de saída
US$ 2,50por milhão de tokens de entrada
128 miltokens de contexto

Você já viu o botão de microfone no ChatGPT funcionar e pensou em colocar aquilo num produto? Pois é exatamente esse o caminho que a OpenAI abriu agora: o GPT Audio é o primeiro modelo de áudio da casa liberado como API geral, cinco dias depois do anúncio. A pergunta que interessa ao desenvolvedor não é se a voz ficou mais natural — é se vale pagar por isso.

O que mudou em relação ao áudio que você já usava

Antes do GPT Audio, quem queria voz pela OpenAI dependia do pipeline antigo: um modelo de transcrição (Whisper), um modelo de linguagem de texto e um modelo de texto-para-fala (TTS) costurado por código. Três chamadas, três contas, latência somada. O GPT Audio comprime isso num único endpoint que recebe áudio e devolve áudio — ou texto, se você preferir. A OpenAI também trocou o decodificador para uma voz mais consistente e menos robótica. Na prática, é o mesmo salto que o GPT-4o deu sobre o Whisper + TTS em 2024, só que agora vendido como produto independente.

A conta que ninguém gosta de fazer

O preço é o ponto que vai doer. Entrada de áudio custa US$ 2,50 por milhão de tokens e saída, US$ 10 por milhão. Traduzindo: se você gerar uma resposta de voz de 30 segundos, algo em torno de 400 tokens de saída, cada interação custa aproximadamente US$ 0,004 — quatro décimos de centavo. Parece barato até você multiplicar por 100 mil usuários falando cinco minutos por dia: a fatura passa de casa dos milhares de dólares mensais com facilidade.

Ficha técnica — GPT Audio
CampoValor
Identificadoropenai/gpt-audio
Criadoropenai
Preço de entradaUS$ 2.50 / M tokens
Preço de saídaUS$ 10.00 / M tokens
Janela de contexto128k
Modalidadetext+audio->text+audio

Compare com o que já está rodando na sua stack: o gpt-oss-120b, modelo aberto da própria OpenAI listado no catálogo, sai por US$ 0,17 por milhão de tokens de saída — quase sessenta vezes mais barato. É texto, não áudio, mas resolve 80% dos casos em que o usuário só queria transcrever ou responder por chat. E no topo de inteligência geral hoje, o Xiaomi MiMo-V2-Flash lidera com IQ 34 cobrando US$ 0,30 por milhão de saída, também só texto.

O topo do mercado nesta data
ModeloInteligênciaSaída US$/M
MiMo-V2-Flash34.00.3
o331.18
Claude Haiku 4.529.95
gpt-oss-120b24.10.17
Devstral 2 251219.22
Entre os 322 modelos disponíveis no catálogo nesta data.

Para quem isso vale a pena

O GPT Audio faz sentido em três cenários específicos. Primeiro, call centers e assistentes telefônicos onde a latência de três modelos em sequência mata a experiência e a voz robótica denuncia que é um bot. Segundo, aplicações de acessibilidade para pessoas com deficiência visual ou analfabetas funcionais, onde digitar não é opção. Terceiro, produtos de idioma único com voz como diferencial — pense num app de meditação, num simulador de entrevista, num jogo narrativo. Nesses casos, a voz consistente e a resposta multimodal justificam o premium.

Para quem NÃO muda nada

Se o seu produto já usa Whisper para transcrição e um LLM barato para gerar texto, trocar tudo pelo GPT Audio é pagar dez vezes mais para ter a mesma informação. Se você só precisa de TTS unidirecional (texto-para-fala sem entender o que o usuário disse), os modelos TTS dedicados da OpenAI continuam na API e custam uma fração. E se o seu caso de uso é em português do Brasil, prepare-se: o material de divulgação da OpenAI destaca inglês, e a qualidade de voz em outros idiomas ainda não foi auditada por ninguém independente — o catálogo não traz avaliação de conhecimento ou raciocínio para esse modelo.

O tabuleiro em janeiro de 2026

O catálogo que você consulta hoje lista mais de 322 modelos de 50 criadores. Nove foram lançados nos últimos 30 dias. O GPT Audio entra num slot que estava vazio: voz multimodal nativa com a marca OpenAI. A Anthropic tem o Claude Haiku 4.5 (IQ 29,9, US$ 5 por milhão de saída) mas só texto. A Xiaomi lidera em inteligência bruta com MiMo-V2-Flash. A Mistral aposta em código com Devstral 2. Nenhum deles cobre áudio nativo com a mesma proposta.

A implicação prática é direta: se voz nativa multimodal é o seu gargalo, teste o GPT Audio num protótipo esta semana e meça latência e custo por sessão real antes de migrar qualquer usuário. Se voz é um detalhe cosmético no seu produto, continue com Whisper + TTS e guarde o dinheiro.

Em uma frase

Só migre para o GPT Audio se voz nativa multimodal for o diferencial do seu produto; para transcrição ou TTS simples, o pipeline antigo custa uma fração.

Perguntas frequentes

Quanto custa o GPT Audio da OpenAI?

US$ 2,50 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. O catálogo não divulga preço de cache para esse modelo.

O GPT Audio substitui o Whisper?

Não diretamente. O Whisper continua sendo a opção mais barata só para transcrição. O GPT Audio faz transcrição, raciocínio sobre o áudio e geração de voz numa única chamada — é mais caro, mas elimina o custo de orquestrar três modelos.

Funciona bem em português?

O catálogo não traz avaliação de idioma nem benchmark de raciocínio para o GPT Audio. O material oficial destaca inglês; a qualidade em português precisa ser testada no seu caso real antes de colocar em produção.

Leia também