GPT Audio Mini custa um quinto do irmão cheio — e ninguém mediu a inteligência dele
Quatro dias após o lançamento, o modelo de voz barato da OpenAI ainda não tem nota de IQ no catálogo. Para quem vale e para quem não muda nada.
O que o release diz — e o que a conta mostra
A OpenAI soltou o GPT Audio Mini no dia 19 de janeiro. A proposta no papel é direta: uma versão enxuta do GPT Audio, com decoder atualizado para voz mais natural e consistência melhor de timbre. Em texto, a conta parece simpática: US$ 0,60 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída. É barato para o padrão OpenAI.
Só que comparar com o quê? O catálogo de hoje tem 322 modelos listados, e nenhum deles aparece marcado como "irmão cheio" do GPT Audio Mini para você confrontar preço a preço. O que dá para cravar é o seguinte: a US$ 2,40 por milhão de saída, você está pagando menos do que pagaria em modelos de texto de peso médio como o Devstral 2 2512, da Mistral, que sai a US$ 2 por milhão. A diferença é que aqui o token de saída é áudio — e tokens de áudio são mais densos em informação, então a conta final por minuto de voz falada costuma ser outra conversa.
O elefante na sala: não tem nota de IQ
Quatro dias depois do lançamento, o GPT Audio Mini segue sem índice de inteligência publicado no catálogo. Sem IQ, sem coding, sem agentic, sem blended. Para um modelo de texto isso já seria estranho; para um modelo cujo forte é voz, é quase esperado — benchmarks de texto não medem bem qualidade de fala. Mas significa que você está comprando no escuro do ponto de vista cognitivo.
Olha o topo do mercado hoje para situar o que está em jogo: o Xiaomi MiMo-V2-Flash lidera com IQ 34,024 a US$ 0,30 por milhão de saída. O OpenAI o3 vem logo atrás com IQ 31,096 a US$ 8. O Claude Haiku 4.5 da Anthropic marca 29,892 a US$ 5. São modelos de texto, não de voz, mas a régua mostra o quanto o catálogo ainda trata áudio como categoria separada — e o quanto a OpenAI cobra caro pelos seus nomes de ponta.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
Para quem o GPT Audio Mini faz sentido
Você roda um produto que fala com o usuário — atendimento, assistente de voz, narração, agente telefônico — e o gargalo é custo por minuto de áudio. A US$ 0,60 de entrada e US$ 2,40 de saída, o modelo entra na faixa em que dá para colocar voz em fluxos que antes só compensavam em texto. O decoder novo promete voz mais natural e consistência de timbre, que é exatamente o tipo de detalhe que importa quando o usuário está ouvindo, não lendo.
Se você já está na API da OpenAI e usa o GPT Audio cheio só porque era a opção, o Mini é a primeira coisa a testar antes de qualquer migração para fora. Trocar dentro do mesmo fornecedor é menos arriscado do que trocar de fornecedor.
Para quem ele não muda nada
Se o seu caso de uso é transcrição pura — pegar áudio e virar texto — o GPT Audio Mini não é a ferramenta certa. A modalidade dele é texto+áudio indo para texto+áudio, ou seja, ele também gera voz. Para só transcrever, você paga caro por um decoder que não vai usar. Whisper e companhia continuam sendo o caminho.
Também não muda nada se você precisa de raciocínio forte em cima do áudio — resumir uma reunião de duas horas com inferência complexa, por exemplo. Sem nota de IQ publicada, não tem como saber onde o modelo para. E se você já está feliz com um modelo de voz de outro fornecedor a preço parecido, migrar só por ser OpenAI raramente compensa.
| Campo | Valor |
|---|---|
| Identificador | openai/gpt-audio-mini |
| Criador | openai |
| Preço de entrada | US$ 0.600 / M tokens |
| Preço de saída | US$ 2.40 / M tokens |
| Janela de contexto | 128k |
| Modalidade | text+audio->text+audio |
O tabuleiro em janeiro de 2026
O catálogo tem 322 modelos, 50 criadores, e nove foram lançados nos últimos 30 dias. A OpenAI não publicou preço de cache para o GPT Audio Mini — o campo está vazio no catálogo, o que provavelmente significa que não há desconto por prompt cacheado nesse modelo. Se você cacheia prompt para economizar, isso é mais um motivo para testar antes de assumir que vai economizar.
A faixa de preço do Mini coloca a OpenAI competindo com modelos de texto baratos como o MiMo-V2-Flash da Xiaomi em custo por milhão de saída, mas em uma categoria — voz — onde a comparação direta não existe. É um produto de nicho com preço de commoditie, e isso é justamente o que pode fazer dele útil ou irrelevante dependendo do seu caso.
O que você faz com isso amanhã
Se voz é gargalo de custo no seu produto, coloque o GPT Audio Mini em teste A/B esta semana contra o que você usa hoje. Meça custo por minuto de áudio falado, não por milhão de tokens — é a métrica que importa no fim do mês. Se voz é detalhe secundário e o cérebro do modelo é o que conta, espere alguém benchmarkar ou siga nos modelos de texto que você já confia.
Teste o GPT Audio Mini esta semana se voz é seu gargalo de custo; ignore se você só transcreve ou precisa de raciocínio forte.
Perguntas frequentes
Quanto custa o GPT Audio Mini?
US$ 0,60 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída. O catálogo não publicou preço de cache, então não há desconto por prompt cacheado confirmado.
O GPT Audio Mini tem nota de inteligência?
Não. Quatro dias após o lançamento, o modelo segue sem IQ, coding, agentic ou blended publicados no catálogo. É esperado para um modelo focado em voz, mas significa comprar sem régua cognitiva.
Para que serve o GPT Audio Mini?
Serve para produtos que geram voz — atendimento, assistentes, narração, agentes telefônicos — onde o custo por minuto de áudio é o gargalo. Não serve para transcrição pura nem para tarefas que exigem raciocínio forte sobre o áudio.