GPT Audio Mini custa 70% menos que o o3 e ninguém sabe para que serve
Lançado há quatro dias, o modelo de voz mais barato da OpenAI não traz índice de inteligência nem benchmark de código — e é justamente aí que mora a dúvida.
O preço baixo que não explica nada
A OpenAI colocou no ar, em 19 de janeiro, o GPT Audio Mini: um modelo de voz que entra texto e áudio e devolve texto e áudio. Pelo preço de US$ 0,60 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída, ele é, hoje, a opção mais barata da casa para quem precisa falar com a API.
Coloque lado a lado do o3, o carro-chefe da empresa: o modelo de raciocínio cobra US$ 8 por milhão de tokens de saída. Em volume, a conta do Audio Mini fica cerca de 70% mais barata na saída. É o tipo de diferença que faz um desenvolvedor parar de rolar o catálogo e abrir a documentação.
Só que aí vem o problema.
| Campo | Valor |
|---|---|
| Identificador | openai/gpt-audio-mini |
| Criador | openai |
| Preço de entrada | US$ 0.600 / M tokens |
| Preço de saída | US$ 2.40 / M tokens |
| Janela de contexto | 128k |
| Modalidade | text+audio->text+audio |
O que o catálogo não te conta
O GPT Audio Mini foi publicado sem índice de inteligência, sem nota de coding, sem agentic, sem blended, sem velocidade, sem país de origem, sem corte de conhecimento. Em outras palavras: não dá para saber, pelos dados públicos de hoje, se ele é bom em alguma coisa além de falar.
Isso não é detalhe. É o sinal que falta para decidir. Quando você olha o topo do mercado de 23 de janeiro de 2026, os cinco modelos mais bem posicionados em inteligência têm nota, têm criador, têm preço. Dá para comparar. O Audio Mini, não.
| Modelo | Inteligência | Saída US$/M |
|---|---|---|
| MiMo-V2-Flash | 34.0 | 0.3 |
| o3 | 31.1 | 8 |
| Claude Haiku 4.5 | 29.9 | 5 |
| gpt-oss-120b | 24.1 | 0.17 |
| Devstral 2 2512 | 19.2 | 2 |
A conta que a OpenAI está te convidando a fazer
O argumento comercial, se a OpenAI tivesse que escrever em uma frase, seria simples: voz boa, voz consistente, decoder atualizado — e barato. O release fala em "voz mais natural" e "consistência melhor de voz". É uma promessa de用户体验, não de benchmark.
A analogia que ajuda aqui: é como comprar um fone de ouvido sem ver a curva de resposta de frequência. Você sabe que ele existe, sabe que é da marca, sabe o preço. Mas não tem como saber, antes de plugar, se ele vai soar melhor que o seu atual.
Para um modelo de texto, dá para testar com um prompt e seguir em frente. Para áudio, o teste custa tempo de desenvolvimento, integração com streaming, latência — e a OpenAI não publicou nem a velocidade desse modelo.
Para quem vale — e para quem não muda nada
Vale a pena testar agora se você já roda um produto de voz na OpenAI e quer reduzir custo sem trocar de fornecedor. Se a sua aplicação hoje usa o GPT-4o Audio ou o Realtime API e a conta de saída está mordendo, o Audio Mini é a primeira coisa a experimentar. A economia de 70% na saída, em escala, paga o trabalho de integração.
Não muda nada se você precisa de raciocínio em cima do áudio — resumir uma reunião, extrair itens de ação, classificar intenção. Para isso, o caminho continua sendo transcrever com um modelo barato e jogar num modelo de texto forte. O Audio Mini não traz índice de inteligência porque, provavelmente, não é essa a proposta.
Também não muda nada se você está montando um agente. O índice agentic está vazio, e o catálogo não oferece pista de como o modelo se comporta em cadeias longas de ferramentas. Não dá para recomendar para esse uso sem dado.
O tabuleiro em 23 de janeiro
O catálogo tem mais de 322 modelos listados, vindos de 50 criadores diferentes. Nove foram lançados nos últimos 30 dias. O topo em inteligência hoje é o Xiaomi MiMo-V2-Flash, com IQ 34,024 e saída a US$ 0,30 por milhão — outra referência de preço baixo, mas em texto puro. O o3, da própria OpenAI, aparece em segundo, com IQ 31,096 e saída a US$ 8.
O Audio Mini entra nesse tabuleiro em um canto ainda mal mapeado: voz, sem benchmark publicado, preço agressivo. É um lançamento que precisa de prova. Até essa prova aparecer, o uso inteligente é pontual — onde o áudio é o produto final e o texto é só o meio.
O que você faz com isso hoje
Se voz é o seu produto, abra a documentação, monte um teste A/B com o seu modelo atual e meça latência e naturalidade. Se voz é só um passo no seu pipeline, ignore por enquanto e espere alguém publicar um benchmark independente. A economia existe, mas só faz sentido se a qualidade não regredir — e isso, em 23 de janeiro, ainda não está nos dados.
Teste o GPT Audio Mini só onde voz é o produto final; para raciocínio sobre áudio, continue transcrevendo e jogando num modelo de texto forte.
Perguntas frequentes
Quanto custa o GPT Audio Mini?
US$ 0,60 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída. É a opção de voz mais barata da OpenAI no catálogo de 23 de janeiro de 2026.
O GPT Audio Mini serve para agentes?
Não há dado público de benchmark agentic para esse modelo. Sem índice de inteligência nem nota de agentic, não dá para recomendar em cadeias de ferramentas sem teste próprio.
Vale trocar meu modelo de voz atual pelo GPT Audio Mini?
Vale testar se você já está na OpenAI e quer cortar custo na saída — a economia é de cerca de 70% frente ao o3. Não vale se você precisa de raciocínio sobre o áudio ou se ainda não tem como medir naturalidade e latência no seu caso de uso.