FalaVIP IA o que os modelos custam,
medido todo dia
Lançamentos

GPT-Live-1 promete telefonia, mas o preço ainda não aparece

A OpenAI abriu o GPT-Live-1 para conversas de voz em tempo real e integração telefônica na API. Para quem paga a fatura, a novidade é arquitetural — mas ainda falta o dado que define a adoção: quanto custa cada minuto ou token.

Redação FalaVIP IA 4 min de leitura
US$ 0,75por milhão de tokens de entrada no Gemini 3.8 Flash
US$ 3,75por milhão de tokens de saída no Gemini 3.8 Flash
US$ 14por milhão de tokens de saída no GPT-5.2

Se você usa voz em produção, o ponto decisivo do GPT-Live-1 não é apenas a naturalidade da conversa. É a promessa de retirar da sua arquitetura parte do trabalho que costuma ficar espalhado entre reconhecimento de fala, geração de texto, síntese de voz, controle de interrupções e integração com telefonia. A OpenAI anunciou o modelo na API com conversas full-duplex de alta fidelidade e suporte direto a telefonia, segundo a publicação da empresa.

A ressalva para quem paga a conta é direta: o preço do GPT-Live-1 não aparece na listagem de modelos do OpenRouter usada como referência para esta comparação. Também não há, nessa listagem, uma janela de contexto ou uma tarifa específica por minuto para o modelo. Isso impede transformar o anúncio em uma previsão confiável de custo mensal.

O que muda na arquitetura

Em uma aplicação tradicional de voz, a chamada telefônica é apenas a porta de entrada. O áudio precisa ser recebido, convertido em texto, enviado a um modelo de linguagem, transformado novamente em áudio e devolvido ao usuário. Cada etapa pode ter fornecedor, latência, cobrança e falha próprios.

A proposta do GPT-Live-1 é concentrar a conversa em tempo real em uma integração de API. O modo full-duplex indica uma interação em que o sistema pode ouvir e responder sem depender de turnos rígidos. Isso importa quando o usuário interrompe, muda de assunto ou fala enquanto o agente ainda está respondendo.

O suporte a telefonia também muda o ponto de partida do produto. Em vez de construir uma ponte separada entre o modelo e uma operadora, a equipe pode tratar chamadas telefônicas como parte do fluxo de produção anunciado pela OpenAI. A vantagem potencial está menos em reduzir cada token e mais em diminuir o número de componentes que precisam ser mantidos.

O marketing termina antes da fatura

A ausência de preço específico é o principal limite para a decisão. Uma arquitetura mais simples pode reduzir horas de engenharia e pontos de falha, mas isso não garante uma conta menor. Em voz, o custo depende do volume de áudio, da duração das chamadas, das interrupções e da quantidade de contexto mantida durante a sessão.

Os preços listados no OpenRouter mostram a diferença entre comparar um modelo textual e estimar uma experiência de voz. O Gemini 3.8 Flash custa US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída. Já o GPT-5.2 aparece a US$ 1,75 por milhão de tokens de entrada e US$ 14 por milhão de tokens de saída.

Esses valores não são o preço do GPT-Live-1. Servem apenas para mostrar por que não é seguro aplicar automaticamente uma tarifa de texto a uma conversa de voz. O modelo anunciado pode ter cobrança própria para áudio, sessões ou telefonia, e nenhum desses valores está disponível na listagem citada.

Para quem a novidade vale

O lançamento interessa principalmente a quem já opera atendimento telefônico, suporte, triagem ou agentes de voz e sofre com uma cadeia extensa de serviços. Nesse cenário, consolidar a interação em uma API pode reduzir a complexidade operacional, facilitar a troca de provedor e tornar mais simples o controle de interrupções e continuidade da conversa.

Também há valor para equipes pequenas. Se a empresa não tem infraestrutura para manter reconhecimento de fala, síntese, roteamento e telefonia separados, uma integração mais concentrada pode acelerar o caminho até a produção. O ganho, porém, precisa ser comparado com disponibilidade, observabilidade, gravação, segurança e regras de atendimento.

Para quem usa apenas chat, geração de texto ou automações assíncronas, o anúncio muda pouco. O GPT-Live-1 não substitui automaticamente um modelo textual barato para classificação, extração ou respostas fora de uma conversa ao vivo. E, sem tarifa publicada, ainda não é possível afirmar que ele será mais econômico do que montar a cadeia com componentes especializados.

Como decidir sem adivinhar

A decisão prática é separar economia de engenharia de economia de inferência. O primeiro benefício pode existir desde o início: menos integrações, menos sincronização entre áudio e texto e menos lógica para controlar turnos. O segundo depende da tabela comercial que ainda não aparece na comparação do OpenRouter.

Antes de migrar uma operação, vale medir o custo atual por chamada, o tempo médio de interação, a proporção de fala do usuário e do agente e o número de interrupções. Depois, a equipe pode comparar esses indicadores com o preço oficial do GPT-Live-1 quando ele estiver disponível e testar a mesma jornada em produção controlada.

A implicação é simples: o GPT-Live-1 pode mudar a arquitetura de aplicações telefônicas agora, mas ainda não muda a planilha de custos — a menos que a OpenAI publique uma cobrança de voz que permita calcular o custo real por conversa.

Em uma frase

Se você precisa reduzir a complexidade de um agente telefônico, o GPT-Live-1 merece um teste; se precisa fechar o orçamento hoje, ainda falta o preço que decide a compra.

Perguntas frequentes

O GPT-Live-1 já tem preço por minuto?

Não há preço por minuto do GPT-Live-1 na listagem do OpenRouter usada nesta comparação. Também não aparece uma tarifa específica para áudio ou telefonia, então ainda não dá para calcular o custo real de uma chamada.

O que o GPT-Live-1 muda para uma aplicação de voz?

A proposta é oferecer conversas full-duplex de alta fidelidade e suporte a telefonia diretamente pela API. Isso pode reduzir a quantidade de componentes separados para reconhecimento, geração, síntese e conexão telefônica.

O GPT-Live-1 substitui modelos de texto mais baratos?

Não necessariamente. Para tarefas assíncronas, chat e processamento textual, um modelo convencional pode continuar sendo mais adequado; no OpenRouter, o Gemini 3.8 Flash custa US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída.

Fontes

Leia também