Pular para o conteúdo
IA

GPT-Live-1 chega à API da OpenAI: como funciona e quanto custa a voz em tempo real

A conversa por voz com uma inteligência artificial costuma denunciar o truque: você termina de falar, espera um instante e só então ouve uma resposta. O GPT-Live-1, modelo da OpenAI que chegou à API em 10 de setembro de 2026, tenta esconder justamente esse intervalo.

A proposta é fazer a IA ouvir e falar ao mesmo tempo, lidar melhor com interrupções e delegar tarefas difíceis a outro modelo ou agente. Para quem desenvolve atendimento telefônico, tutoria de idiomas ou assistentes para aplicativos, a novidade é importante — mas não significa que qualquer empresa ganhou um atendente pronto e barato.

Interface do ChatGPT Voice exibindo uma lista de partidas esportivas
O GPT-Live também foi apresentado com respostas visuais durante a conversa. Imagem: OpenAI.

O que é o GPT-Live-1?

O GPT-Live-1 é a camada de voz em tempo real da OpenAI. Em vez de tratar cada fala como um pacote isolado, o modelo trabalha com áudio contínuo: pode escutar enquanto responde, reconhecer uma pausa, aceitar uma interrupção ou decidir que precisa chamar uma ferramenta.

Esse desenho é chamado de full duplex. Em termos simples, é parecido com uma ligação telefônica: as duas pessoas podem falar, parar, retomar e se interromper sem esperar que uma “entregue o turno” formalmente.

Como a arquitetura funciona

A OpenAI separa o trabalho em duas partes. O GPT-Live-1 cuida da conversa, do ritmo e da escolha do momento de falar. Quando o pedido exige busca, raciocínio mais longo ou uma ação externa, ele delega a tarefa a um modelo de texto, agente ou serviço definido pelo desenvolvedor.

Imagine um cliente perguntando por voz onde está uma encomenda. A camada de voz mantém a conversa natural; o backend consulta o sistema da loja e devolve o resultado. Se o cliente interromper para acrescentar o número do pedido, a aplicação ainda precisa controlar permissões, estado da tarefa e regras de negócio. A interrupção da fala não cancela automaticamente o trabalho que já foi enviado ao backend.

O que dá para criar com a API

  • Atendimento telefônico: triagem inicial, consulta de pedidos, agendamentos e encaminhamento para uma pessoa.
  • Aplicativos com voz: assistentes que respondem sem exigir que o usuário toque na tela a cada frase.
  • Educação: conversas para praticar idiomas, com ritmo mais próximo de uma interação humana.
  • Operações internas: consulta a sistemas, abertura de chamados e coleta de informações antes de uma aprovação.

A documentação oficial indica caminhos por WebRTC para navegador e aplicativos, WebSocket para integrações de áudio no servidor e SIP para telefonia. Também há integrações com parceiros como Twilio, Telnyx, LiveKit e Daily/Pipecat.

Quanto custa o GPT-Live-1?

Na página de lançamento da API, a OpenAI informa US$ 0,05 por minuto para a camada de voz. A cobrança é por duração, com medição por segundo segundo a documentação. Isso equivale a US$ 3 por hora de sessão contínua, cálculo simples que não inclui outras partes do sistema.

O backend, os modelos usados para raciocinar, as ferramentas, a hospedagem e a operadora de telefonia podem gerar cobranças separadas. Portanto, o preço divulgado não é o custo total de um call center com IA. Uma conversa longa, com consultas externas e transferência para humanos, terá uma conta bem diferente de um protótipo que faz uma pergunta curta.

GPT-Live-1 é melhor que uma arquitetura tradicional?

Depende do objetivo. A abordagem de voz contínua tende a fazer mais sentido quando a prioridade é baixa latência, interrupção natural e uso em tempo real. Já o pipeline tradicional — fala para texto, modelo de texto e texto para fala — pode ser melhor quando a equipe precisa revisar cada etapa, salvar transcrições, aplicar regras antes da resposta ou reutilizar um agente textual já pronto.

A própria documentação da OpenAI trata essas arquiteturas como escolhas diferentes, não como uma substituição universal. Em um fluxo de aprovação de crédito, por exemplo, ter texto intermediário e validações explícitas pode valer mais do que uma conversa extremamente fluida.

Limitações e cuidados antes de colocar em produção

O primeiro cuidado é segurança. A aplicação continua responsável por autenticação, autorização, confirmação de ações e proteção de dados pessoais. Não basta o modelo “saber” que uma operação é sensível: o sistema deve impedir que uma fala ambígua apague um pedido, altere um cadastro ou confirme um pagamento sem validação.

O segundo é custo. O valor por minuto parece pequeno isoladamente, mas cresce com sessões abandonadas, espera em linha, chamadas repetidas e backend acionado várias vezes. Vale implementar encerramento correto de sessão, limites de duração e métricas de uso antes de liberar o recurso para muita gente.

Também é necessário testar sotaques, ruído, nomes próprios, números de pedido e vocabulário do negócio. Uma demonstração em ambiente silencioso não prova que o agente funcionará em uma rua movimentada ou em uma central de atendimento.

Vale a pena usar o GPT-Live-1?

Para quem precisa de voz em tempo real e aceita montar a infraestrutura ao redor, o GPT-Live-1 é uma opção interessante porque combina conversa contínua com delegação de tarefas. O ganho principal não é “falar com uma IA” — isso já existe —, mas reduzir a rigidez da interação e separar a conversa do trabalho pesado.

Eu não trataria o lançamento como atalho para substituir uma operação inteira. O modelo resolve a camada de diálogo; filas, permissões, integrações, observabilidade, custos e atendimento humano continuam sendo problema de engenharia. A API pode ser um bom ponto de partida para um agente de voz, desde que a empresa comece por um fluxo pequeno, mensurável e com aprovação humana nas ações de risco.

Perguntas frequentes

O GPT-Live-1 está disponível para desenvolvedores?

Sim. A OpenAI informa que o GPT-Live-1 está disponível na API, com a camada de voz anunciada a US$ 0,05 por minuto. A disponibilidade de recursos e modelos pode mudar, por isso é importante consultar a documentação antes da implementação.

GPT-Live-1 e Realtime são a mesma coisa?

Não exatamente. O GPT-Live-1 é o modelo e a experiência de voz contínua descritos no lançamento. Realtime é a superfície de API e a família de recursos para sessões de áudio em tempo real. A documentação também apresenta modelos Realtime e arquiteturas encadeadas para outros cenários.

Posso usar qualquer modelo no backend?

A documentação diferencia a delegação por Responses, que usa modelos compatíveis, da delegação pelo cliente, na qual o desenvolvedor controla o modelo, agente ou serviço que executará o trabalho. A escolha depende do controle e das integrações necessários.

Fontes consultadas