Actualidad

OpenAI lanza GPT-Live-1 en la API para crear agentes de voz full-duplex

GPT-Live-1 ya está disponible en la API de OpenAI para crear agentes de voz full-duplex, con manejo de interrupciones y precio de US$0,05 cada minuto.
Viernes, Septiembre 11, 2026

OpenAI lanzó GPT-Live-1 en su API, llevando a desarrolladores y empresas un modelo de voz capaz de escuchar y hablar al mismo tiempo, manejar interrupciones durante una conversación y apoyarse en otros modelos para ejecutar razonamiento o acciones de mayor complejidad.

El lanzamiento busca resolver uno de los problemas históricos de los agentes de voz: la sensación de estar hablando con un sistema que necesita esperar a que una persona termine completamente una frase para comenzar a responder.

GPT-Live-1 utiliza un modelo full-duplex, lo que permite procesar audio entrante y saliente simultáneamente. OpenAI afirma que esto mejora la capacidad para interpretar pausas, interrupciones, cam

bios de idea, ruido de fondo y pequeñas señales de conversación, como una risa o un breve asentimiento.

La compañía puso el modelo a disposición de desarrolladores el 10 de septiembre con un precio de US$0,05 por minuto para la capa frontal de voz. El modelo de razonamiento que se conecte detrás y la arquitectura adicional del agente tienen costos separados.

GPT-Live-1 reduce casi 80 % las interrupciones en una prueba de educación

Uno de los datos que mejor muestra la diferencia está en las primeras evaluaciones realizadas con Speak, plataforma de aprendizaje de idiomas.

Durante las pruebas, GPT-Live-1 permitió que los estudiantes tuvieran más tiempo para pensar antes de que el tutor virtual interpretara una pausa como el final de su intervención. El resultado fue una reducción de casi 80 % en las interrupciones frente a sistemas anteriores basados en turnos.

“Un buen tutor de idiomas sabe cuándo dar espacio al estudiante y cuándo intervenir”, explicó, en traducción del original, Andrew Hsu, cofundador y CTO de Speak. La compañía encontró que el nuevo modelo reducía de forma considerable las interrupciones durante las pausas de pensamiento.

Para aplicaciones empresariales, la diferencia puede ser importante. Un cliente que llama para reservar un restaurante, modificar un pedido o resolver un problema no habla siguiendo turnos perfectos: duda, interrumpe, cambia de dirección y habla mientras existe ruido alrededor.

De tres sistemas separados a un solo modelo de voz

Los agentes tradicionales suelen unir tres componentes: un sistema que convierte voz en texto, un modelo que interpreta y genera la respuesta y otro que transforma nuevamente el texto en audio.

Cada paso añade latencia y aumenta las posibilidades de perder ritmo o contexto durante la conversación.

GPT-Live-1 concentra la interacción de voz en un solo modelo, mientras puede enviar tareas más exigentes hacia un modelo de texto ubicado en el backend.

OpenAI señala, por ejemplo, que un desarrollador podría utilizar un modelo más rápido para tareas de alto volumen, como actualizar pedidos o gestionar reservas, y recurrir a uno de mayor capacidad de razonamiento cuando un cliente plantea un caso complejo.

La arquitectura permite que la conversación continúe mientras determinadas acciones se procesan en segundo plano.

En una implementación citada por OpenAI, Tony Stoyanov, cofundador y CTO, aseguró que frente a su arquitectura anterior GPT-Live-1 redujo en 80 % la base de código y permitió eliminar 23.000 líneas, simplificando el desarrollo de conversaciones en tiempo real para pacientes.

Reservas, pedidos y servicio al cliente aparecen entre los primeros usos

Una de las aplicaciones empresariales más evidentes está en la telefonía. GPT-Live-1 puede utilizarse para construir agentes capaces de atender llamadas relacionadas con reservas, pedidos y soporte al cliente, incluyendo conversaciones en las que hay ruido de fondo o varias personas hablando.

Yelp ya lo está utilizando en Yelp Host y Hatch.

“Las personas están hablando con frases más completas y naturales”, señaló, en traducción del original, Alex Levy, Chief Technology Officer de Yelp, al explicar que la compañía está observando mejoras en el manejo de llamadas relacionadas con reservas y pedidos.

El modelo también puede producir transcripciones automáticas, interpretar mejor combinaciones alfanuméricas y utilizar palabras clave específicas, funciones relevantes para escenarios como números de pedidos, referencias, códigos o información entregada verbalmente.

OpenAI reporta una mejora de 30 puntos en conversaciones full-duplex

En sus evaluaciones internas, OpenAI asegura que GPT-Live-1 mejora en 30 puntos porcentuales el desempeño en Full Duplex Bench frente a GPT-Realtime-2.1, especialmente en latencia entre turnos y comportamiento interactivo.

El modelo también puede delegar razonamiento y llamadas a herramientas a sistemas externos. OpenAI muestra una integración en la que GPT-Live-1 envía contexto de una conversación a Codex, recibe el resultado y lo incorpora nuevamente al diálogo hablado.

Esto amplía el concepto de asistente de voz: ya no se trata únicamente de responder preguntas, sino de conversar mientras consulta información, utiliza sistemas empresariales o ejecuta acciones autorizadas.

Los agentes de voz también podrán tener distintos acentos y estilos

GPT-Live-1 incorpora además mayor control sobre tono, velocidad y estilo conversacional mediante instrucciones del sistema.

OpenAI amplió el catálogo de voces disponibles en tiempo real hacia una selección con diferentes acentos, dialectos e idiomas y anticipó que seguirá aumentando esa oferta durante los próximos meses.

La posibilidad de personalizar cómo habla un agente puede ser especialmente relevante para compañías que buscan llevar una misma experiencia de servicio a distintos países o construir asistentes coherentes con su identidad de marca.

La voz empieza a convertirse en una interfaz para ejecutar tareas

El avance de GPT-Live-1 tiene una lectura empresarial que supera la mejora en la calidad del audio.

Durante años, los asistentes de voz fueron principalmente interfaces para responder preguntas simples o ejecutar instrucciones limitadas. La capacidad de conversar de manera continua, conectarse con modelos de razonamiento y utilizar herramientas externas acerca estos sistemas a funciones que hoy desempeñan personas en servicio al cliente, reservas, soporte, ventas o coordinación de procesos.

El precio de US$0,05 por minuto para la capa de voz también introduce una referencia concreta para que las empresas comparen estas arquitecturas frente a sistemas tradicionales y operaciones atendidas por personas.

La prueba real estará en algo que durante años ha limitado a los asistentes telefónicos automatizados: que una persona pueda hablar como habla normalmente, sin adaptar su ritmo a la máquina.

Si GPT-Live-1 consigue llevar esa naturalidad a operaciones de gran escala, el cambio no será únicamente tener mejores asistentes de voz. Será convertir una conversación en una interfaz capaz de consultar, decidir y actuar dentro de los sistemas de una empresa mientras el usuario sigue hablando.