La prueba de interrupción de GPT-Live-1 que te dice si debes jubilar tu cadena STT-LLM-TTS
Un modelo de voz full-duplex solo supera a una cadena en cascada cuando tus propios datos de interrupción, latencia, coste, retención y fallback lo confirman.

Tu agente de voz acaba de tener un nuevo rival: OpenAI puso GPT-Live-1 a disposición a través de su API el 10 de septiembre de 2026. La empresa de aprendizaje de idiomas Speak informó que GPT-Live-1 generó casi un 80% menos de interrupciones durante las pausas de reflexión de los estudiantes que sus anteriores sistemas por turnos. Si gestionas flujos de telefonía, soporte o agentes conversacionales, la pregunta es si tu cadena STT-LLM-TTS sigue ganando en las llamadas que realmente atiendes.
Una cascada es una estafeta donde cada relevo cuesta tiempo. Un modelo full-duplex intenta eliminar ese relevo. El equilibrio es toda la decisión.
La prueba de sustitución es una tabla de puntuación, no una demostración
Trata la cascada como línea base y GPT-Live-1 como el retador. Puntúa ambos en los mismos cinco criterios. Una demo del proveedor puede ocultar las pausas exactas, las llamadas a herramientas y las llamadas largas que afectan a tu cola.
- Tasa de interrupción. Cuenta con qué frecuencia el agente interrumpe a un llamador durante pausas de reflexión y compáralo con tu cadena actual.
- Retención en sesiones largas. Registra si el agente mantiene el contexto, el estado de la tarea y la intención del llamador tras una llamada larga.
- Latencia de delegación. Mide el retraso desde la solicitud del llamador hasta una respuesta útil temprana, incluido cualquier traspaso a un humano o herramienta de backend.
- Coste total por minuto. Suma los costes de voz, modelo, herramientas, telefonía y mantenimiento de ingeniería para el mismo tráfico.
- Modo de fallo de fallback. Decide qué ocurre cuando el modelo se equivoca, no está disponible o se atasca, y si el llamador puede recuperarse.
Interrupción y latencia son los criterios que se sienten
La voz full-duplex suena como una pequeña mejora hasta que un llamador hace una pausa para pensar. Una cadena por turnos trata esa pausa como silencio y sigue hablando. Un modelo full-duplex tiene que decidir si la pausa es una vacilación, un backchannel o una interrupción real. Esa decisión es donde tu cola de soporte nota la diferencia.
OpenAI afirmó que GPT-Live-1 superó a GPT-Realtime-2.1 en 30 puntos porcentuales en Full Duplex Bench y se situó en lo más alto de Tau3 al usar GPT-6 Astra con esfuerzo de razonamiento medio. Los benchmarks no son tus registros de llamadas. Usa tus propias pausas: vacilación del llamador, ruido de fondo, agente a mitad de frase y el momento en que un llamador dice espera.
La latencia de toma de turno es el número que un llamador percibe como un silencio muerto. La comparación publicada por OpenAI muestra una latencia de toma de turno de GPT-Live-1 de aproximadamente 0,8 segundos, frente a más de un segundo en los modelos de voz anteriores. La diferencia puede sentirse fluida en una prueba controlada y áspera en un centro de llamadas donde el llamador ya está impaciente. Mide el mismo camino: voz del llamador a respuesta del agente, incluyendo red, telefonía y cualquier llamada a herramienta de backend.
Coste, retención y fallback deciden si la ventaja se sostiene
Las sesiones de voz de GPT-Live-1 cuestan $0.05 por minuto con facturación por segundo, y el uso de modelo y herramientas de backend se factura por separado. Ese concepto es fácil de pasar por alto cuando una llamada activa una búsqueda, una actualización de ticket o un traspaso. La cascada tiene sus propios conceptos: reconocimiento de voz, tokens del modelo, síntesis de voz, telefonía y el código que los mantiene sincronizados.
Un cliente dijo que al pasar de un sistema de voz en cascada a GPT-Live-1 redujo su base de código de voz en un 80% y eliminó 23.000 líneas usadas para conversaciones en tiempo real con pacientes. Ahorros de mantenimiento como este pueden importar más que el precio por minuto. GPT-Live-1 se lanzó con 12 voces que cubren acentos, dialectos e idiomas, y el acceso a voces personalizadas requiere contactar con ventas. Si la voz de tu marca o el acento regional necesita un modelo personalizado, eso es un artículo de adquisición, no un interruptor.
Un agente de voz que maneja bien un intercambio breve aún puede fallar en una llamada de soporte larga. Registra si mantiene el problema del llamador, las respuestas anteriores y el estado de la tarea a lo largo de una sesión larga. Si pierde el hilo, el llamador se repite, y el coste no son solo minutos.
El fallback es donde termina la prueba controlada. Si el modelo se equivoca, no está disponible o se atasca, el llamador necesita un camino hacia un humano, un reintento o una salida segura. Una cascada puede ser aburridamente fiable aquí porque cada etapa tiene un modo de fallo conocido. Un modelo full-duplex puede ser más fluido, pero aún necesitas un punto de parada claro.
Jubila la cadena solo cuando tus números lo digan
Pon las cinco comprobaciones en una hoja de cálculo antes de hacer el piloto. Si los números favorecen a GPT-Live-1, realiza un despliegue por fases. Si la cascada sigue ganando, arregla el componente más débil.