Inteligencia Artificial Edición diaria
INTELIGENCIA ARTIFICIAL IA GENERATIVA
GPT-Live-1 convierte la voz full-duplex en una API; la conversación sigue necesitando ingeniería
La nueva API de OpenAI puede escuchar mientras habla, aceptar interrupciones y modular idioma, tono y extensión. La experiencia parece inmediata; detrás siguen mandando telefonía, ruido, herramientas, consentimiento, escalado y medición.

OpenAI puso a disposición de desarrolladores GPT-Live-1 el 10 de septiembre. Es un modelo de voz a voz diseñado para mantener una conversación full-duplex: puede escuchar mientras responde, detectar una interrupción y adaptar idioma, tono o longitud sin obligar a encadenar por separado reconocimiento, texto y síntesis. La API se factura por segundo de sesión, con un precio publicado de 0,05 dólares por minuto de voz. Una conversación natural no es todavía un servicio fiable. Entre la voz del usuario y una acción real siguen existiendo red, códec, cancelación de eco, turnos, herramientas, políticas, estado y una persona que deberá hacerse cargo cuando el sistema no entienda.
El full-duplex cambia el punto de control. En un flujo clásico, el sistema espera a que termine la frase, transcribe, razona y reproduce una respuesta. En voz simultánea, debe distinguir una interrupción deliberada de una tos, ruido de fondo o el retorno de su propio altavoz. Si corta demasiado tarde, parece sordo; si corta demasiado pronto, pierde información. Además, el modelo puede empezar a hablar antes de terminar una consulta a una base de datos o una herramienta externa. La interfaz debe decidir qué puede decir de inmediato, qué debe confirmar y qué exige silencio hasta recibir evidencia. Una frase fluida que anuncie una reserva inexistente es peor que una pausa honesta. Por eso la latencia debe dividirse: primer audio, respuesta de herramienta, confirmación y cierre.
La prueba real empieza cuando el usuario interrumpe
La telefonía añade problemas que no aparecen en el navegador. Una llamada atraviesa proveedores, regiones, números, colas, grabaciones y transferencias. El audio puede llegar comprimido, con pérdida de paquetes o desde manos libres. El usuario puede cambiar de idioma, deletrear un identificador o pedir hablar con una persona mientras el sistema sigue razonando. El diseño necesita un estado explícito: intención, datos confirmados, acción pendiente, consentimiento y punto de retorno. Cada herramienta debe ser idempotente para que un reintento no duplique un cobro o una cita. Las credenciales deben limitarse a la operación concreta y las escrituras externas requieren confirmación audible. El modelo conversa; la aplicación conserva la verdad transaccional.
También cambia la privacidad. La voz puede revelar identidad, salud, emoción, ubicación y terceras personas que ni siquiera saben que están siendo captadas. Antes de grabar o transcribir, el servicio debe informar con claridad, obtener el consentimiento exigible y ofrecer una alternativa. Conviene minimizar audio y texto, separar registros operativos de contenido, definir retención y borrar lo que no sea necesario. Un resumen automático puede atribuir una decisión a la persona equivocada; una entonación no debe convertirse en diagnóstico ni en criterio de riesgo. En atención regulada, las afirmaciones sensibles necesitan fuentes y la transferencia humana debe incluir sólo el contexto autorizado. Son decisiones de producto y cumplimiento, no opciones de estilo del modelo.
Un piloto útil empieza con una intención estrecha: consultar el estado de un pedido, reprogramar una cita o clasificar una incidencia. Se construyen entre treinta y cincuenta conversaciones que incluyan silencio, solapamiento, acentos, ruido, herramientas lentas, identificadores ambiguos y peticiones fuera de alcance. Se mide el percentil 95 del primer audio, la proporción de interrupciones entendidas, acciones correctas, confirmaciones, transferencias completadas, llamadas abandonadas y coste por resolución. Las transcripciones se revisan con una taxonomía de fallos y no sólo con una nota de satisfacción. Si la tasa de acción errónea supera el umbral acordado, la prueba debe detener escrituras y degradarse a información o derivación.
Las herramientas de apoyo aclaran responsabilidades. Un sistema de trazas como Langfuse puede relacionar turnos, llamadas y latencia, siempre que los registros se redacten antes de almacenar datos personales o secretos. Un sandbox efímero como E2B sirve para ejecutar código no confiable, pero su microVM no decide por sí sola a qué dominios puede conectarse ni qué credenciales recibe. En uso personal, ChatGPT Voice permite ensayar una entrevista o una llamada difícil y Krisp puede limpiar y transcribir reuniones; ninguno elimina la obligación de verificar información, anunciar una grabación o revisar quién asumió cada tarea. La utilidad nace de combinar capacidad con una regla concreta de comprobación.
La oportunidad comercial está en el último metro. Una consultora puede vender un piloto de soporte, una auditoría de límites o un paquete recurrente de pruebas con ruido e interrupciones. El entregable no debería ser una voz sorprendente, sino un flujo delimitado, métricas, registros, escalado y coste previsto. Habrá que vigilar cómo se comporta GPT-Live-1 en llamadas largas, con herramientas lentas y cambios de idioma; qué garantías ofrece sobre residencia y retención; y si el precio por sesión se mantiene competitivo al sumar telefonía, observabilidad y supervisión. La conversación ya puede sentirse inmediata. La confianza dependerá de que el sistema sepa esperar, confirmar, ceder el turno y reconocer cuándo debe dejar de hablar.
Etiquetas
- GPT-Live-1
- voz
- full-duplex
- API
- experiencia conversacional
BOLDERROR Edición diaria Rubén Campoy