miércoles, 23 de septiembre de 2026

Tu tía tenía razon: hablar con la tecnología es más sencillo. GPT-Live mantiene conversaciones en tiempo real, escucha, pregunta e incluso te corrige.

GPT-Live escucha y habla al mismo tiempo mientras interactúas con él. OpenAI ha creado la interfaz de usuario definitiva

La comunicación oral fue la primera forma que desarrollamos como especie para interactuar socialmente, es la más natural y la que aprendemos desde pequeños.

Siglos han pasado y hemos desarrollado formas más complejas de comunicación, pasando por los lenguajes de programación, los algoritmos o la criptografía. Lo que OpenAI ha hecho hoy, es volver al inicio: a la conversación oral, y no es cosa menor.

Durante casi tres años, hablar con ChatGPT tuvo el mismo defecto de fondo, sin importar cuánto mejorara el modelo detrás: había que esperar tu turno. Terminabas de hablar, había un silencio incómodo, y recién entonces la IA respondía. Si dudabas medio segundo de más, el sistema asumía que habías terminado y te interrumpía. Si había ruido de fondo, confundía una moto pasando con el final de tu frase. Ese defecto tiene nombre técnico —»detección de turno basada en silencio»— y el 8 de julio OpenAI anunció que lo resolvió con un cambio de arquitectura, no de modelo: GPT-Live.

Qué es, técnicamente

GPT-Live no es un modelo de lenguaje nuevo como GPT-5.5 o GPT-5.6. Es una nueva generación de modelos de voz —GPT-Live-1 y una versión más ligera, GPT-Live-1 mini— construidos sobre lo que OpenAI llama arquitectura full-duplex: en vez de procesar la conversación como una serie de mensajes separados (tú hablas, silencio, la IA responde), el modelo escucha y genera respuesta al mismo tiempo, de forma continua, decidiendo muchas veces por segundo si debe hablar, seguir escuchando, hacer una pausa, interrumpir o llamar a una herramienta externa.

La comparación que hace la propia OpenAI es útil para entender el salto. La primera versión de ChatGPT Voice encadenaba tres modelos distintos —uno que transcribía tu voz a texto, uno que generaba la respuesta, uno que la convertía de vuelta a audio— y perdía información y velocidad en cada eslabón. El Advanced Voice Mode (el que la mayoría de usuarios conoce hoy) unificó eso en un solo modelo, pero seguía funcionando por turnos discretos: esperaba a que dejaras de hablar. GPT-Live elimina esa espera estructuralmente.

La segunda pieza, quizás más relevante para quien piensa en esto como herramienta de trabajo y no solo de conversación casual, es la delegación: cuando la pregunta requiere buscar en la web, razonar más a fondo o ejecutar una tarea compleja, GPT-Live no se detiene a pensar en silencio. Delega la tarea a un modelo de última generacion (GPT-5.5 al momento de su lanzamiento), y mientras ese modelo trabaja en segundo plano, GPT-Live sigue sosteniendo la conversación. Es, en esencia, la misma lógica de un asistente humano competente: no te deja hablando solo mientras busca un dato, sigue la plática y regresa con la respuesta cuando la tiene.

OpenAI también añadió tarjetas visuales (clima, resultados deportivos, cotizaciones bursátiles) que aparecen mientras hablas, y remasterizó las nueve voces de ChatGPT con tres niveles de razonamiento seleccionables: Instantáneo, Medio y Alto, según qué tanto quieras que el modelo «piense» antes de responder.

Conversaciones seguras

OpenAI dedicó una sección completa de su anuncio al tema que preocupa a muchos: seguridad.

La compañía señaló haber ampliado sus pruebas con evaluaciones sintéticas de audio en áreas como autolesiones, dependencia emocional hacia la IA, violencia y contenido sexual, y construyó salvaguardas que pueden actuar mientras el modelo está hablando: redirigir hacia una respuesta más cuidadosa, ofrecer recursos, o terminar la conversación en casos de mayor riesgo.

Para adolescentes, los padres pueden decidir si su hijo tiene acceso a ChatGPT Voice mediante controles parentales. Un tema de seguridad pero que también toca la frontera de los derechos de propiedad intelectual es que GPT-Live tampoco imita voces reales: usa únicamente el set de voces predefinidas de ChatGPT.

Disponibilidad: quién lo tiene ya y quién no

GPT-Live-1 se convierte en el modelo por defecto de ChatGPT Voice para los planes de pago (Go, Plus, Pro); GPT-Live-1 mini hace lo propio en la capa gratuita. Está disponible ya en iOS, Android y la web, de forma global.

Lo que no está disponible todavía es el acceso vía API: OpenAI dice que lo traerá «pronto» y por ahora solo abrió un formulario de registro de interés para desarrolladores y empresas. Tampoco soporta, por ahora, voz combinada con video o pantalla compartida —función que sí existe en las versiones anteriores del modo de voz.

Para quien evalúa esto con fines de negocio, ese matiz importa: hoy GPT-Live es una mejora de experiencia dentro de la app de ChatGPT, no todavía una herramienta que un equipo de producto pueda integrar a su propio call center o asistente de voz. Eso llegará, pero la ventana de «en espera» sigue abierta por ahora.

¿Su aplicación potencial está en el servicio al cliente? Piensa de nuevo.

Contenido restringido para usuarios premium

Comienza con 30 días de acceso incluido. Después, continúa por $169 MXN al mes.

Una forma simple de estar al día

Una selección clara sobre IA, tecnología y los cambios que vale la pena seguir, directo en tu correo.