GPT-Live explicado: La IA que escucha y habla al mismo tiempo
Game Plan
Conviértete en un supporter de este podcast: https://www.spreaker.com/podcast/horizontes-digitales-tecnologia-inteligencia-artificial-y-futuro-digital--2467211/support.
¿Te gustó este episodio? ¡No olvides suscribirte y dejar una reseña! Esto nos ayuda a llegar a más personas interesadas en el mundo digital.
🚀 Conecta con Horizontes Digitales:
Sitio Web: https://horizontesdigitaleschatg.podview.com/ Instagram: @hori.zontesdigitales
LinkedIn: https://linkedin.com/in/leh-english
Threads: @Luis_e_huizzi
📩 Recibe nuestras novedades: Únete a nuestra comunidad y recibe recursos exclusivos en: https://luishuizzi.substack.com/
💼 ¿Colaboraciones o Patrocinios?
Escríbenos a: [email protected]
¿Te gustaría apoyar este proyecto?
Puedes ayudarnos a seguir creando contenido de valor aquí:
🔗 Apoya el podcast en Spreaker
Conéctate con nosotros: Mantente a la vanguardia y únete a la conversación en nuestras redes sociales. ¡Gracias por ser parte de nuestra comunidad!
Este episodio incluye contenido generado por IA.
Speaker 2: Imagina esto. Estás caminando por la calle, hablando con alguien
Speaker 2: que conoces bien. No esperas a que termine la frase
Speaker 2: para reaccionar. No hay silencios incómodos. Si te interrumpe, no
Speaker 2: te ofendes. Si tú la interrumpes, ella tampoco. Es una
Speaker 2: conversación real, fluida, humana. Ahora imagina que ese alguien es
Speaker 2: una inteligencia artificial. Durante años, hablar con ChatGPT por voz
Speaker 2: se sintió como usar un walkie-talkie. Cambio y fuera. Esperar
Speaker 2: su turno, escuchar un silencio artificial antes de que la
Speaker 2: máquina reaccionara. Pero el 8 de julio de 2026, eso cambió. Y
Speaker 2: hoy te voy a contar exactamente qué pasó, por qué
Speaker 2: importa y qué significa para el futuro de cómo hablamos
Speaker 2: con las máquinas. Bienvenidos a Horizontes Digitales. Soy tu conductor
Speaker 2: Luis Quixin en este recorrido semanal por el filo más
Speaker 2: afilado de la tecnología, donde la inteligencia artificial deja de
Speaker 2: ser un concepto abstracto y se convierte en algo que
Speaker 2: cambia literalmente. Como vivimos, trabajamos y nos comunicamos. En el
Speaker 2: episodio de hoy vamos a hablar de ChatGPT Live, el
Speaker 2: nuevo sistema de voz de OpenAI que reemplaza el clásico
Speaker 2: modo de voz avanzado de ChatGPT. Y no, no es
Speaker 2: solo una actualización más. Es un cambio de arquitectura que
Speaker 2: promete resolver uno de los problemas más frustrantes de la
Speaker 2: inteligencia artificial conversacional, la torpeza al hablar. Vamos a recorrer
Speaker 2: juntos qué es exactamente esta tecnología. cómo funciona por dentro,
Speaker 2: qué la hace diferente de todo lo anterior, quién puede
Speaker 2: usarla ya mismo y como siempre en este podcast, qué
Speaker 2: recomendaciones prácticas te llevas a casa al final del episodio.
Speaker 2: Así que ponte cómodo, cómoda, ajustas tus audífonos y empecemos.
Speaker 2: Para entender por qué GPT Live es tan importante, primero
Speaker 2: tenemos que entender que estaba mal antes. Piensa en cómo
Speaker 2: funcionaban los asistentes de voz hasta ahora, incluyendo el propio
Speaker 2: chat GPT. El proceso era, en esencia, una cadena de
Speaker 2: tres pasos separados. Primero, un sistema transcribía tu voz a texto. Después,
Speaker 2: Un modelo de lenguaje generaba una respuesta escrita y finalmente
Speaker 2: otro sistema convertía ese texto de vuelta en audio. Tres eslabones,
Speaker 2: uno detrás del otro, como una fila de dominós. El
Speaker 2: problema es que esa cadena solo podía avanzar en un
Speaker 2: sentido a la vez. Mientras tú hablabas, la máquina escuchaba
Speaker 2: en silencio. Y mientras la máquina hablaba, tú tenías que
Speaker 2: esperar porque el sistema no estaba realmente escuchando. en ese momento.
Speaker 2: Los ingenieros llaman a esto un modelo de media duplex
Speaker 2: o semi-duplex, solo un canal activo a la vez, exactamente
Speaker 2: como una radio se ve de camionero. Hablas, dices cambio
Speaker 2: y ahora escuchas. Además, si necesitabas que buscara algo en
Speaker 2: internet o resolviera un problema complejo, tenías que esperar. La
Speaker 2: conversación se detenía por completo mientras el sistema procesaba la tarea. Era,
Speaker 2: en palabras simples, una conversación con fricción constante. Y esto
Speaker 2: no es un detalle menor. Según cifras que la propia
Speaker 2: OpenAI ha compartido, más de 150 millones de personas usan semanalmente
Speaker 2: funciones de voz y dictado en chat GPT. Hablamos de
Speaker 2: un uso masivo cotidiano para practicar idiomas, para pedir ayuda
Speaker 2: sin usar las manos. para conversar durante un viaje en coche,
Speaker 2: y todas esas personas estaban lidiando, sin saberlo del todo,
Speaker 2: con esa arquitectura rígida y anticuada. Entonces la pregunta que
Speaker 2: se hicieron en OpenAI fue,¿ y si la máquina pudiera
Speaker 2: escuchar y hablar al mismo tiempo como hacemos los humanos?
Speaker 2: Aquí es donde entra GPT Live. El 8 de julio, OpenAI
Speaker 2: presentó esta nueva familia de modelos de voz, disponible en
Speaker 2: dos versiones, GPT Live 1, la versión más potente, reservada para
Speaker 2: los planes de pack, y GPT Live 1 Mini, una versión
Speaker 2: más ligera pensada para usuarios de plan gratuito. Ambos comenzaron
Speaker 2: a desplegarse ese mismo día en las aplicaciones de iOS,
Speaker 2: Android y en la versión web de ChatGPT. La palabra
Speaker 2: clave aquí es Full Duplex o Duplex Completo. En lugar
Speaker 2: de esperar turnos, el modelo procesa el audio que entra
Speaker 2: y genera su respuesta de manera simultánea. Es la misma
Speaker 2: lógica de una llamada telefónica normal, donde ambas personas pueden hablar,
Speaker 2: interrumpirse y reaccionar en tiempo real sin necesidad de protocolos artificiales.¿
Speaker 2: Y cómo se traduce esto en la práctica? De varias
Speaker 2: maneras muy concretas. Primero, puedes interrumpir a la IA sin
Speaker 2: generar caos. Si empieza a explicarte algo que ya sabes,
Speaker 2: simplemente hablas encima y el sistema entiende que debe detenerse
Speaker 2: y escucharte. Segundo, el modelo da señales de que está
Speaker 2: prestando atención mientras hablas, con pequeños sonidos como o si entiendo,
Speaker 2: tal como haría una persona real en una conversación. Esto
Speaker 2: que suena casi trivial, cambia por completo la sensación de
Speaker 2: estar hablando con algo vivo en lugar de un menú
Speaker 2: de opciones. Tercero, y esto es clave, los silencios ya
Speaker 2: no generan una respuesta apresurada. Si te quedas pensando en
Speaker 2: un momento, GPT Live puede sostener esa pausa en lugar
Speaker 2: de llenarla de inmediato, entendiendo que estás organizando tus ideas.
Speaker 2: Y cuarto, ahora existe la posibilidad de traducción en tiempo
Speaker 2: real durante la conversación, algo que la arquitectura anterior no
Speaker 2: permitía hacer de forma fluida. Pero quizás lo más interesante
Speaker 2: desde este punto de vista técnico es cómo resolvieron el
Speaker 2: tema de la inteligencia. Porque aquí surge una tensión. Un
Speaker 2: modelo optimizado para hablar rápido y natural no necesariamente es
Speaker 2: el modelo más inteligente para resolver problemas complejos. La solución
Speaker 2: de OpenAI fue separar las dos funciones y Peter Life
Speaker 2: se encarga de la conversación, del ritmo, de la naturalidad.
Speaker 2: Pero cuando detecta que una pregunta requiere una búsqueda en Internet,
Speaker 2: un razonamiento profundo, una tarea más compleja, delega esa parte
Speaker 2: del trabajo a su modelo más avanzado, actualmente GPT 5.5, que
Speaker 2: trabaja en segundo plano. Mientras ese proceso ocurre, GPT Live
Speaker 2: sigue sosteniendo la conversación contigo y cuando la respuesta está lista,
Speaker 2: la integra de forma natural sin que sientas que se
Speaker 2: quedó pensando y desapareció. Es en cierto sentido como tener
Speaker 2: a alguien que charla contigo mientras en paralelo consulta con
Speaker 2: un experto para darte la mejor respuesta posible. Ahora bien,
Speaker 2: Capital Live no es solo una mejora de fluidez conversacional,
Speaker 2: trae consigo un paquete de funciones que vale la pena desglosar.
Speaker 2: Por un lado está el sistema de niveles de razonamiento.
Speaker 2: Los usuarios de planes pagos pueden elegir entre tres modos, instantáneo,
Speaker 2: medio y alto esfuerzo de razonamiento. Esto significa que puedes decidir,
Speaker 2: según la situación, si quieres respuestas rápidas y directas o
Speaker 2: si prefieres que el mismo sistema se tome un poco
Speaker 2: más de tiempo internamente para darte un análisis más elaborado.
Speaker 2: Por otro lado, se incorporan tarjetas visuales durante la conversación
Speaker 2: de voz. Es decir, si le preguntas por el clima...
Speaker 2: por una cotización de bolsa, por un resultado deportivo o
Speaker 2: le pides indicaciones en un mapa, el sistema puede mostrarte
Speaker 2: esa información visualmente en pantalla mientras la conversación de voz
Speaker 2: continúa sin interrupciones. Esto combina lo mejor de dos mundos,
Speaker 2: la naturalidad del habla y la precisión de la información visual.
Speaker 2: También se renovaron las voces disponibles. OpenAI remasterizó las nueve
Speaker 2: voces distintas que ya existían en ChatGPT para adaptarlas a
Speaker 2: esta nueva arquitectura, buscando que suenen más naturales y más expresivas.
Speaker 2: Y aquí hay un matiz importante que no todos están mencionando.
Speaker 2: GPT Live, al menos por ahora, no soporta conversaciones con
Speaker 2: video ni con la posibilidad de compartir pantalla. Si necesitas
Speaker 2: mostrarle algo a ChatGPT con la cámara o compartir lo
Speaker 2: que ves en tu computadora mientras hablas, todavía tienes que
Speaker 2: recurrir a las versiones anteriores, el modo de voz estándar
Speaker 2: o el modo de voz avanzado que siguen disponibles en paralelo.
Speaker 2: OpenAI ha dicho que está trabajando para incorporar esas capacidades
Speaker 2: más adelante, pero todavía no hay una fecha confirmada. En
Speaker 2: materia de seguridad, la compañía también amplió sus evaluaciones para
Speaker 2: conversaciones de voz, específicamente en torno a temas sensibles como
Speaker 2: la autolesión, episodios de psicosis o manía, la dependencia emocional
Speaker 2: hacia la IA, la violencia y el contenido sexual. El
Speaker 2: sistema puede reconducir una conversación en tiempo real, mostrar recursos
Speaker 2: de ayuda o incluso finalizar una sesión si detecta una
Speaker 2: situación de alto riesgo. Es un detalle que vale la
Speaker 2: pena mencionar porque muestra que a medida que estas herramientas
Speaker 2: se vuelven más humanas en su forma de hablar, también
Speaker 2: aumenta la responsabilidad de quienes la construyen. Y un dato
Speaker 2: que ilustra bien el salto en capacidad. En una prueba
Speaker 2: específica de búsqueda web durante conversaciones conocida como BrowseCom, la
Speaker 2: versión anterior del modo de voz apenas lograba resolver una
Speaker 2: fracción mínima de las tareas, mientras que GPT-Live alcanza un
Speaker 2: porcentaje de acierto muy superior. La diferencia en números es
Speaker 2: enorme y confirma que no se trata solo de sonar
Speaker 2: más natural, sino de ser efectivamente más capaz. Vale la
Speaker 2: pena detenernos un momento a pensar en el contexto más
Speaker 2: amplio de este lanzamiento. Durante la presentación, uno de los
Speaker 2: responsables del producto de voz en OpenAI compartió que había
Speaker 2: mantenido conversaciones de 30 a 40 minutos usando esta nueva tecnología simplemente caminando.
Speaker 2: Y esa anécdota no es casual, refleja hacia dónde apunta
Speaker 2: la visión de la compañía. No se trata únicamente de
Speaker 2: responder preguntas rápidas, sino de convertir la voz en una
Speaker 2: interfaz primaria para trabajar con inteligencia artificial durante periodos largos
Speaker 2: incluyendo tareas complejas y de varios pasos. Esto conecta con
Speaker 2: una tendencia que hemos venido observando en la industria. la
Speaker 2: carrera por convertir la conversación hablada en el punto de
Speaker 2: entrada principal hacia sistemas de inteligencia artificial cada vez más
Speaker 2: capaces de ejecutar tareas por sí mismos, no solo en
Speaker 2: responder preguntas. En ese sentido, GPT Live no compite solamente
Speaker 2: con asistentes de voz tradicionales, sino con toda una generación
Speaker 2: de compañías que están apostando por la conversación fluida como
Speaker 2: núcleo de sus productos. Y no es casualidad que esto
Speaker 2: ocurra justo antes del lanzamiento de un nuevo modelo insignia
Speaker 2: de OpenAI conocido como GPT-5.6, orientado a mejorar el razonamiento,
Speaker 2: la programación y la creatividad de forma general. GPT-Live parece ser,
Speaker 2: en cierto modo, la puerta de entrada conversacional a ese
Speaker 2: ecosistema más amplio que la compañía está construyendo. Lo interesante
Speaker 2: desde una perspectiva de industria es que esta no es
Speaker 2: una carrera en solitario. Otras compañías, tanto gigantes tecnológicos como
Speaker 2: startups especializados en voz, están explorando también arquitecturas de conversación simultánea.
Speaker 2: Esto sugiere... que lo que hoy parece una novedad llamativa,
Speaker 2: en un par de años podría convertirse en el estándar
Speaker 2: esperado para cualquier asistente conversacional. De la misma manera en
Speaker 2: que hace no tanto tiempo esperar segundos eternos por una
Speaker 2: respuesta de texto nos parecía normal. Y llegamos al momento
Speaker 2: que más me gusta de cada episodio, traducir toda esta
Speaker 2: información en algo que puedes usar tú hoy mismo. Primera recomendación.
Speaker 2: Si probaste el modo de voz de ChatGPT en el
Speaker 2: pasado y te pareció rígido, lento o poco útil, este
Speaker 2: es un buen momento para darle una segunda oportunidad. La
Speaker 2: experiencia que describen quienes ya lo probaron es sustancialmente distinta
Speaker 2: a la que existía hace apenas una semana. Segunda recomendación.
Speaker 2: Si tu plan es gratuito, no esperes exactamente la misma
Speaker 2: experiencia que quienes pagan por ChatGPT. La versión mini es
Speaker 2: más limitada, así que ajusta tus expectativas y evalúa si
Speaker 2: el salto a un plan de pago tiene sentido según
Speaker 2: cuánto uses la función de voz en tu día a día.
Speaker 2: Tercera recomendación, si tu trabajo depende de compartir pantalla o
Speaker 2: usar la cámara mientras conversas con la inteligencia artificial, no
Speaker 2: elimines todavía el modo de voz avanzado de tus herramientas.
Speaker 2: Esa función en particular sigue viviendo únicamente en la versión anterior,
Speaker 2: al menos por ahora. Cuarta recomendación, aprovecha los niveles de
Speaker 2: razonamiento si tienes acceso a ellos. No todas las conversaciones
Speaker 2: necesitan la máxima potencia de análisis. Preservar el modo de
Speaker 2: esfuerzo alto para preguntas realmente complejas te dará respuestas más
Speaker 2: rápidas en el día a día y más profundas cuando
Speaker 2: de verdad las necesites. Y quinta, quizás la más importante,
Speaker 2: si vas a usar estas herramientas de voz de forma prolongada,
Speaker 2: mantén presente que siguen siendo sistemas de inteligencia artificial, no
Speaker 2: compañías reales de verdad ni sustitutos de vínculos humanos. La
Speaker 2: naturalidad de la conversación es un logro técnico impresionante, pero
Speaker 2: no debería confundirse con una relación genuina. Úsala como una
Speaker 2: herramienta poderosa para aprender, producir y resolver problemas, y no
Speaker 2: como reemplazo de las conversaciones que de verdad nos sostienen.
Speaker 2: Y así llegamos al final de este recorrido por uno
Speaker 2: de los cambios más significativos que ha tenido la voz
Speaker 2: artificial en los últimos años. Lo que empezó como una
Speaker 2: simple frustración, esa sensación incómoda de hablar con una máquina
Speaker 2: que no sabía escuchar de verdad, hoy se está resolviendo
Speaker 2: con una arquitectura pensada literalmente para imitar el ritmo natural
Speaker 2: de una conversación humana. Y si algo nos enseña la
Speaker 2: historia reciente de la inteligencia artificial, es que estos pequeños
Speaker 2: saltos técnicos los que parecen detalles de ingeniería terminan cambiando
Speaker 2: por completo la forma en que interactuamos con la tecnología
Speaker 2: todos los días. Si este episodio te ayudó a entender
Speaker 2: mejor qué es GPT Live y por qué está dando
Speaker 2: de qué hablar, te invito a suscribirte a Horizontes Digitales
Speaker 2: en la plataforma donde nos estás escuchando ahora mismo. Así
Speaker 2: no te pierdes ningún episodio de esta serie donde exploramos
Speaker 2: semana a semana las noticias que de verdad están moldeando
Speaker 2: el futuro digital. Y si te gustó lo que escuchaste hoy,
Speaker 2: compártelo con esta persona que todavía usa la inteligencia artificial
Speaker 2: solo para preguntas rápidas y no sabe todo lo que
Speaker 2: se está perdiendo. Déjanos también tu opinión en los comentarios.¿
Speaker 2: Ya probaste GPT Live?¿ Sentiste la diferencia? Nos encantaría leer
Speaker 2: tu experiencia. Nos escuchamos en el próximo episodio de Horizontes Digitales.
Speaker 2: Soy Luis Huitzi. Hasta entonces, sigue explorando, sigue preguntando y
Speaker 2: no dejes de mirar hacia el horizonte digital que se
Speaker 2: sigue construyendo todos los días. Un poco más rápido de
Speaker 2: lo que imaginamos.
Podbean