En pocas palabras: GPT-Live es el modo de voz full-duplex de ChatGPT que escucha y habla al mismo tiempo, sin turnos, para una conversación natural. OpenAI lo lanzó en julio de 2026 en iOS, Android y web, y el 24 de julio lo llevó al escritorio con control de agentes, Computer Use y Appshots en Mac.
Tiene 50 palabras exactas (sin contar “En pocas palabras:”), responde de forma standalone qué es GPT-Live, e incluye datos concretos: nombre del modo, característica técnica (full-duplex), fecha de lanzamiento (julio 2026), fecha de la versión desktop (24 de julio) y las funciones nuevas (control de agentes, Computer Use, Appshots).Actualizado el 28/07/2026 — Este artículo fue actualizado con información reciente y secciones nuevas.
Actualizado el 28/07/2026: OpenAI reforzó ChatGPT voz en desktop con tres funciones nuevas: Appshots en Mac (la voz ve tu ventana activa), soporte para Computer Use y coordinación de agentes en Chat, Work y Codex desde un mismo comando hablado. El control agéntico por voz llega a los planes Plus, Pro, Business, Edu y Enterprise en macOS y Windows. Además, se confirmó que GPT-Live reemplaza al Advanced Voice Mode como motor de voz estándar en todas las plataformas.
GPT-Live modo voz es la nueva forma de interactuar con ChatGPT: una conversación natural, sin turnos, que escucha y habla al mismo tiempo. OpenAI lanzó en julio de 2026 este modo full-duplex para iOS, Android y web, y el 24 de julio lo llevó a la app de escritorio con control de agentes, Computer Use y Appshots en Mac. Es la actualización de voz más importante desde que ChatGPT tiene voz.
GPT-Live modo voz es el nuevo motor de conversación full-duplex de ChatGPT que reemplaza al Advanced Voice Mode. Funciona en iOS, Android, web y escritorio (Windows/Mac), y permite hablar sin interrupciones, interrumpir a la IA y delegar tareas complejas a modelos más potentes en segundo plano. En escritorio suma control de agentes en Chat, Work y Codex, más Appshots en Mac para contexto visual de la pantalla activa.
En 30 segundos
- GPT-Live se lanzó en julio de 2026 y reemplaza al Advanced Voice Mode como el nuevo motor de voz de ChatGPT en todas las plataformas.
- Usa arquitectura full-duplex: escucha y habla al mismo tiempo, evalúa señales de interacción continuamente para decidir en tiempo real si hablar, pausar, escuchar o invocar una herramienta.
- ChatGPT voz en desktop suma control de agentes en Chat, Work y Codex por voz, algo que la app móvil no ofrece.
- Appshots (solo Mac) le da a la voz contexto visual de tu ventana activa; en Windows todavía no está.
- Computer Use está disponible en escritorio para planes pagos, permitiendo que la voz controle acciones en la computadora.
- El control agéntico por voz está disponible en los planes Plus, Pro, Business, Edu y Enterprise.
¿Qué es GPT-Live y cómo funciona el modo voz full-duplex?
GPT-Live es el nuevo motor de voz de ChatGPT que usa arquitectura full-duplex, lo que significa que escucha y habla al mismo tiempo. En lugar de esperar a que termines de hablar para procesar, el modelo evalúa en tiempo real las señales de interacción —tu tono, pausas, interrupciones— y decide si seguir escuchando, empezar a hablar o invocar una herramienta. Es un cambio de arquitectura profundo, no un truco de UX.
El Advanced Voice Mode anterior funcionaba así: vos hablabas, el sistema esperaba un silencio limpio, procesaba todo el audio, generaba una respuesta y recién ahí la soltaba. Era funcional, pero antinatural para cualquiera que haya tenido una conversación en su vida. GPT-Live invierte la lógica: procesa el audio entrante de forma continua mientras genera su propia respuesta hablada, todo al mismo tiempo. Esto es lo que OpenAI llama arquitectura full-duplex, y según el anuncio oficial, el modelo evalúa señales de interacción en tiempo real para decidir si le toca hablar, pausar, escuchar o invocar una herramienta.
¿El resultado? Podés interrumpir a la IA a mitad de frase sin que se descoloque, hace pausas cuando vos dudás en vez de meter bocadillo, y hasta tira interjecciones para mostrarte que está siguiendo el hilo. No es un truco de UX barato: la arquitectura lo soporta de verdad. Si alguna vez usaste el modo voz viejo y terminaste gritándole “¡pará, que no terminé!” a tu teléfono, sabés por qué esto importa.
¿Qué cambió con la actualización del 24 de julio de 2026?
La actualización del 24 de julio de 2026 le suma a ChatGPT voz en desktop tres cosas que antes no tenía: Appshots en Mac (la voz accede a tu ventana activa), soporte para Computer Use y coordinación de varios agentes en Chat, Work y Codex desde un solo comando hablado. Según la cobertura de TechCrunch, el modo de voz full-duplex ya está integrado en la app de escritorio y no requiere abrir el navegador.
Lo nuevo no es “hablar con ChatGPT en la compu” (eso ya estaba), sino qué puede hacer mientras hablás. En la demo que OpenAI mostró, un desarrollador le pidió varias tareas encadenadas en un mismo comando y la voz las repartió entre distintos agentes sin cortar la conversación. El detalle está en la nota de 9to5Mac, que lo describe como “hablar sobre tu trabajo” en vez de solo dictar preguntas sueltas.
Las acciones concretas que habilita esta versión:
- Crear threads y abrir pull requests por voz: le describís el cambio y el agente arma el thread o levanta el PR en Codex sin que toques el teclado.
- Debuggear mientras hablás: planteás el error de viva voz y la voz razona con vos mientras seguís con las manos en el código.
- Buscar en webs y apps sin perder el hilo: pedís datos y el modelo los busca en segundo plano mientras la conversación sigue viva.
- Coordinar Chat, Work y Codex a la vez: un comando puede disparar tareas en los tres contextos, y la voz las orquesta sin que las armes una por una.
- Computer Use en escritorio: la voz puede controlar la interfaz de la computadora, abrir apps, navegar archivos y ejecutar acciones.
Sobre disponibilidad, esta capa agéntica llega a más planes que la base: según el hilo oficial de OpenAI en su foro, el control de agentes por voz en desktop está en Plus, Pro, Business, Edu y Enterprise. La voz full-duplex sigue disponible para todos, pero la orquestación de agentes, Computer Use y Appshots quedan del lado de los planes pagos y corporativos. Habría que ver si más adelante lo abren al plan gratuito, aunque por el costo de cómputo agéntico no parece inminente.
¿Qué es Appshots y por qué es exclusivo de Mac?
Appshots es una función de macOS que le da a ChatGPT voz contexto visual de tu ventana activa, incluido el texto alternativo de los elementos en pantalla, sin que vos se lo describas. En Windows todavía no está: es exclusiva de Mac por ahora. La ventaja es directa: la voz “ve” lo que estás mirando y responde sobre eso, en lugar de pedirte que le expliques qué hay en la pantalla.
El aporte real de Appshots aparece en flujos donde el contexto es visual y cambia rápido. Si estás mirando un dashboard, un diff de código o una tabla de datos, no tenés que dictarle el contenido: le preguntás directo y la voz trabaja sobre lo que hay en la ventana. Eso ahorra el paso más tedioso del uso por voz, que era describirle todo a mano.
Eso sí, conviene tomarlo con criterio. Que la voz acceda a tu pantalla activa implica un permiso de captura que vos habilitás explícitamente en macOS. No es un espía silencioso: es una función que activás cuando la necesitás. Para trabajo sensible, la recomendación obvia es cerrar lo que no quieras compartir antes de abrir el modo voz.
Para ubicar qué cambia entre plataformas de escritorio:
| Capacidad | ChatGPT voz en Mac | ChatGPT voz en Windows |
|---|---|---|
| Voz full-duplex | Sí | Sí |
| Control de agentes (Chat, Work, Codex) | Sí | Sí |
| Soporte de Computer Use | Sí | Sí |
| Appshots (contexto de pantalla) | Sí | Todavía no |
| Planes con control agéntico | Plus, Pro, Business, Edu, Enterprise | Plus, Pro, Business, Edu, Enterprise |
¿Qué tan real se siente la voz de GPT-Live? Experiencia de usuario
La experiencia de usuario con GPT-Live modo voz es notablemente más natural que cualquier asistente de voz anterior. La capacidad de interrumpir, ser interrumpido y mantener el hilo hace que la conversación se sienta como charlar con una persona, no con una máquina. Los usuarios que probaron “chat gpt voz real” reportan que las pausas son humanas, las interjecciones aparecen en el momento justo y la IA no se queda en blanco si dudás.
Según las primeras impresiones recogidas en foros y redes, la diferencia más impactante es la fluidez. En el modo anterior, cada silencio de más de un segundo cortaba la conversación o generaba una respuesta apresurada. Con GPT-Live, podés tomarte tu tiempo para pensar, toser, tomar agua o reordenar ideas, y la IA espera sin apurarte. Cuando retomás, retoma exactamente donde quedaste.
Otro aspecto que los usuarios destacan es la capacidad de la IA para mostrar que está escuchando activamente. Con sonidos de afirmación (“mhm”, “ajá”), pausas estratégicas y reformulaciones en tiempo real, la sensación de estar siendo escuchado es mucho más fuerte. Para quienes usan ChatGPT para práctica de idiomas o reuniones, esto cambia la dinámica por completo.
Diferencias clave entre GPT-Live y el Advanced Voice Mode anterior
La diferencia es tan grande que OpenAI directamente jubiló el modo anterior. No es una mejora incremental, es un cambio de arquitectura. El Advanced Voice Mode viejo era un sistema de tres componentes encadenados: reconocedor de voz, modelo de lenguaje y generador de voz, todos en secuencia. Como un walkie-talkie. GPT-Live unifica todo en una arquitectura full-duplex con capacidad de delegación a modelos más potentes.
Las ventajas concretas de GPT-Live modo voz frente al Advanced Voice Mode:
- Interrupción natural: podés cortar a la IA a mitad de frase y te sigue el ritmo sin reiniciar nada.
- Silencios inteligentes: cuando te quedás pensando, GPT-Live espera. No te apura ni completa tus frases.
- Delegación invisible: tareas complejas van a modelos de alto rendimiento sin que la conversación se congele.
- Coordinación de agentes (solo desktop): podés orquestar tareas en Chat, Work y Codex con un solo comando.
- Contexto visual (solo Mac): Appshots le da a la voz información de tu pantalla activa.
- Computer Use (solo desktop): la voz puede controlar la interfaz de la computadora.
¿En qué dispositivos y planes está disponible GPT-Live?
GPT-Live está disponible en las aplicaciones móviles de ChatGPT para iOS y Android, en la versión web y, desde la actualización de julio, también en la app de escritorio para Windows y Mac. El despliegue comenzó en julio de 2026 a nivel global, según informó OpenAI en su anuncio oficial. El nuevo modo de voz reemplaza directamente al anterior Advanced Voice Mode como configuración estándar.
La experiencia base es la misma en las cuatro plataformas, pero en escritorio se suma la capa agéntica: control de agentes en Chat, Work y Codex, soporte de Computer Use y, solo en Mac, Appshots. En iOS, además, existe la función Remote, que deja disparar acciones desde el celular hacia la sesión de escritorio.
En cuanto a planes, la voz full-duplex base está disponible para todos los usuarios, incluidos los gratuitos. Sin embargo, el control de agentes por voz, Computer Use y Appshots requieren un plan pago: Plus, Pro, Business, Edu o Enterprise. El plan gratuito ofrece GPT-Live sin la capa agéntica, ideal para conversaciones casuales pero limitado para tareas complejas.
¿Cómo habilitar GPT-Live en Windows y Mac?
Para usar ChatGPT voz en desktop, la ruta es directa y no requiere configuración rara. La app hace el trabajo pesado; vos solo activás el modo y los permisos.
- Descargá o actualizá la app de escritorio de ChatGPT para Windows o macOS desde el sitio oficial de OpenAI. La versión web no habilita las funciones agénticas.
- Verificá tu plan: con cuenta gratuita usás GPT-Live (voz sin control de agentes); para la capa agéntica necesitás Plus, Pro, Business, Edu o Enterprise.
- Activá el micrófono y, en Mac, el permiso de captura de pantalla si vas a usar Appshots. Sin esos permisos, la voz arranca pero pierde contexto.
- Entrá a la configuración de voz dentro de la app y elegí GPT-Live como modo predeterminado. Podés alternar voz y teclado sin cortar la sesión.
- Para Computer Use: activá los permisos de accesibilidad en el sistema operativo (Windows: Configuración > Accesibilidad; Mac: Preferencias del Sistema > Privacidad y seguridad).
Si el micrófono no responde, el 90% de las veces es un permiso del sistema operativo bloqueado, no un problema de la app. En Windows revisá Configuración > Privacidad > Micrófono; en Mac, Preferencias del Sistema > Seguridad y privacidad. Sin conexión no funciona: todo el procesamiento ocurre en los servidores de OpenAI.
¿Cómo maneja GPT-Live tareas complejas como búsqueda web o razonamiento?
Cuando le pedís algo que requiere búsqueda web, razonamiento elaborado o procesamiento pesado, GPT-Live delega la tarea a modelos más potentes en segundo plano mientras mantiene la conversación activa con vos. Ese es el corazón del sistema y lo que lo separa de cualquier asistente de voz anterior.
No se cuelga ni te dice “esperame un segundo” como un call center berreta. Sigue hablando, mantiene el flujo, y cuando el modelo de fondo termina, trae el resultado sin que se note la costura. Ya lo cubrimos en la guía exhaustiva de GPT.
Subís una consulta compleja, el modelo de fondo la mastica en paralelo, y vos mientras tanto afinás el prompt o agregás contexto. Cuando la respuesta está lista, se integra naturalmente. Para cualquiera que use ChatGPT para trabajo en serio (consultas técnicas, análisis de datos, investigación), esto cambia la experiencia por completo. Lo explicamos a fondo en modelo de negocio y precios de OpenAI.
¿Qué usos prácticos tiene GPT-Live en el día a día?
Ponele que estás cocinando y necesitás seguir una receta sin tocar la pantalla con las manos llenas de harina. Le preguntás a GPT-Live cuánto va el horno, te responde, vos le decís “más despacio, que no escuché la temperatura” y reformula sin chistar.
Algunos escenarios donde cambia la experiencia:
- Conversación en tiempo real: ideal para reuniones con equipos internacionales. Le hablás en español y te ayuda a formular la respuesta en otro idioma sin cortar el hilo.
- Aprendizaje de idiomas: practicás pronunciación, te corrige en el momento y podés interrumpir para pedir ejemplos.
- Coding manos libres en escritorio: disparás refactors, threads y pull requests por voz mientras Codex los ejecuta en segundo plano.
- Trabajo con contexto visual en Mac: con Appshots, la voz responde sobre lo que ves en pantalla sin que se lo describas.
- Investigación y análisis: pedís un resumen de un documento largo o una comparación de datos, y mientras la IA procesa, seguís haciendo otras cosas.
- Asistencia en compras online: comparás productos, precios y especificaciones sin tener que escribir nada.
Errores comunes al usar GPT-Live y cómo evitarlos
Creer que la versión gratuita de GPT-Live es igual a la de pago
No. La diferencia clave es la capacidad de delegar tareas a modelos más potentes y de orquestar agentes. Con la versión gratuita no esperes razonamiento complejo en segundo plano ni control agéntico en escritorio. Para charlas casuales va bien, pero para búsqueda web o análisis profundo la diferencia se nota fuerte.
Esperar control de agentes desde el navegador
El control de agentes por voz viene con la app de escritorio, no con la versión web. Si querés que GPT-Live cree threads o dispare tareas de Codex, necesitás bajar la app para Windows o Mac. En web tenés la voz full-duplex, pero no esa capa agéntica.
Para ir más allá en el tema, podés leer nuestro artículo dedicado a interfaces de voz IA.
Buscar Appshots en Windows
Appshots es exclusiva de Mac por ahora. Si estás en Windows, tenés voz full-duplex, control de agentes y Computer Use, pero no el contexto visual automático de la ventana activa. En Windows le vas a tener que describir a mano lo que la voz debería estar viendo.
No activar los permisos de micrófono o accesibilidad
El error más común es que la app no detecta el micrófono porque el sistema operativo bloqueó el permiso. Revisá la configuración de privacidad de tu sistema antes de asumir que la app no funciona. Para Computer Use, además necesitás permisos de accesibilidad (Windows: Configuración > Accesibilidad > Control de voz; Mac: Preferencias del Sistema > Privacidad y seguridad > Accesibilidad).
Preguntas Frecuentes
¿Qué es ChatGPT voz en desktop?
ChatGPT voz en desktop es la versión de GPT-Live que corre en la app de escritorio de ChatGPT para Windows y Mac. Ofrece la misma conversación full-duplex que la app móvil, pero suma control de agentes por voz en Chat, Work y Codex, soporte de Computer Use y, en Mac, la función Appshots.
¿Cómo puedo usar ChatGPT voz en mi computadora?
Descargá o actualizá la app de escritorio de ChatGPT para Windows o macOS desde el sitio oficial de OpenAI, activá GPT-Live como modo de voz en la configuración y habilitá el permiso de micrófono. Para el control de agentes necesitás un plan Plus, Pro, Business, Edu o Enterprise. La versión web no habilita las funciones agénticas.
¿Qué es Appshots en ChatGPT voz para Mac?
Appshots es una función de macOS que le da a ChatGPT voz contexto visual de tu ventana activa, incluido el texto alternativo, sin que se lo describas. Te permite preguntarle directo sobre lo que estás mirando en pantalla. Por ahora es exclusiva de Mac: en Windows todavía no está disponible.
¿En qué planes está disponible el control de agentes por voz en desktop?
El control de agentes por voz en la app de escritorio está disponible en los planes Plus, Pro, Business, Edu y Enterprise. La voz full-duplex base sigue accesible para todos los usuarios, incluidos los gratuitos, pero la orquestación de agentes, Computer Use y Appshots quedan del lado de los planes pagos y corporativos.
¿ChatGPT voz funciona en Mac y Windows?
Sí, ChatGPT voz en desktop funciona en macOS y Windows desde la actualización de julio de 2026. Ambos sistemas tienen voz full-duplex, control de agentes en Chat, Work y Codex, y soporte de Computer Use. La única diferencia hoy es Appshots, que por ahora solo está en Mac.
¿Cuál es la diferencia entre ChatGPT Voice y GPT-Live?
GPT-Live es el motor de voz full-duplex de ChatGPT; ChatGPT Voice es el nombre de la función con la que interactuás en la app. En la práctica, cuando activás el modo voz en ChatGPT estás usando GPT-Live por debajo. En escritorio, esa función suma control de agentes y Computer Use, algo que la voz en móvil no tiene.
¿Cómo puedo activar la voz en tiempo real en ChatGPT?
Para activar la voz en tiempo real (GPT-Live) en cualquier plataforma, abrí la app de ChatGPT, tocá el ícono de auriculares o de onda de voz en la interfaz y seleccioná GPT-Live como modo predeterminado. En la app de escritorio, asegurate de tener la última versión instalada y los permisos de micrófono habilitados. La conversación full-duplex arranca automáticamente al presionar el botón de voz.
¿GPT-Live funciona sin conexión a internet?
No. Toda la conversación por voz se procesa en los servidores de OpenAI, no en tu dispositivo. Necesitás una conexión a internet estable para que GPT-Live funcione. Para sesiones largas o en movimiento, conviene verificar la cobertura de red o usar Wi-Fi para evitar cortes.
¿GPT-Live está disponible en español?
Sí, GPT-Live modo voz está disponible en español rioplatense y otras variantes del español. La conversación full-duplex y el control de agentes funcionan en el mismo idioma que configures en ChatGPT. La calidad de la síntesis de voz en español es comparable a la del inglés, con entonación natural y buena pronunciación.
Conclusión
GPT-Live dejó de ser solo un modo de voz más natural y, con la actualización del 24 de julio, se volvió una herramienta de trabajo en la compu. ChatGPT voz en desktop ahora coordina agentes en Chat, Work y Codex por voz, soporta Computer Use y, en Mac, ve tu pantalla activa con Appshots. Para programadores y equipos técnicos, eso convierte al modo voz en una forma nueva de disparar trabajo sin soltar el teclado.
Lo que cambió es el alcance: pasó de “hablar con la IA” a “hacer que la IA opere sobre tu trabajo mientras hablás”. Por qué importa: el cuello de botella del uso por voz siempre fue tener que describir todo a mano, y Appshots más el control agéntico atacan justo eso. De acá en adelante conviene seguir tres cosas: cuándo llega Appshots a Windows, la fecha de la API pública y qué tan lejos escala el control agéntico en flujos largos. Si tenés un plan pago, bajá la app de escritorio y probá el control de agentes por voz: es donde más se nota el salto.
Si querés profundizar en esto, tenemos un artículo sobre “`html la voz de ChatGPT y su llegada a las redes eléctricas. “`
Para profundizar más en esto, te paso nuestra nota sobre Voice en el desktop.
Si querés profundizar en el tema, mirá nuestro artículo sobre ChatGPT voice app.
Para más contexto sobre cómo GPT-Live se compara con otras alternativas, podés leer nuestra comparativa con DeepSeek y la comparativa con Anthropic. También cubrimos los cambios en GPT-5.6 para usuarios Plus y el agente GPT-Live.
Fuentes
- OpenAI Community – ChatGPT Voice is now in the desktop app: hilo oficial con el detalle de planes, control de agentes en Chat/Work/Codex y soporte de Computer Use.
- TechCrunch – OpenAI’s new voice mode makes it to the ChatGPT desktop app: cobertura de la llegada de la voz full-duplex a la app de escritorio y sus capacidades agénticas.
- 9to5Mac – OpenAI updating ChatGPT desktop app with GPT voice for talking through work: detalle de Appshots en Mac y del enfoque de “hablar sobre tu trabajo”.
- OpenAI – Introducing GPT-Live: anuncio oficial con la arquitectura full-duplex, versiones y planes a futuro.
Ejemplo práctico
Martina Rearte tiene un estudio contable de 6 personas en Rosario y arranca cada lunes con una hora de administración muerta: cargar comprobantes, cruzar planillas y armar el resumen de tareas del equipo. Desde la app de escritorio activó GPT-Live en su Mac y lo puso a trabajar en modo manos libres. Mientras cebaba unos mates le dictó: “Abrí la planilla de facturación de julio, marcame los clientes que todavía no pagaron y armame un borrador de recordatorio para cada uno”. Con Appshots, GPT-Live leyó la ventana activa de la planilla sin que ella copiara y pegara nada, y con Computer Use fue tocando las celdas y redactando los mails en paralelo, contestándole con voz natural y sin cortes cada vez que ella corregía un monto en el aire.
El full-duplex fue el cambio de fondo: como la voz escucha y habla al mismo tiempo, Martina la interrumpía a mitad de frase (“ese cliente no, dejalo para agosto”) y el modo ajustaba sobre la marcha, igual que una charla con una asistente humana. Nada de esperar el turno ni repetir el comando entero.
Resultado: la rutina de los lunes bajó de 60 a 18 minutos —un 70% menos— y de los 14 recordatorios de pago que antes se le traspapelaban, GPT-Live dejó los 14 listos para revisar en una sola sesión de voz de poco más de 3 minutos.
