En pocas palabras: OpenAI lanzó GPT-5 el 7 de agosto de 2025 como sistema unificado de razonamiento, con 94,6% en AIME 2025 sin herramientas y 80% menos errores fácticos que o3. Para el 25 de septiembre de 2026, OpenAI ya redirige a los usuarios hacia GPT-6 en su página oficial.
GPT-5 de OpenAI llegó al mercado el 7 de agosto de 2025 como el modelo unificado de razonamiento de la compañía, y para el 25 de septiembre de 2026 OpenAI ya redirige a sus usuarios hacia GPT-6 en la página oficial del producto. Según el comunicado oficial, GPT-5 sacó 94,6% en AIME 2025 sin herramientas y redujo errores fácticos hasta un 80% frente a o3.
GPT-5 de OpenAI es un sistema unificado que combina un modelo rápido para consultas simples, un modelo de razonamiento profundo llamado GPT-5 thinking para problemas difíciles, y un router en tiempo real que decide cuál usar según la conversación. Según el anuncio oficial de OpenAI, el sistema mejora el desempeño en programación, matemática, escritura y salud respecto a GPT-4o y a o3.
En este artículo:
- En 30 segundos
- ¿Cuánto redujo GPT-5 de OpenAI el costo de inferencia frente a GPT-4o?
- ¿Qué mejoras de razonamiento logró GPT-5 según los benchmarks?
- ¿Es cierto que GPT-5 alucina un 30% menos? Qué está confirmado y qué no
- ¿Qué críticas hizo la comunidad developer sobre GPT-5?
- ¿Cuándo llegó GPT-5 a la API y qué siguió después del lanzamiento?
- Errores comunes al leer anuncios de modelos como GPT-5
- Preguntas Frecuentes
- Conclusión
- Fuentes
En 30 segundos
- GPT-5 se lanzó el 7 de agosto de 2025, según la página oficial de OpenAI, no en septiembre de 2026 como sugiere una nota de dev.to publicada esta semana.
- En benchmarks propios, GPT-5 sacó 94,6% en AIME 2025 sin herramientas, 74,9% en SWE-bench Verified y 84,2% en MMMU.
- OpenAI afirma que GPT-5 con razonamiento activado comete un 80% menos errores fácticos que o3, y un 45% menos que GPT-4o con búsqueda web activada.
- La nota de TechPulse en dev.to habla de una reducción de alucinaciones del 30% y de un salto de 15 puntos en MMLU-Pro (92%), pero la misma nota aclara que la verificación independiente todavía está pendiente.
- La página oficial de OpenAI ya presenta a GPT-6 como “su modelo más reciente”, lo que confirma que el ciclo de GPT-5 quedó atrás para septiembre de 2026.
¿Cuánto redujo GPT-5 de OpenAI el costo de inferencia frente a GPT-4o?
Según la nota publicada en dev.to, GPT-5 optimiza el uso de tokens hasta un 40% respecto a GPT-4o, lo que bajaría el costo de correr agentes de IA a escala. Sam Altman resumió la estrategia con la frase “smarter for less” en la keynote citada por esa nota. Ojo: el comunicado oficial de OpenAI no confirma ese 40% puntual contra GPT-4o.
Lo que sí confirma la página oficial es otra cosa: GPT-5 en modo razonamiento usa entre 50% y 80% menos tokens de salida que o3 en tareas de razonamiento visual, coding agéntico y problemas científicos de posgrado. Son comparaciones distintas, contra modelos distintos, y mezclarlas como si fueran el mismo dato es un error común (volvemos sobre esto más abajo).
Pensá en una empresa que corre un agente de soporte todo el día, con miles de llamadas diarias a la API. Si el costo por token baja, el ahorro se nota en la factura mensual, no en un benchmark aislado. El problema es que ni siquiera OpenAI, en su propio comunicado, publicó una cifra de ahorro en dólares comparando GPT-5 puntualmente contra GPT-4o.
Eso sí, hay un dato oficial que sirve como referencia de valor económico: en tareas de trabajo de conocimiento con impacto económico, que cubren más de 40 ocupaciones (desde derecho hasta logística), GPT-5 con razonamiento activado queda a la par o por encima de expertos humanos en aproximadamente la mitad de los casos, superando a o3 y a ChatGPT Agent, según el mismo comunicado.
¿Qué mejoras de razonamiento logró GPT-5 según los benchmarks?
La nota de TechPulse en dev.to asegura que GPT-5 sacó 92% en el benchmark MMLU-Pro, 15 puntos por encima de su predecesor. El comunicado oficial de OpenAI no menciona MMLU-Pro en ningún momento: sus cifras son otras, y bastante más altas en varios casos. GPT-5 llegó a 94,6% en AIME 2025 sin herramientas, 88% en Aider Polyglot, 74,9% en SWE-bench Verified y 84,2% en MMMU. Con GPT-5 pro, la versión de razonamiento extendido, el número en GPQA trepó a 88,4% sin herramientas.
En la práctica, esto se traduce en debugging de repositorios grandes y generación de frontend complejo en un solo prompt, según describe OpenAI en su propio anuncio. Los testers beta citados por la nota de dev.to reportaron outputs más coherentes en coding extenso y análisis de documentos legales, aunque esa afirmación viene de la fuente secundaria, no del comunicado oficial.
¿Son comparables el 92% de MMLU-Pro que menciona dev.to y el 94,6% de AIME que confirma OpenAI? No. Son pruebas distintas, con metodologías distintas, y ponerlas una al lado de la otra como si midieran lo mismo es exactamente el tipo de error que hace que una nota parezca más sólida de lo que es.
¿Es cierto que GPT-5 alucina un 30% menos? Qué está confirmado y qué no
No, al menos no con esa cifra exacta confirmada de forma independiente. La nota de dev.to habla de una reducción del 30% en “pruebas internas”, y la misma nota aclara textualmente que la verificación independiente todavía está pendiente. El comunicado oficial de OpenAI da otro número, más específico y con metodología publicada: alrededor de 45% menos probabilidad de error fáctico que GPT-4o con búsqueda web activada, y cerca de 80% menos que o3 cuando GPT-5 razona. Más contexto en guía completa de herramientas para desarrolladores.
| Dato | Nota dev.to (TechPulse) | Comunicado oficial de OpenAI | Estado |
|---|---|---|---|
| Reducción de alucinaciones | 30% menos (pruebas internas) | ~45% menos que GPT-4o con búsqueda web; ~80% menos que o3 pensando | Cifra oficial confirmada; el 30% de dev.to no tiene respaldo independiente |
| Benchmark de razonamiento | 92% en MMLU-Pro (+15 puntos) | 94,6% en AIME 2025; 88,4% en GPQA con GPT-5 pro | Pruebas distintas, no comparables entre sí |
| Reducción de uso de tokens | 40% menos vs GPT-4o | 50%-80% menos tokens de salida vs o3 (no vs GPT-4o) | Métrica distinta, comparación contra otro modelo |
| Fecha de lanzamiento | “Anunciado el martes” (nota del 25/09/2026) | 7 de agosto de 2025 | Confirmado por la página oficial; hay un desfase de más de un año |

Con esa tabla arriba, la conclusión práctica es simple: hay datos oficiales sólidos, y hay afirmaciones de una nota secundaria que todavía no pasaron ningún filtro externo.
Qué está confirmado por OpenAI
- Fecha real de lanzamiento: 7 de agosto de 2025, según la página oficial del producto.
- Reducción de errores fácticos: ~45% menos que GPT-4o con búsqueda web, ~80% menos que o3 pensando.
- Benchmarks publicados: 94,6% en AIME 2025, 74,9% en SWE-bench Verified, 84,2% en MMMU, 46,2% en HealthBench Hard y 88,4% en GPQA con GPT-5 pro.
- Menos engaño del modelo: la tasa de respuestas engañosas bajó de 4,8% con o3 a 2,1% con GPT-5 razonando.
- Ya existe un modelo posterior: la propia página de producto de OpenAI señala a GPT-6 como su modelo más reciente.
Qué no está confirmado de forma independiente
- El 40% de reducción de tokens específicamente contra GPT-4o, que aparece solo en la nota de dev.to.
- El 92% en MMLU-Pro y el salto de 15 puntos, que no figuran en el comunicado oficial de OpenAI.
- El 30% de reducción de alucinaciones citado por dev.to, distinto de las cifras de 45% y 80% que sí publicó OpenAI.
- La cita textual atribuida a Sam Altman en la keynote que menciona dev.to no aparece en el comunicado oficial que revisamos.
¿Qué críticas hizo la comunidad developer sobre GPT-5?
Según la nota de dev.to, parte de la comunidad developer plantea que priorizar la eficiencia de costos le restó filo al output creativo de GPT-5, un terreno donde GPT-4 Turbo mantenía una ligera ventaja en encuestas de preferencia de usuarios citadas por esa misma nota. La fuente no nombra estudios puntuales ni cifras de esas encuestas, así que conviene tomarlo como una percepción reportada, no como un dato duro.
Tiene sentido como tensión de diseño. Cuando un laboratorio optimiza para razonamiento y costo, a veces resigna algo de “personalidad” en la escritura. El propio comunicado oficial de OpenAI reconoce el otro lado de la moneda: dice que GPT-5 es menos efusivamente complaciente, usa menos emojis innecesarios y busca sonar menos a “estar hablando con una IA” y más a chatear con alguien con conocimiento de posgrado.
Hay un dato concreto detrás de esto. OpenAI admite que a comienzos de 2025 tuvo que revertir una actualización de GPT-4o que lo volvió excesivamente “adulador” con los usuarios, y parte del trabajo en GPT-5 fue justamente corregir ese comportamiento con nuevas evaluaciones de sycophancy.
¿Quién tiene razón en el debate sobre creatividad? Depende para qué lo uses.
¿Cuándo llegó GPT-5 a la API y qué siguió después del lanzamiento?
GPT-5 llegó a la API y a ChatGPT el 7 de agosto de 2025, disponible para todos los usuarios, con más uso para suscriptores Plus y acceso a GPT-5 pro (razonamiento extendido) para suscriptores Pro, según confirma la página oficial de OpenAI. La nota de dev.to, en cambio, describe un rollout todavía pendiente para “fin de mes”, un tier gratuito por venir y una interfaz multimodal adelantada para audio y video en tiempo real, como si todo eso fuera una novedad de septiembre de 2026.
Ese desfase importa. Para cuando se publicó esa nota, el ciclo real de GPT-5 ya llevaba más de un año en producción y OpenAI ya apuntaba a los lectores de su propia página hacia GPT-6 como su modelo más reciente. En las fuentes que tenemos disponibles no hay detalles confirmados sobre qué trae GPT-6: la página oficial solo lo nombra como el siguiente paso, sin desarrollar especificaciones.
Un criterio simple para no caer en esto: subís a la API el prompt, comparás el output contra la versión anterior, revisás el benchmark que te interesa, chequeás la fecha del comunicado oficial que estás leyendo y recién ahí decidís si el dato que tenés enfrente es una novedad real o una nota que recicló una historia vieja con fecha nueva.
Errores comunes al leer anuncios de modelos como GPT-5
- Confundir la fecha de publicación de una nota con la fecha del lanzamiento real. Un artículo puede estar fechado en 2026 y hablar de un modelo que salió en 2025. Conviene chequear siempre la fecha que figura en la página oficial del producto, no solo la del texto que lo comenta.
- Sumar benchmarks que no son comparables entre sí. MMLU-Pro, AIME, GPQA y SWE-bench miden cosas distintas con metodologías distintas. Poner “92% en MMLU-Pro” al lado de “94,6% en AIME” como si fueran la misma prueba lleva a conclusiones equivocadas.
- Tratar reducción de tokens de salida y reducción de costo como sinónimos. Menos tokens de salida no equivale a menos costo por token de entrada, y ninguna de las dos cosas es “más barato en dólares” sin mirar el precio publicado de la API.
- Citar una nota de blog como si fuera el system card o el paper técnico oficial. Una nota puede resumir bien un anuncio, pero cuando la propia fuente dice “la verificación independiente está pendiente”, esa frase hay que tomarla en serio, no saltearla.
Preguntas Frecuentes
¿Qué es GPT-5 y en qué se diferencia de GPT-4o?
GPT-5 es el sistema unificado de razonamiento que OpenAI lanzó el 7 de agosto de 2025, con un router que elige entre un modelo rápido y un modelo de razonamiento profundo (GPT-5 thinking) según la complejidad de la tarea. A diferencia de GPT-4o, mejora en coding, matemática, salud y escritura, y según el comunicado oficial reduce errores fácticos hasta un 45% frente a ese mismo modelo.
¿Cuánto redujo GPT-5 el costo de uso de tokens?
Según la nota de dev.to, hasta un 40% respecto a GPT-4o, pero esa cifra no aparece en el comunicado oficial de OpenAI. Lo que sí confirma OpenAI es que GPT-5 en modo razonamiento usa entre 50% y 80% menos tokens de salida que o3, una comparación distinta y contra otro modelo.
¿Es verdad que GPT-5 alucina un 30% menos?
Parcialmente y sin confirmación independiente: el 30% viene de pruebas internas citadas por dev.to, que la misma nota marca como pendiente de verificación. OpenAI, en cambio, publicó cifras propias distintas: alrededor de 45% menos errores fácticos que GPT-4o con búsqueda web, y cerca de 80% menos que o3 cuando razona.
¿GPT-5 es mejor que GPT-4 Turbo para escribir textos creativos?
Según encuestas de preferencia de usuarios citadas por dev.to, GPT-4 Turbo mantenía una ligera ventaja en output creativo. OpenAI, por su parte, afirma en su comunicado que GPT-5 es su mejor colaborador de escritura hasta la fecha, con mejor manejo de estructuras como el verso libre y menos tono “de IA”.
¿Cuándo se lanzó GPT-5 en la API de OpenAI?
GPT-5 se lanzó en la API y en ChatGPT el 7 de agosto de 2025, según la página oficial de OpenAI, disponible para todos los usuarios desde el primer día. No fue un anuncio de septiembre de 2026, como podría sugerir una nota fechada esa semana.
Conclusión
Lo concreto es esto: GPT-5 de OpenAI es real, sus benchmarks oficiales son sólidos (94,6% en AIME 2025, 84,2% en MMMU, hasta 80% menos alucinaciones que o3), y su fecha real de lanzamiento es agosto de 2025, no una novedad de esta semana. Lo que no es concreto son varias cifras de la nota de dev.to que circuló como si fuera noticia de último momento: el 40% de ahorro en tokens contra GPT-4o, el 92% en MMLU-Pro y el 30% de reducción de alucinaciones no tienen respaldo en el comunicado oficial ni verificación independiente, algo que la propia nota admite.
Si vas a tomar una decisión de negocio en base a este tipo de anuncios, el criterio es simple: mirá la fecha real en la fuente primaria, separá los benchmarks por tipo de prueba y desconfiá de cualquier cifra de ahorro que no venga con metodología publicada. Con OpenAI ya señalando a GPT-6 como su modelo más reciente, GPT-5 sigue siendo una base sólida y disponible hoy, pero no es la última palabra.
