En pocas palabras: El benchmark Wall-Clock Traps de Kaggle mostró que Gemini 2.5 Flash, Claude Haiku 4.5 y GPT-5.4 mini acertaron solo 12% de las veces al resolver la 1:30 AM duplicada del 1 de noviembre de 2026, mientras que Gemini 3.7 Flash acertó el 100% de los casos.
El 1 de noviembre de 2026 la 1:30 AM va a ocurrir dos veces en Estados Unidos por el fin del horario de verano, y un benchmark de Kaggle llamado Wall-Clock Traps mostró que Gemini 2.5 Flash, Claude Haiku 4.5 y GPT-5.4 mini acertaron ese caso puntual apenas 12% de las veces. Gemini 3.7 Flash, en cambio, lo resolvió el 100% de las veces.
Wall-Clock Traps es un benchmark publicado por el usuario wishbone_data como parte del Kaggle Benchmarking Challenge, que mide qué tan bien resuelven seis modelos de IA conversiones de zona horaria en escenarios reales: horas que no existen (spring forward), horas que se repiten (fall back), offsets raros y países que cambiaron sus reglas de horario de verano entre 2023 y 2024.
En este artículo:
- En 30 segundos
- ¿Qué es el benchmark Wall-Clock Traps de Kaggle?
- ¿Qué modelos de IA se probaron y qué resultados obtuvieron?
- ¿Por qué la 1:30 AM que se repite confunde a la mayoría de los modelos?
- ¿Qué otros errores de zona horaria cometen los modelos de IA?
- ¿Qué implica esto para usar IA en tareas con fechas y horarios?
- Errores comunes al usar IA para calcular zonas horarias
- Preguntas Frecuentes
- Conclusión
- Fuentes
En 30 segundos
- El benchmark Wall-Clock Traps de Kaggle probó 118 preguntas de zona horaria (59 escenarios x 2 formas) en 6 modelos de IA.
- Gemini 3.7 Flash acertó el 100%, GPT-5.4 mini el 66-68% según la corrida.
- Con horas que se repiten (como la 1:30 AM del 1 de noviembre), Gemini 2.5 Flash, Claude Haiku 4.5 y GPT-5.4 mini cayeron a 12% de acierto.
- Paraguay, Egipto y Groenlandia cambiaron sus reglas de horario en 2023-2024 y varios modelos siguen dando la regla vieja.
- Claude Sonnet 4.5 quedó afuera de la segunda corrida porque 102 de sus 118 llamadas a la API fallaron.
¿Qué es el benchmark Wall-Clock Traps de Kaggle?
Wall-Clock Traps es un conjunto de 59 escenarios de zona horaria, cada uno formulado de dos formas distintas (limpia y “messy”, con contexto de la vida real), lo que da un total de 118 ítems repartidos en nueve grupos: conversiones básicas, la semana de brecha entre Estados Unidos y Europa cuando cambian de horario en fechas distintas, offsets raros como Nepal o Lord Howe Island, la línea de fecha, vuelos que aterrizan justo el día del cambio de horario, países que modificaron sus reglas entre 2023 y 2024, horas que no existen, horas que se repiten y controles que parecen trampa pero no lo son.
La pregunta “limpia” pide algo tipo: hora local en Chicago 2026-03-08 02:30, ¿qué hora es en Londres en ese mismo momento? La versión “messy” pregunta lo mismo pero disfrazado de mensaje de trabajo real, tipo “el backup del servidor de Chicago corre a las 2:30 AM el domingo 8 de marzo, ¿a qué hora lo ve el equipo de Londres?”. Mismo dato, misma respuesta correcta (en ese caso, las 2:30 AM directamente no existe esa noche en Chicago, porque el reloj salta de las 2:00 a las 3:00).
Lo interesante del diseño metodológico es que la respuesta correcta no la define el autor a mano: la calcula Python con la librería zoneinfo, que usa la base de datos IANA de zonas horarias, la misma que usan sistemas operativos y servidores en todo el mundo. El autor verificó 25 respuestas a mano y el grading es exacto, sin juez de otro modelo de IA evaluando: cada respuesta debe terminar con una línea tipo ANSWER: 2026-03-16 14:00, o ANSWER: NONEXISTENT / AMBIGUOUS si corresponde.
¿Qué modelos de IA se probaron y qué resultados obtuvieron?
El benchmark corrió seis modelos: Gemini 3.7 Flash, Gemma 4 26B A4B (un modelo open-weights chico), Claude Sonnet 4.5, Gemini 2.5 Flash, Claude Haiku 4.5 y GPT-5.4 mini. Gemini 3.7 Flash sacó 100% de precisión tanto en el leaderboard oficial de Kaggle como en la corrida de análisis detallada, mientras GPT-5.4 mini quedó último con 66% en el leaderboard y 68% en la segunda corrida.
El autor corrió el benchmark dos veces: una en el leaderboard público de Kaggle, y otra en un notebook de análisis que guarda cada respuesta individual para entender por qué falla cada modelo. Claude Sonnet 4.5 quedó afuera de esa segunda corrida porque 102 de sus 118 llamadas volvieron como error de API, así que ese número mediría la infraestructura, no el modelo. Su puntaje de 91% del leaderboard queda como única referencia. Ya lo cubrimos antes en los cambios que trajo GPT-5.6 Sol.
| Modelo | Accuracy (run 2) | Clean | Messy | Trampas detectadas | Falsas alarmas | Errores por regla vieja |
|---|---|---|---|---|---|---|
| Gemini 3.7 Flash | 100% | 100% | 100% | 18/18 | 0/12 | 0/16 |
| Gemma 4 26B A4B | 97% | 97% | 97% | 17/18 | 0/12 | 2/16 |
| Gemini 2.5 Flash | 91% | 88% | 93% | 11/18 | 0/12 | 4/16 |
| Claude Haiku 4.5 | 78% | 80% | 76% | 9/18 | 1/12 | 10/16 |
| GPT-5.4 mini | 68% | 75% | 61% | 7/18 | 1/12 | 5/16 |
Claude Sonnet 4.5 sacó 91% en el leaderboard (run 1), pero no tiene fila en esta tabla por el problema de API mencionado arriba. Gemma, el modelo más chico de la lista, quedó segundo, unos 3 puntos abajo de Gemini 3.7 Flash en la corrida de análisis (97% frente a 100%). Eso ya te dice algo: el tamaño del modelo no explica todo acá.
¿Por qué la 1:30 AM que se repite confunde a la mayoría de los modelos?
Porque una hora que se repite (fall back, cuando el reloj retrocede) obliga al modelo a reconocer que hay dos respuestas válidas y decir cuál, mientras que una hora que no existe (spring forward, cuando el reloj salta hacia adelante) es más fácil de detectar como error obvio. Los datos del benchmark lo confirman con una diferencia enorme entre ambos casos.
Cuando la hora no existe, casi todos los modelos lo notaron: 100% en tres de los cinco modelos evaluados en la corrida completa, 80% en Haiku, 60% en GPT-5.4 mini. Ahora bien, cuando la hora se repite, el panorama se da vuelta por completo. Gemini 3.7 Flash acertó todos los casos y Gemma llegó a 88%. Gemini 2.5 Flash, Claude Haiku 4.5 y GPT-5.4 mini se quedaron en 12% cada uno.
¿Qué hicieron esos tres modelos? Calcularon uno de los dos momentos posibles y dieron una respuesta segura, como si la ambigüedad no existiera. El ítem más difícil de todo el set fue la 1:45 AM en Lord Howe Island, un territorio australiano donde el reloj retrocede solo 30 minutos en vez de una hora completa. Casi nadie marcó ese caso como ambiguo. Relacionado: guía sobre herramientas para desarrolladores.
Eso conecta directo con el 1 de noviembre de 2026: ese domingo, el horario de verano termina en Estados Unidos y la 1:30 AM va a pasar dos veces, primero en horario de verano y después en horario estándar. Un modelo que “picked one and moved on”, como dice el título original del autor, te puede dar una respuesta con total confianza que en realidad tiene un 50% de chance de estar mal.
¿Qué otros errores de zona horaria cometen los modelos de IA?
Además de la ambigüedad de horas repetidas, los modelos fallan por usar reglas de horario de verano desactualizadas y por perder precisión con prompts que incluyen pistas erróneas escritas a propósito. Son dos problemas distintos del mismo tema: uno es de conocimiento viejo, el otro es de razonamiento bajo presión de un dato falso.
El grupo de “países que cambiaron reglas” fue el que más separó a los modelos buenos de los flojos. Claude Haiku 4.5 dio la respuesta vieja en 10 de 16 ítems, GPT-5.4 mini en 5 y Gemini 2.5 Flash en 4. El caso peor fue Paraguay, que eliminó su cambio de horario de invierno en 2024: la mayoría de los modelos se equivocó con la hora de julio en Asunción. Egipto (que reinstauró el horario de verano en 2023) y Nuuk, en Groenlandia (que cambió de offset ese mismo año), también hicieron tropezar a varios modelos.
- Regla vieja de Paraguay: el país dejó de cambiar el horario en 2024 y varios modelos siguen calculando como si todavía existiera esa transición.
- Regla vieja de Egipto: volvió a aplicar horario de verano en 2023 después de años sin hacerlo, y algunos modelos usan la regla anterior a ese cambio.
- Regla vieja de Groenlandia (Nuuk): cambió de offset en 2023 y quedó fuera del conocimiento de algunos modelos entrenados con datos más viejos.
El otro hallazgo tiene que ver con el texto “messy”, esos prompts con contexto real que incluían pistas falsas a propósito, como un mensaje de un CFO que “siempre suma cinco horas” sin pensarlo. Los dos modelos mejores (Gemini 3.7 Flash y Gemma) puntuaron igual en clean y messy. GPT-5.4 mini cayó de 75% a 61%, una baja de 14 puntos, y Haiku perdió 4. Curiosamente, Gemini 2.5 Flash mejoró en messy (93% contra 88% en clean). La pista de “sumá cinco horas” durante la semana de brecha entre Nueva York y Londres alcanzó para hacer que dos modelos pasaran de una respuesta correcta a una equivocada. En cómo Copilot sumó un agente para Jira profundizamos sobre esto.
Un dato que llamó la atención del propio autor del benchmark: la cantidad de tokens que usa cada modelo para pensar se relaciona casi de forma directa con la precisión. GPT-5.4 mini escribió unos 80 tokens por respuesta, fue la corrida más barata (USD 0,06 por los 118 ítems) y fue el único modelo que falló conversiones simples de la semana de brecha US/EU, el tipo de cálculo que pondrías en una invitación de calendario sin pensarlo dos veces. Gemma, mucho más chico como modelo, escribió unos 2.500 tokens por respuesta y sacó 97%.
¿Qué implica esto para usar IA en tareas con fechas y horarios?
Implica que pedirle a un modelo de IA que calcule una hora entre husos horarios distintos durante una semana de transición es justo el momento donde más chance hay de error, y ese error viene con la misma confianza que una respuesta correcta. Si coordinás una reunión o un backup entre Buenos Aires y Nueva York o Londres a fines de octubre o principios de noviembre, ojo con esto.
Argentina no aplica cambio de horario actualmente, así que el riesgo no aparece calculando la hora local acá, sino cuando coordinás con equipos en Estados Unidos o Europa, que cambian de horario en fechas distintas entre sí. Esa brecha de una o dos semanas donde “Nueva York está cinco horas atrás de Londres” deja de ser verdad es exactamente uno de los nueve grupos que mide Wall-Clock Traps.
El autor del benchmark propone tres pasos siguientes para profundizar esta investigación: darle a los modelos una herramienta de zona horaria real y ver si la usan en vez de calcular de memoria, probar con fechas de 2028 y 2030 donde podría haber cambios de regla posteriores a los datos de entrenamiento, y repetir cada ítem varias veces para medir el ruido entre corridas. Ese último punto no es menor: Haiku pasó de 73% a 78% entre el leaderboard y la corrida de análisis, y GPT-5.4 mini de 66% a 68%, con exactamente los mismos prompts. Un modelo que acierta 60% de las veces en un caso ambiguo no es lo mismo que uno que acierta siempre, aunque el promedio final se parezca. Más contexto en comparación entre GLM-5.3 y GPT-5.6 Sol.
Errores comunes al usar IA para calcular zonas horarias
- Confiar en una sola respuesta sin verificar la ambigüedad: si la hora cae en la ventana de “fall back”, pedile al modelo explícitamente que te diga si existen dos momentos posibles antes de tomar la respuesta como definitiva.
- Asumir que todos los países cambian de horario el mismo fin de semana: Estados Unidos y Europa lo hacen en fechas distintas, y esa brecha de días es donde más se equivocan los modelos con peor puntaje en el benchmark.
- Dar por sentada una regla de horario de verano de un país sin chequear si cambió: Paraguay, Egipto y Groenlandia modificaron sus reglas entre 2023 y 2024 y algunos modelos todavía calculan con la versión vieja.
- Meter un dato “obvio” en el prompt sin cuestionarlo: frases tipo “siempre sumo cinco horas” funcionan como ancla y empujan al modelo a copiar el error en vez de calcular desde cero.
Un criterio simple para chequear esto vos mismo: si la fecha en cuestión cae dentro de las dos o tres semanas alrededor de un cambio de horario en cualquiera de los países involucrados, no le pidas al modelo la hora final. Pedile que te diga si esa hora es ambigua, inexistente o directa, y recién ahí calculá el horario con una fuente como la base de datos IANA o el reloj del sistema operativo. Esto es una propuesta de chequeo propia, no algo que el benchmark haya probado.
Preguntas Frecuentes
¿Por qué la 1:30 AM ocurre dos veces el 1 de noviembre?
Porque el 1 de noviembre de 2026 termina el horario de verano en Estados Unidos y el reloj retrocede de las 2:00 AM a la 1:00 AM, así que el período entre la 1:00 y las 2:00 AM pasa dos veces esa madrugada, una en horario de verano y otra en horario estándar.
¿Qué modelo de IA es más preciso calculando zonas horarias?
Según el benchmark Wall-Clock Traps, Gemini 3.7 Flash sacó 100% de precisión en las dos corridas realizadas, incluyendo todos los casos de horas ambiguas y reglas de horario de verano desactualizadas. Gemma 4 26B A4B quedó segundo con 96-97%.
¿Qué es el benchmark Wall-Clock Traps de Kaggle?
Wall-Clock Traps es un benchmark de 118 preguntas de zona horaria publicado en Kaggle, que evalúa modelos de IA con la base de datos IANA como respuesta correcta y grading exacto, sin juez de otro modelo. Cubre horas inexistentes, horas repetidas, offsets raros y países con reglas de horario de verano cambiadas recientemente.
¿Por qué ChatGPT o Gemini se equivocan con el cambio de horario?
Se equivocan porque calculan un solo resultado con confianza en vez de reconocer que una hora puede ser ambigua (se repite) o inexistente (no existe esa noche), y porque a veces conservan reglas de horario de verano viejas de países que cambiaron su normativa después del corte de sus datos de entrenamiento. GPT-5.4 mini y Claude Haiku 4.5 fueron los que más errores de este tipo mostraron en el benchmark.
¿Argentina tiene cambio de horario como Estados Unidos?
No, Argentina no aplica cambio de horario de verano actualmente, así que el reloj no se adelanta ni se atrasa en el país. El riesgo para equipos argentinos aparece al coordinar horarios con Estados Unidos o Europa, que cambian de horario en fechas distintas entre sí durante octubre y noviembre.
Conclusión
El benchmark Wall-Clock Traps deja un dato concreto y verificable con código, no con opinión: los modelos de IA calculan bien una hora inexistente, pero fallan sistemáticamente con una hora que se repite. La diferencia entre 100% y 12% de precisión según el tipo de trampa no es un detalle menor, es la diferencia entre confiar ciegamente en una respuesta y necesitar chequearla.
Si tu equipo coordina reuniones, backups o despliegues entre husos horarios distintos, la recomendación práctica es simple: en las semanas de transición de horario de verano, no le pidas a la IA la hora final, pedile que te diga si esa hora es ambigua y verificá con la base IANA antes de agendar algo importante. El 1 de noviembre de 2026 es un buen recordatorio de que la aritmética de zonas horarias no es tan simple como parece, ni para vos ni para el modelo que estás usando.
Fuentes
- 1:30 AM Happens Twice on November 1 – artículo original del benchmark en dev.to
- Wall-Clock Traps – página del benchmark en Kaggle
- Wall-Clock Traps – tarea, código y grader en Kaggle
