Harbor-Index: ningún agente de IA supera el 30% de aciertos

En pocas palabras: Harbor Adapters y Harbor-Index, presentados el 3 de septiembre de 2026 en arXiv, son infraestructura para portar más de 80 benchmarks agénticos a un formato común y un meta-dataset de 82 tareas curadas donde ningún modelo superó el 30% de aciertos; el mejor, GPT-5.5 con Codex, llegó a 28,0%.

Un equipo de investigadores presentó Harbor Adapters y Harbor-Index el 3 de septiembre de 2026 en arXiv: una infraestructura que porta más de 80 benchmarks agénticos a un formato común y un meta-dataset de 82 tareas curadas para la evaluación de agentes de IA. Ningún modelo superó el 30% de aciertos; el mejor resultado, GPT-5.5 con el harness Codex, llegó a 28,0%.

Harbor Adapters es la infraestructura que permite correr decenas de benchmarks agénticos distintos bajo un mismo formato, sin tener que armar un entorno a medida para cada uno. Harbor-Index es el producto derivado de esa infraestructura: 82 tareas difíciles, tomadas de 29 benchmarks, seleccionadas justamente porque siguen sin resolverse de forma consistente. La idea de fondo es simple: hoy evaluar agentes de IA a gran escala es caro y poco comparable entre laboratorios, y este trabajo busca resolver las dos cosas a la vez.

En 30 segundos

  • Harbor Adapters porta más de 80 benchmarks agénticos a una infraestructura única, validada con revisión de código y experimentos de paridad.
  • Harbor-Index reúne 82 tareas curadas de 29 benchmarks, seleccionadas a partir de un conjunto mucho más amplio de tareas candidatas mediante filtrado de dificultad y auditoría humana y de IA.
  • El estudio evaluó 8 modelos en 54 benchmarks, cada uno corrido con el harness Terminus-2 y con uno de 3 harnesses nativos.
  • Ningún modelo-harness superó el 30% de aciertos en Harbor-Index; el techo lo puso GPT-5.5 con Codex, con 28,0%.
  • Harbor-Index está pensado para ser mucho más económico de correr que la evaluación masiva completa, sin perder su nivel de exigencia.
  • Los adaptadores, los resultados y el propio Harbor-Index se liberaron como artefactos open-source.

GPT-5 es un modelo de lenguaje grande desarrollado por OpenAI, diseñado para generar texto, responder preguntas y asistir en tareas de programación y razonamiento complejo. Fue presentado como sucesor de la familia GPT-4.

¿Por qué es tan difícil evaluar agentes de IA a gran escala?

Cada benchmark agéntico exige su propio entorno y su propia forma de conectar al agente, y eso multiplica el trabajo de ingeniería antes de poder comparar un solo número. Ponele que querés correr un mismo agente contra 50 benchmarks distintos: cada uno tiene su sandbox, su forma de definir tareas, su criterio de éxito, y armar todo eso a mano lleva semanas.

El resultado, según describe el paper publicado en arXiv, es que las comparaciones entre modelos terminan siendo parciales: cada laboratorio corre lo que puede, con la infraestructura que tiene, y nadie ve el cuadro completo de qué falla y dónde. Faltaba una capa común que hiciera comparable lo incomparable.

¿Qué son los Harbor Adapters y cómo funcionan?

Harbor Adapters es una infraestructura de evaluación que traduce más de 80 benchmarks agénticos a un formato único, de modo que cualquier agente se pueda correr contra cualquiera de ellos sin reescribir la integración desde cero. Cada adaptador porta un benchmark existente al estándar de Harbor y queda validado antes de sumarse al conjunto.

Esa validación no es cosmética. El equipo la sostiene con revisión de código y con experimentos de paridad, comparando los resultados del benchmark adaptado contra su versión original para confirmar que mide lo mismo. Es el trabajo menos vistoso del paper (nadie se entusiasma leyendo sobre revisión de código) pero es el que sostiene toda la credibilidad de los números que vienen después. Tema relacionado: cómo le fue a GPT-5.6 Sol en otros benchmarks.

¿Qué es Harbor-Index y en qué se diferencia de otros benchmarks?

Harbor-Index es un meta-dataset de 82 tareas tomadas de 29 benchmarks distintos, pensado para ser difícil, diverso y barato de correr al mismo tiempo. A diferencia de un benchmark tradicional, que arma sus propias tareas desde cero, Harbor-Index las selecciona de benchmarks ya existentes y las filtra con un criterio explícito: solo entran las que siguen desafiando a los modelos de punta.

Eso lo distingue de índices como SWE-bench o GAIA, que evalúan un dominio puntual. Harbor-Index cruza 29 fuentes distintas para capturar una foto más amplia de las capacidades agénticas (codificación, uso de herramientas, navegación, tareas de sistema) sin que correrlo implique el gasto de la evaluación completa.

¿Cómo se construyó Harbor-Index a partir de la evaluación a gran escala?

El equipo partió de un conjunto mucho más amplio de tareas candidatas, tomado de la suite de benchmarks adaptada, y lo redujo a 82 mediante un proceso de curación en varias etapas. Primero aplicaron un filtro de dificultad para descartar todo lo que los modelos actuales ya resuelven sin esfuerzo (una tarea que cualquier modelo pasa no aporta nada a un índice pensado para medir el límite de lo que un agente puede hacer).

Después vino una auditoría combinada, con revisión automática vía IA y revisión humana, y un ciclo de auditoría y corrección que repitieron hasta que cada tarea sobreviviente cumplía los criterios buscados: diversa, difícil y de calidad verificada. El embudo de selección fue bastante agresivo, y ahí está buena parte del valor del trabajo: no es que falten benchmarks agénticos dando vueltas, es que casi ninguno pasa un filtro de calidad tan estricto. Te puede servir nuestra guía completa de herramientas para desarrolladores.

¿Qué modelos y harnesses se evaluaron en el estudio?

El estudio evaluó 8 modelos que cubren distintos niveles de capacidad, corriendo cada uno con el harness genérico Terminus-2 y con uno de 3 harnesses nativos adicionales, sobre un total de 54 benchmarks. Un harness es, en criollo, el “andamiaje” que le da al modelo acceso a herramientas, memoria y el entorno donde ejecuta sus acciones: el mismo modelo puede rendir distinto según qué harness lo sostenga.

Correr cada modelo con más de un harness fue justamente lo que permitió al equipo separar dos cosas que suelen mezclarse: cuánto del resultado depende del modelo en sí y cuánto depende de la ingeniería del agente que lo rodea. Esa comparación cruzada es la base del análisis de modos de falla que trae el paper.

AspectoEvaluación completa (Harbor Adapters)Harbor-Index (curado)
Benchmarks cubiertos54 (de más de 80 adaptados en total)29
TareasConjunto amplio de candidatas82 seleccionadas
Modelos evaluados8, cada uno con Terminus-2 y un harness nativoMismo conjunto, subconjunto de tareas
Costo estimadoEvaluación a gran escala, de alto costo computacionalPensado para ser mucho más accesible de correr
Mejor resultado registradoN/D28,0% (GPT-5.5 con Codex)

¿Por qué ningún modelo supera el 30% de aciertos en Harbor-Index?

Porque las 82 tareas se eligieron con ese objetivo explícito: quedar afuera todo lo que un modelo de punta ya resuelve, y quedar adentro solo lo que sigue siendo un problema real. GPT-5.5 con el harness Codex fue la combinación con mejor desempeño de todo el estudio, y aun así se quedó en 28,0%, según reporta el paper.

¿Significa que los agentes de IA todavía no sirven para nada complejo? No, para nada. Significa que Harbor-Index mide específicamente el borde de la dificultad, no el promedio de tareas que un agente resuelve en el día a día. Un modelo puede automatizar sin drama la mayoría de las tareas de un flujo de trabajo real y seguir rindiendo bajo en un índice diseñado para exigirle justo donde falla.

¿Cuánto cuesta correr una evaluación con Harbor-Index?

Correr la evaluación completa de 8 modelos en 54 benchmarks demandó un volumen de cómputo considerable, propio de una evaluación a gran escala. Es un nivel de recursos que deja afuera a la mayoría de los equipos de investigación que no son un laboratorio grande. Sobre eso hablamos en cómo Copilot sumó un agente para Jira.

Correr Harbor-Index, en cambio, está pensado para ser mucho más accesible, según plantea el propio paper. Esa diferencia es la razón de ser del dataset curado: no reemplaza a la evaluación masiva, la vuelve accesible para quien quiera repetirla sin necesitar el presupuesto de un laboratorio grande.

¿Dónde conseguir los adaptadores y el dataset de Harbor-Index?

El equipo liberó los adaptadores, los resultados de la evaluación, el análisis en profundidad y Harbor-Index como artefactos open-source, según indica el paper que los presenta.

Quien quiera evaluar un agente propio contra Harbor-Index no necesita reconstruir la infraestructura de adaptadores desde cero: la idea del release es justo esa, que cualquier equipo pueda enchufar su agente y correr las 82 tareas sin el costo de armar 29 entornos distintos a mano.

Qué está confirmado y qué no

  • Confirmado: Harbor Adapters porta más de 80 benchmarks agénticos y fue validado con revisión de código y experimentos de paridad, según el paper publicado el 3 de septiembre de 2026.
  • Confirmado: Harbor-Index tiene 82 tareas de 29 benchmarks, filtradas a partir de la suite adaptada mediante un proceso de filtrado por dificultad y auditoría humana y de IA.
  • Confirmado: ningún modelo-harness superó el 30% de aciertos; el máximo fue 28,0% de GPT-5.5 con Codex.
  • Confirmado: los adaptadores, los resultados y Harbor-Index se liberaron como open-source.
  • No confirmado: si Harbor-Index se va a actualizar con nuevas versiones a medida que los modelos superen el umbral actual de dificultad.

Errores comunes al interpretar Harbor-Index

  • Confundir Harbor Adapters con Harbor-Index. Adapters es la infraestructura que porta benchmarks; Harbor-Index es el dataset curado que resulta de usarla. Son dos entregas distintas del mismo paper.
  • Leer el 28,0% como un mal resultado en términos absolutos. Es el techo de un índice diseñado a propósito para quedar fuera del alcance de los modelos actuales, no una medida de qué tan útil es un agente en la práctica.
  • Comparar el puntaje de Harbor-Index con el de otro benchmark como si fueran escalas equivalentes. Cada benchmark define su propia dificultad; un 28% acá no es comparable con un 90% en un benchmark distinto.
  • Asumir que correrlo es gratis por ser open-source. El código y las tareas son gratuitos, pero seguís pagando el cómputo de correr el agente contra ellas, aunque sea una fracción de lo que costó la evaluación original.

Preguntas Frecuentes

¿Qué es Harbor-Index?

Harbor-Index es un meta-dataset de 82 tareas curadas, tomadas de 29 benchmarks agénticos distintos, diseñado para la evaluación de agentes de IA de forma difícil, diversa y barata de correr. Se publicó junto con el paper de Harbor Adapters el 3 de septiembre de 2026. Más contexto en esta comparativa de GLM-5.3 contra GPT-5.6 Sol.

¿Qué son los Harbor Adapters?

Los Harbor Adapters son una infraestructura que porta más de 80 benchmarks agénticos a un formato de evaluación común, validada con revisión de código y experimentos de paridad. Permiten correr cualquier agente contra decenas de benchmarks sin reconstruir cada entorno por separado.

¿Qué modelo de IA obtuvo el mejor resultado en Harbor-Index?

GPT-5.5 combinado con el harness Codex obtuvo el mejor resultado de todo el estudio, con 28,0% de aciertos. Ninguna otra configuración de modelo y harness superó el 30%, según los datos del paper.

¿Cómo se mide el desempeño de un agente de IA en tareas complejas?

Se mide corriendo al agente contra tareas de entornos reales (código, uso de herramientas, navegación) y registrando la tasa de aciertos por benchmark y por harness. Harbor Adapters estandariza ese proceso para que el mismo criterio de éxito aplique en decenas de benchmarks distintos a la vez.

¿Dónde se puede descargar Harbor-Index?

Harbor-Index se liberó como artefacto open-source, según indica el paper que lo presenta, publicado el 3 de septiembre de 2026 en arXiv.

Conclusión

Harbor Adapters resuelve un problema de infraestructura que venía frenando la evaluación de agentes de IA a gran escala, y Harbor-Index convierte ese trabajo en algo mucho más accesible de correr que la evaluación original completa. El dato que más pesa es el 28,0% de techo: mientras los modelos frontera sigan lejos de resolver estas 82 tareas, el índice cumple su función de vara exigente. Si trabajás evaluando o desplegando agentes, vale la pena mirar qué benchmarks integra Harbor-Index y probar el propio agente contra ellos antes de confiar en un número de marketing suelto.

Fuentes

Desplazarse hacia arriba