Nvidia AVO: 100% en ARC-AGI-3 con su arquitectura de agentes

En pocas palabras: Nvidia anunció el 21 de agosto de 2026 que AVO logró 100,00 RHAE en ARC-AGI-3: completó los 183 niveles de los 25 ambientes públicos con 12% menos acciones que el récord anterior, elevando a Claude Opus 5 del 30,2% al 100%.

Nvidia anunció este 21 de agosto de 2026 que AVO, su arquitectura de agentes autónomos, alcanzó un puntaje perfecto de 100,00 RHAE en el benchmark ARC-AGI-3: completó los 183 niveles de los 25 ambientes públicos usando 12% menos acciones que el récord anterior.

AVO (Agentic Variation Operators) es un sistema general de agentes de programación desarrollado por Nvidia que sostiene trabajo autónomo de largo plazo combinando memoria persistente, supervisión y uso de herramientas. En ARC-AGI-3, un benchmark interactivo donde el agente debe descubrir reglas y objetivos sin recibir instrucciones, AVO elevó a Claude Opus 5 desde una línea base de 30,2% hasta el 100%, según el blog oficial de desarrolladores de Nvidia.

En 30 segundos

  • Puntaje perfecto: 100,00 RHAE en los 25 ambientes del set público de ARC-AGI-3, con los 183 niveles completados, según el anuncio del 21 de agosto de 2026.
  • El modelo no cambió: debajo corre Claude Opus 5, que según el análisis de ARC Prize ronda el 30,2% cuando se evalúa solo.
  • Más eficiente que el récord previo: 6.624 acciones de entorno contra las 7.542 que VISTA reportó con el mismo modelo, un 12% menos.
  • Antecedente pesado: antes de ARC-AGI-3, AVO pasó 7 días optimizando kernels de atención y superó a FlashAttention-4 hasta en 10,5% sobre DGX B200.
  • Ojo con el alcance: los resultados cubren solo el set público; no hay números en los sets semi-privados ni privados, y AVO todavía no es un producto comercial.

Nvidia es una empresa estadounidense de tecnología fundada en 1993 por Jensen Huang, Chris Malachowsky y Curtis Priem, con sede en Santa Clara, California. Diseña unidades de procesamiento gráfico (GPU) y chips para inteligencia artificial, videojuegos y centros de datos.

¿Qué es el benchmark ARC-AGI-3 y por qué exige más que un modelo de IA?

ARC-AGI-3 es un benchmark de razonamiento interactivo en el que un agente entra a entornos tipo juego sin instrucciones, sin reglas explícitas y sin objetivo declarado. Tiene que explorar, inferir la dinámica del mundo y resolver niveles progresivamente más difíciles. El puntaje se calcula con RHAE (Relative Human Action Efficiency), una métrica que combina finalización de tareas con eficiencia de acciones medida contra humanos primerizos, agregada sobre todos los niveles y ambientes.

Ponele que te sentás frente a un juego que nunca viste, sin manual, sin tutorial, sin siquiera saber qué botones hacen algo útil. Cada acción te devuelve un cambio en pantalla y nada más. Ese es el trabajo: armar hipótesis con evidencia incompleta, actuar, observar consecuencias, guardar lo que sirvió y descartar lo que no.

Los 25 ambientes y 183 niveles del set público están diseñados justo para eso: distinguir si un sistema razona de verdad o si solamente matchea patrones de su entrenamiento. Un modelo de lenguaje puede saber muchísimo sobre texto y aun así quedarse clavado en el nivel 3 porque nunca entendió qué hace la acción que está repitiendo. A diferencia de los acertijos estáticos de las primeras versiones de la familia ARC, acá el entorno responde a cada movimiento. Y esa respuesta es la única fuente de información disponible.

¿Y por qué no puede memorizar las respuestas? Porque cada ambiente es nuevo y las reglas se descubren jugando.

Para dimensionar la dificultad: Claude Opus 5 con esfuerzo máximo de razonamiento marca 97,5% en ARC-AGI-1 y 90,4% en el set semi-privado de ARC-AGI-2, según los análisis de ARC Prize citados por The New Stack. La tercera versión, con interacción, es otra liga.

De 30% a 100%: cómo la arquitectura de agentes de Nvidia AVO supera al modelo

El salto de 30,2% a 100% no vino de un modelo nuevo: vino del sistema alrededor del modelo. Claude Opus 5, evaluado solo, ronda el 30,2% en el set público de ARC-AGI-3 con esfuerzo de razonamiento alto, según el análisis de ARC Prize de julio de 2026. Envuelto en AVO, ese mismo modelo completó el benchmark entero.

Ese sistema que rodea al modelo tiene nombre en la jerga: harness. Define cómo el modelo recibe contexto, qué herramientas puede usar, cómo mantiene estado, cómo responde al feedback y cómo se recupera cuando se equivoca. Un modelo de frontera es apenas un componente; el harness decide si esa capacidad se convierte en progreso sostenido o en un loop infinito de intentos fallidos. Para más detalles técnicos, mirá el costo del compute de Nvidia.

“El diseño del sistema, y no solo la capacidad del modelo, puede desbloquear rendimiento de frontera en horizontes largos”, escribió el equipo encabezado por Terry Chen, director y distinguished engineer de Nvidia, en el anuncio oficial (traducción propia).

Mirá el loop completo: el agente inspecciona el estado actual, forma una hipótesis, ejecuta una acción, observa qué cambió, actualiza lo que cree saber, corrige las suposiciones que resultaron falsas y vuelve a empezar, miles de veces, durante horas o días, sin que nadie le prescriba cada paso.

Ojo con una cosa: Nvidia aclara que esto no es una ablación controlada. La corrida usó otra configuración de razonamiento y otro setup de evaluación que la medición standalone de ARC Prize, así que el número exacto de puntos ganados no es una constante universal. Lo robusto es el patrón: mismo modelo, sistema distinto, resultado de otra categoría.

¿Significa que cualquier modelo llega al 100% con un buen harness? Nadie lo afirmó, y sería exagerarlo.

¿Qué es Nvidia AVO y cuáles son sus componentes clave?

Nvidia presentó AVO (Agentic Variation Operators) por primera vez a fines de marzo de 2026: un sistema general de agentes de código que puede inspeccionar y editar código, correr comandos, consultar documentación y validar su trabajo ejecutándolo. Su rasgo distintivo no es hacer esas cosas, porque todos los agentes modernos las hacen, sino sostener operación autónoma en tareas largas, donde una sola invocación del modelo no alcanza ni cerca.

  • Loop iterativo con herramientas reales: el agente inspecciona contexto, planifica, implementa cambios y evalúa resultados usando ejecución concreta, no intuición.
  • Reemplazo del paso de variación: en lugar del paso predefinido de los sistemas de búsqueda evolutiva, un agente autónomo decide qué inspeccionar, qué cambiar, qué testear y qué commitear.
  • Memoria persistente: arrastra implementaciones previas, resultados de evaluación, salidas de compilador y profiler, y razonamiento acumulado entre iteraciones.
  • Supervisión automática: un módulo programático vigila la trayectoria completa y redirige la estrategia cuando detecta estancamiento o ciclos improductivos.

Lo interesante es que el backend del agente se mantiene igual aunque cambie la tarea. Para ARC-AGI-3, Nvidia conectó el mismo agente a otra interfaz: cambiaron las herramientas específicas del entorno y la evaluación, nada más.

Memoria persistente y supervisión: por qué los agentes necesitan estas capas

Trabajar más allá de una ventana de contexto exige dos mecanismos: memoria que sobreviva entre iteraciones y supervisión que detecte cuándo el progreso se frenó. Sin memoria, el agente reconstruye la búsqueda desde cero en cada ciclo, quemando acciones y tokens en redescubrir lo que ya sabía. Sin supervisión, un estancamiento puede durar días. Tema relacionado: nuestra guía de seguridad de Intune.

La memoria persistente de AVO guarda implementaciones anteriores, resultados de evaluación, outputs de compiladores y profilers, y el razonamiento acumulado. Eso permite retomar desde el estado actual en vez de recomenzar. El supervisor, en cambio, mira la trayectoria global: si ve ciclos repetidos o mesetas, redirige al agente principal hacia estrategias alternativas.

Pensalo como un “tech lead” que nunca duerme y que tampoco cobra horas extra: no escribe el código, pero corta el rumbo cuando el proyecto empieza a dar vueltas en círculos.

En la corrida de siete días sobre kernels de atención, el agente principal decidió en todo momento qué inspeccionar, cambiar y testear, mientras el supervisor mantenía el avance cuando la búsqueda se planchaba. Esa división de roles es, según el equipo, parte central de por qué el sistema aguanta horizontes largos.

Primer caso real: cómo AVO optimizó kernels de GPU durante 7 días

Antes de ARC-AGI-3, AVO se probó en un problema de ingeniería de altísima exigencia: optimización autónoma de kernels de GPU. Durante 7 días continuos, el sistema exploró más de 500 direcciones de optimización y committeó 40 versiones de kernel, todo sin intervención manual en cada paso (sí, siete días seguidos).

El terreno es hostil para un agente. El espacio de búsqueda es enorme, el paisaje de performance es difícil de razonar directamente, y cambios mínimos de implementación afectan corrección, comportamiento de memoria, scheduling y throughput de formas impredecibles sin ejecutar. Por eso el feedback con base en hardware, tests y mediciones reales, pesa tanto en este tipo de tarea.

Los kernels de multihead attention resultantes superaron a cuDNN hasta en 3,5% y a FlashAttention-4 hasta en 10,5% en las configuraciones evaluadas sobre sistemas Nvidia DGX B200, según el anuncio oficial. Bonus: el agente adaptó después el kernel evolucionado a grouped-query attention en unos 30 minutos adicionales de trabajo autónomo.

¿Qué demostró esto? Que AVO puede sostener un loop de ingeniería productivo durante muchos días, no solo responder bien una vez. Relacionado: cómo funciona ChatGPT por dentro.

La arquitectura transfiere: mismo loop, distinta interfaz

El hallazgo central no es el 100,00 sino la transferencia: la misma arquitectura pasó de optimizar kernels de GPU a resolver entornos interactivos sin cambiar de fondo. Lo que cambia es el canal de feedback; el patrón computacional queda idéntico. En ambos escenarios, el agente tiene que:

  • Formar hipótesis con evidencia incompleta
  • Actuar a través de una interfaz externa
  • Observar las consecuencias
  • Preservar estado útil
  • Revisar su modelo del problema
  • Recuperarse de supuestos incorrectos
  • Seguir progresando en horizontes largos

En optimización de kernels, el feedback viene de compiladores, tests, profilers y benchmarks. En ARC-AGI-3, viene de transiciones del entorno y outcomes de acciones. Dominio nuevo, canal nuevo, loop igual. La conclusión del equipo: la generalidad puede venir no solo del conocimiento de dominio, sino de la maquinaria que permite que razonamiento y feedback se acumulen en el tiempo.

Eso explica por qué el mismo sistema zafa en dos mundos tan distintos.

AVO vs VISTA vs Tycho: qué cambia entre arquitecturas de agentes

ARC-AGI-3 acumula en pocos meses sistemas con filosofías opuestas: Tycho apuesta a construir modelos de mundo explícitos y ejecutables, mientras VISTA y AVO van por interacción directa. La diferencia de observación es llamativa: VISTA alimenta al modelo con imágenes PNG renderizadas de 512×512; AVO le entrega grillas textuales exactas de 64×64, sin una sola imagen ni image token.

SistemaModelo baseObservacionesEnfoqueAcciones (set público)
AVO (Nvidia)Claude Opus 5Grilla textual exacta de 64×64, solo textoInteracción directa con memoria persistente y supervisión6.624
VISTAClaude Opus 5 (vía Claude Code) o GPT-5.6 Sol (vía Codex)PNG renderizado de 512×512, también exploró grillas textualesInteracción directa7.542
TychoNo informado en las fuentesNo informadoModelo de mundo explícito y ejecutableNo informado
nvidia avo arquitectura agentes diagrama explicativo

Con Claude Opus 5, AVO cerró los 183 niveles en 6.624 acciones contra las 7.542 que VISTA reportó con el mismo modelo: un 12% menos. Ahora bien, Nvidia advierte que la comparación es entre sistemas completos, no una ablación: difieren en backend, representación de observaciones, memoria y gestión de contexto. Una diferencia que puede pesar en horizontes largos es justamente el sistema de memoria de AVO, pensado para arrastrar conocimiento útil y reducir exploración repetida, aunque el experimento no aisla su aporte individual.

También probaron AVO con GPT-5.6 Sol en un subconjunto difícil de juegos: Sol llegó antes a niveles equivalentes en tiempo de reloj (wall-clock), mientras Opus usó menos acciones en comparaciones de nivel igualado. Perfiles complementarios, concluye el equipo, que prometen una comparación sistemática más adelante.

¿Qué significa esto para los equipos que construyen agentes?

Si desarrollás con agentes, la lección es accionable: antes de pagar por un upgrade de modelo, auditá tu harness. Memoria que sobrevive entre sesiones, supervisión que corte estancamientos, herramientas con feedback real y recuperación de errores valen más puntos que cambiar de proveedor de modelo.

Para equipos de Latinoamérica que trabajan con presupuestos ajustados, esto es casi una buena noticia: la palanca está en la ingeniería del sistema, que es trabajo tuyo, no en la factura del modelo, que es trabajo de otro. Tomalo con pinzas igual: los resultados vienen del propio fabricante. ¿Réplicas independientes? Todavía no. En cómo razonan los modelos de lenguaje profundizamos sobre esto.

Qué está confirmado y qué sigue pendiente

  • Puntaje y alcance: 100,00 RHAE en los 25 ambientes del set público, 183 niveles completados, según el anuncio del 21 de agosto de 2026 en el blog de desarrolladores de Nvidia.
  • Eficiencia: 6.624 acciones de entorno frente a las 7.542 que VISTA reportó con Claude Opus 5.
  • Kernels GPU: hasta 3,5% sobre cuDNN y 10,5% sobre FlashAttention-4 en DGX B200, tras 7 días y 40 versiones commiteadas.
  • Equipo: cinco personas, encabezadas por Terry Chen, director y distinguished engineer de Nvidia.

Y lo que falta:

  • Sets semi-privados y privados: sin resultados ahí, el 100% mide el set público y nada más.
  • Comparación sistemática con GPT-5.6 Sol: hoy solo hay experimentos preliminares en un subconjunto difícil.
  • Ablación de componentes: nadie aisló cuánto aporta la memoria versus la supervisión versus la representación textual.
  • Comercialización: AVO es investigación; no hay producto ni API anunciada.

Errores comunes al interpretar el 100% de AVO

  • Atribuirle el salto al modelo. El modelo es el mismo Claude Opus 5 de siempre; lo que cambió es el sistema. Si replicás la idea con otro modelo pero un harness pobre, no esperes ese número.
  • Dar por resuelto el razonamiento general. El 100% cubre el set público; los sets privados existen precisamente para frenar el overfitting, y ahí no hay datos todavía.
  • Leer 30,2% vs 100% como experimento controlado. Diferían el esfuerzo de razonamiento, la representación de observaciones y la evaluación; Nvidia misma pide no interpretarlo como medición directa del aporte de AVO.
  • Buscar dónde contratarlo. No existe como producto comercial; es una demostración de investigación.

Preguntas Frecuentes

¿Qué es Nvidia AVO y cómo funciona?

Nvidia AVO (Agentic Variation Operators) es un sistema general de agentes de código que combina un loop iterativo de inspección, planificación, implementación y evaluación con memoria persistente y supervisión automática. Nvidia lo presentó a fines de marzo de 2026 y el 21 de agosto de 2026 alcanzó 100,00 RHAE en ARC-AGI-3.

¿Por qué la arquitectura de un agente importa más que el modelo?

Porque el modelo aporta capacidad bruta y el sistema define cómo se convierte en progreso: contexto, herramientas, estado, feedback y recuperación de errores. Claude Opus 5 pasó de 30,2% a 100% en ARC-AGI-3 sin cambiar de modelo, solo cambiando el sistema que lo rodea.

¿Qué es el benchmark ARC-AGI-3 y la métrica RHAE?

ARC-AGI-3 es un benchmark de razonamiento interactivo con 25 ambientes y 183 niveles donde el agente entra sin instrucciones y debe descubrir reglas y objetivos interactuando. RHAE (Relative Human Action Efficiency) combina finalización de tareas con eficiencia de acciones respecto a humanos primerizos.

¿Cómo logró AVO el 100% si Claude Opus 5 solo llega al 30%?

Con memoria persistente que conserva lo aprendido, un supervisor que redirige ante estancamientos y observaciones como grillas textuales exactas de 64×64. Así completó los 183 niveles en 6.624 acciones, un 12% menos que VISTA.

¿Se puede usar Nvidia AVO hoy y cuánto cuesta?

No. AVO es un proyecto de investigación de Nvidia sin comercialización ni API pública anunciada. Los resultados publicados corresponden al set público de ARC-AGI-3 ejecutando Claude Opus 5 dentro del sistema.

Conclusión

Lo que cambió: la conversación de benchmarks dejó de ser una carrera de modelos y empezó a medir sistemas completos. Un 30,2% convertido en 100,00 con el mismo modelo de por medio es el argumento más contundente publicado hasta ahora a favor de la arquitectura de agentes como disciplina propia. La memoria determina qué sobrevive, las herramientas definen qué acciones son posibles y la recuperación permite seguir más allá de una sola invocación.

Mi lectura: el resultado técnico me convence, el titular del 100% me genera cautela. Falta el set privado, faltan réplicas independientes y falta aislar componentes. Hasta entonces, tomá el número como una demostración potente de ingeniería, no como la coronación de la “inteligencia” artificial general.

Si corrés agentes en producción, hacé una cosa esta semana: revisá qué sobrevive de una sesión a la siguiente. Si la respuesta es “nada”, ya sabés por dónde empezar.

Fuentes

Desplazarse hacia arriba