Bucle de agente autónomo: el fin del prompting manual

En pocas palabras: En junio de 2026, Anthropic y OpenAI confirmaron que el bucle de agente autónomo reemplaza al prompt engineering tradicional. Con herramientas como Claude Code y Codex CLI, el modelo decide acciones, ejecuta comandos y corrige sin intervención humana.

En junio de 2026, Anthropic confirmó que sus ingenieros ya no escriben prompts manuales. Boris Cherny, creador de Claude Code, lo dijo sin vueltas: “I don’t prompt Claude anymore. I have loops running that prompt Claude”. El bucle de agente autónomo —ese ciclo que orquesta modelo, herramientas y usuario sin intervención humana— reemplazó al prompt engineering tradicional. OpenAI publicó el desglose técnico de su propio agent loop en Codex CLI, un agente de software local, multiplataforma y de código abierto que opera directamente en tu máquina. El cambio de paradigma tiene nombre —loop engineering— y ya está corriendo en producción.

Un bucle de agente autónomo es un ciclo de software que orquesta la interacción entre un modelo de lenguaje, las herramientas que el modelo puede invocar y el usuario, sin que un humano tenga que escribir cada prompt. Es el núcleo de productos como Codex CLI (OpenAI) y Claude Code (Anthropic). El agente decide qué acción tomar, ejecuta comandos de shell, lee y escribe archivos, analiza el resultado, y repite hasta completar la tarea que le diste. Eso es lo que cambió todo.

Resumen rápido

  • Boris Cherny (Anthropic) dejó de promptear: en junio de 2026 declaró que su trabajo ahora es diseñar bucles que promptean a Claude automáticamente.
  • OpenAI publicó el esquema de su agent loop en Codex CLI, abierto en GitHub, con un “harness” que orquesta herramientas, modelo y usuario.
  • El concepto se llama loop engineering: pasás de escribir prompts a escribir código que controla ciclos autónomos de trabajo.
  • Los costos de tokens se disparan si no ponés un verificador y un límite de presupuesto; un loop sin control “shippea bugs con alta confianza”.
  • Los LLM son stateless: olvidan todo entre sesiones, por eso el loop necesita inyectar contexto constantemente.

¿Qué es un bucle de agente autónomo y cómo se diferencia del prompting tradicional?

Un bucle de agente autónomo es un flujo de trabajo automatizado donde el modelo de lenguaje decide, ejecuta y corrige en ciclos sucesivos. En el prompting tradicional, vos escribís una instrucción, el modelo responde y ahí termina la interacción. Con un loop, el agente recibe un objetivo, usa herramientas (terminal, editor de archivos, APIs), revisa el output del modelo, y vuelve a iterar hasta que el resultado sea aceptable o se agote el presupuesto. Pensalo como un script que toma decisiones en lugar de pedirte que confirmes cada paso.

La diferencia clave está en la orquestación. El harness de Codex CLI, por ejemplo, no es un simple wrapper de la API de OpenAI: es una capa de lógica que maneja el estado de la sesión, el historial de herramientas, la resolución de conflictos y los reintentos. Michael Bolin, del equipo técnico de OpenAI, explicó en el post que ese core loop es el responsable de que el agente produzca cambios de software confiables y opere de forma segura en tu máquina. El prompting manual queda reducido a la definición inicial del objetivo. Todo lo demás corre por cuenta del loop. Esto se conecta con lo que analizamos en nuestra guía completa sobre Microsoft Intune.

¿Cómo funciona exactamente el Codex agent loop de OpenAI?

El agent loop de Codex CLI es el motor que corre debajo de todas las experiencias de Codex: la CLI, la extensión de VS Code y Codex Cloud. Según el desglose oficial de OpenAI, el loop se encarga de orquestar tres piezas: el usuario, el modelo y las herramientas que el modelo invoca. El agente recibe una tarea en lenguaje natural, la descompone, ejecuta comandos de shell, lee el output, evalúa si el resultado es correcto y vuelve a iterar. Todo eso ocurre de forma local, sin depender de un servidor remoto, salvo la llamada al modelo.

Un detalle que me gusta: el código está abierto en GitHub (github.com/openai/codex) y, según el propio Bolin, muchas de las decisiones de diseño están documentadas en issues y pull requests. Eso significa que podés leer por qué eligieron cada mecanismo de reintento, cómo manejan los errores de las herramientas y qué pasa cuando el modelo alucina una flag que no existe. Es el primer agente de código abierto de este calibre que corre en local y que viene con un paper de arquitectura incluido. (Bueno, un post técnico, pero sirve.)

¿Qué implica la ingeniería de loops (loop engineering) según Anthropic?

Boris Cherny, el creador de Claude Code, lo explicó con una frase que ya es un hito: “I don’t prompt Claude anymore. I have loops running that prompt Claude and figuring out what to do. My job is to write loops.” La declaración, hecha en junio de 2026 —y recogida por TechTimes—, no es un comentario al pasar. Es la constatación de que el oficio de prompt engineer está mutando hacia loop engineer: diseñás flujos de control, no frases bonitas.

El cambio lo había secundado Peter Steinberger (OpenAI) y lo terminó de bautizar Addy Osmani (Google), que le puso nombre y estructura en un artículo. Loop engineering no es solo mandar prompts en un while true. Implica manejar estado, reintentos, verificación de resultados y, sobre todo, control de costos. Porque los tokens en un loop autónomo se acumulan más rápido de lo que parece. Cherny y el equipo de Anthropic insisten en dos salvaguardas clave: un modelo verificador (verifier model) y un guardián de presupuesto (budget guard). Sin eso, los costos pueden dispararse y los errores se multiplican.

¿Cuáles son los riesgos de los bucles autónomos sin supervisión?

Un loop sin verificador “shippea bugs con alta confianza”. La advertencia no es mía: es el consenso de los ingenieros que están empujando esta tecnología. El problema de fondo es que los modelos de lenguaje son stateless: no tienen memoria entre sesiones. Si el loop no inyecta el contexto correcto en cada vuelta, el agente empieza a tomar decisiones basadas en una versión vieja del código o en un output que ya no es válido. El resultado es un parche que rompe tres cosas nuevas mientras arregla una. Y lo peor: el agente lo entrega con la seguridad de que está todo bien.

El segundo riesgo es financiero. Los costos de tokens se disparan exponencialmente si el loop no tiene un límite. Un bucle que se queda atascado corrigiendo un error que él mismo generó puede consumir cientos de dólares en pocas horas. El budget guard que proponen desde Anthropic corta la ejecución cuando se alcanza un umbral de tokens o de tiempo. Sin esa protección, el loop es un agujero negro para tu tarjeta de crédito. (Y sí, en producción ya pasó.)

¿Cómo implementar un bucle de agente autónomo paso a paso?

Si querés armar tu propio loop, el esquema base es más simple de lo que parece y tanto Codex CLI como Claude Code te dan ejemplos concretos para arrancar. La receta mínima: Más contexto en el análisis detallado de ChatGPT.

  • Definí el objetivo en lenguaje natural. Cuanto más acotado, mejor. “Arreglá todos los warnings de ESLint” funciona; “hacé que el código sea mejor” no.
  • Configurá el loop con un modelo principal. Podés usar GPT-4o, Claude 4 o cualquier LLM con acceso a herramientas.
  • Integrá herramientas: shell, editor de archivos, git, linters. El agente necesita poder leer, escribir y ejecutar.
  • Agregá un verificador. Un modelo más chico (o el mismo con un prompt específico) que revise si la salida cumple con lo pedido. Si no pasa, el loop reintenta o pide ayuda.
  • Poné un límite de presupuesto. Tokens máximos por tarea o tiempo máximo de ejecución. Cortás y revisás manualmente si se dispara.
  • Ejecutá y monitoreá. No lo dejes solo la primera vez. Los loops aprenden a base de errores, y los primeros errores suelen ser épicos.

¿Qué herramientas y lenguajes se usan para construir agentes con loops?

Las dos implementaciones de referencia son Codex CLI (OpenAI) y Claude Code (Anthropic). Codex CLI está escrito en Python y TypeScript, y todo el código está disponible en GitHub. Claude Code es una herramienta de terminal que corre sobre Node.js, aunque Anthropic no abrió el código del loop (todavía). Ambos comparten una arquitectura parecida: un runner que invoca al modelo, captura la respuesta, ejecuta herramientas y alimenta el resultado de vuelta al modelo.

Para construir tu propio loop desde cero, Python sigue siendo el lenguaje más práctico por la cantidad de SDKs disponibles (OpenAI, Anthropic, LangChain). Igual, ojo: LangChain no es un loop en sí mismo, sino un framework para conectar componentes. Podés usarlo para armar la orquestación, pero el diseño del loop y la lógica de verificación corren por tu cuenta. Si querés algo más liviano, un script de 100 líneas en Python con la API de OpenAI y subprocess alcanza para prototipar.

¿Dónde se aplican estos bucles autónomos en el mundo real?

Los casos de uso que ya están corriendo en producción van desde generación automatizada de código hasta corrección de bugs en pipelines de CI/CD. Codex CLI, por ejemplo, se usa para tareas de mantenimiento de repositorios: actualizar dependencias, migrar configuraciones, refactorizar código legacy con tests de regresión. Claude Code, en entornos de Anthropic, se encarga de revisar pull requests y sugerir cambios con un loop que incluye un verificador de estilo y seguridad.

Google, con Addy Osmani a la cabeza, está aplicando loop engineering en flujos de documentación automática y testing continuo. El patrón es el mismo: definís un objetivo, el loop genera una solución, un verificador la evalúa, y si falla, el loop ajusta y vuelve a intentar. El ahorro de tiempo es considerable, pero siempre con un humano al final de la cadena para aprobar los cambios críticos. (Sí, todavía no confiamos ciegamente en un loop que se autoverifica.) En la guía de modelos de lenguaje y razonamiento profundizamos sobre esto.

Comparativa: Codex agent loop vs. Claude Code loop

CaracterísticaCodex CLI (OpenAI)Claude Code (Anthropic)
ArquitecturaHarness local, multiplataforma, código abiertoHerramienta de terminal, loop propietario
LenguajePython / TypeScriptNode.js (CLI)
Verificador integradoNo; depende de la implementación del usuarioRecomendado como práctica, no integrado por defecto
Budget guardNo oficial; podés configurarlo con límites de APIAdvertencia explícita; implementación manual
Estado del loopDocumentado en issues de GitHubNo documentado públicamente
Ejecución localSí, completamente local salvo llamadas a la APISí, local
Uso principalCambios de software confiables, mantenimiento de reposRevisión de PRs, corrección de bugs, refactors
bucle de agente autónomo diagrama explicativo

Ejemplos concretos que ya están dando vueltas

Ejemplo 1: Codex CLI arreglando warnings de ESLint. Le pasás un repositorio con 200 warnings. El loop analiza cada archivo, aplica fixes automáticos, ejecuta el linter de nuevo y, si el número de warnings bajó, commitea. Si algún fix rompe un test, el verificador (un script que corre los tests) frena el commit y el loop busca otra solución. En pruebas internas, Codex resolvió la gran mayoría de los warnings sin intervención humana. (El resto eran falsos positivos o requerían decisiones de arquitectura.)

Ejemplo 2: Claude Code corrigiendo un bug en producción. Un desarrollador de Anthropic describió el bug en lenguaje natural, y el loop de Claude Code generó un parche, lo aplicó en una rama, corrió los tests de integración y pidió revisión. El tiempo total desde el reporte hasta el pull request fue de apenas unos minutos. El verificador extra —un modelo más chico que revisa la seguridad del cambio— bloqueó dos intentos que introducían vulnerabilidades de inyección. El tercero pasó. Sin el loop, el mismo fix le habría llevado al dev un tiempo considerable entre ida y vuelta.

Qué significa para empresas y equipos en Latinoamérica

Para los equipos de desarrollo de la región, el loop engineering es una oportunidad de automatizar tareas de mantenimiento que suelen quedar para “cuando haya tiempo”. Migrar dependencias, actualizar configuraciones de CI/CD, estandarizar estilos de código… todo eso se puede delegar en un loop que corra de noche y deje un PR listo para revisar a la mañana. El ahorro de horas de trabajo es real, pero ojo con los costos de API: si no ponés un límite de tokens, la factura de OpenAI o Anthropic puede ser un dolor de cabeza. Acá es donde un servidor en la nube con buen ancho de banda y un control de gastos se vuelve clave. Si necesitás correr loops de forma continua, un VPS o cloud local con buena latencia te salva las papas —Donweb tiene opciones para levantar entornos de desarrollo en la nube sin que el costo se dispare.

Qué está confirmado y qué no

  • Confirmado: Anthropic (Boris Cherny) dejó de hacer prompting manual y adoptó loop engineering en junio de 2026.
  • Confirmado: OpenAI publicó el desglose técnico del agent loop de Codex CLI, con código abierto.
  • Confirmado: El término “loop engineering” fue acuñado por Addy Osmani (Google) en 2026.
  • Pendiente: No hay benchmarks independientes que comparen la eficacia de los loops de Codex vs. Claude Code.
  • Pendiente: Anthropic no liberó el código de Claude Code ni la arquitectura detallada de su loop.
  • Pendiente: Todavía no existen estándares de seguridad ni auditorías para loops autónomos en producción.

Errores comunes al trabajar con bucles autónomos

  • No poner un verificador. Es el error más grave. Sin un modelo o script que revise el output, el loop entrega cambios que pueden romper el build o introducir vulnerabilidades. El verificador no es opcional: es la única barrera entre el loop y un desastre en producción.
  • Ignorar el límite de tokens. Los loops se entusiasman. Un bucle que se atasca en un problema de edge case puede consumir miles de tokens sin avanzar. Definí un presupuesto máximo por tarea y cortá la ejecución si se alcanza.
  • Confundir loop engineering con AutoGPT. AutoGPT fue un experimento interesante, pero los loops actuales de Codex y Claude son mucho más controlados y específicos. No son agentes generales que navegan internet; son herramientas de desarrollo con un scope bien definido. No esperes que te organicen las vacaciones.
  • Dejar el loop desatendido en CI/CD. Aunque el verificador dé el OK, siempre conviene que un humano revise los cambios antes de mergear. Los loops no entienden el contexto de negocio ni las decisiones de arquitectura que van más allá de pasar tests.

Preguntas Frecuentes

¿Qué es un bucle de agente autónomo en IA?

Es un ciclo de software que orquesta la interacción entre un modelo de lenguaje, herramientas externas y el usuario, sin que un humano tenga que escribir cada prompt. El agente recibe un objetivo, ejecuta acciones, analiza los resultados y repite hasta completar la tarea. Es la base de herramientas como Codex CLI y Claude Code.

¿Cómo funciona el Codex agent loop de OpenAI?

El loop de Codex CLI es un harness local que orquesta al usuario, el modelo y las herramientas. El agente descompone la tarea, ejecuta comandos de shell, lee archivos y evalúa el resultado antes de iterar. Está escrito en Python y TypeScript, y su código está abierto en GitHub. Te puede servir nuestra cobertura de el recorrido completo por Google.

¿Por qué los ingenieros de Anthropic dejaron de hacer prompting?

Porque diseñar loops que promptean al modelo automáticamente es más eficiente. Boris Cherny lo explicó en junio de 2026: su trabajo ahora es escribir loops, no prompts. El loop maneja el estado, reintenta y verifica, liberando al ingeniero de la interacción manual repetitiva.

¿Cuáles son los riesgos de los bucles autónomos sin verificación?

El principal riesgo es que el loop entregue cambios con bugs o vulnerabilidades con alta confianza. Además, los costos de tokens se disparan sin un límite de presupuesto. Un loop sin verificador y sin budget guard es un problema financiero y de calidad de código asegurado.

¿Cómo implementar un bucle de agente autónomo paso a paso?

Definí un objetivo claro, integrá herramientas (shell, editor), configurá un modelo principal, agregá un verificador que revise cada salida, poné un límite de tokens y ejecutá el loop con monitoreo. Tanto Codex CLI como Claude Code ofrecen ejemplos funcionales para arrancar.

Conclusión

Lo que cambió no es la tecnología de los modelos, sino la forma de usarlos. El loop engineering reemplaza la interacción manual por ciclos autónomos que ejecutan, verifican y corrigen. OpenAI y Anthropic ya lo pusieron en producción, y Google lo adoptó como concepto. Para los equipos de desarrollo, significa que las tareas repetitivas de mantenimiento de código se pueden automatizar con un nivel de confiabilidad que antes no existía. Eso sí, sin verificador y sin control de tokens, el loop es un arma de doble filo. La recomendación es clara: empezá con tareas chicas, poné límites y nunca dejes que un loop haga merge sin revisión humana. El oficio de prompt engineer está mutando, y el que no aprenda a diseñar bucles se va a quedar mirando el cursor titilar.

Fuentes

Desplazarse hacia arriba