$ man how-to/autonomous-agent-loops
Agentes Paralelosintermediate
Loops de Agentes Autonomos: El Patron Autoresearch
Como el repositorio autoresearch de Karpathy revela la arquitectura detras de agentes de IA que se auto-mejoran
by Shawn Tenam
Que Es Autoresearch
En marzo de 2026, Andrej Karpathy lanzo autoresearch (anuncio en X). Tres archivos. Una GPU. Un agente de IA que modifica codigo de entrenamiento, ejecuta un experimento de 5 minutos, evalua si el resultado mejoro, mantiene o descarta el cambio, y repite. Alrededor de 12 experimentos por hora, aproximadamente 100 durante la noche, con cero intervencion humana.
El repositorio en si es un demo - un modelo GPT pequeno entrenando en una sola GPU NVIDIA. Pero el patron que demuestra es la verdadera contribucion. Loops de agentes autonomos con una metrica clara, un espacio de accion restringido, e iteracion indefinida.
PATTERN
La Arquitectura de Tres Archivos
El sistema completo son tres archivos. prepare.py esta bloqueado - utilidades para carga de datos y evaluacion que el agente no puede tocar. train.py es el unico archivo que el agente modifica - contiene el modelo, el optimizador, y el loop de entrenamiento. program.md es donde los humanos escriben instrucciones para el agente.
Ese ultimo archivo es el cambio de paradigma. No programas Python. Programas un archivo markdown que le dice al agente que explorar. El agente escribe el Python. Karpathy lo llama "programar el program.md." El humano proporciona estrategia. El agente proporciona ejecucion. El loop proporciona acumulacion.
PATTERN
El Patron Aplicado a GTM
El loop de autoresearch tiene cuatro pasos: modificar, probar, evaluar, mantener-o-descartar. Este patron se aplica a cualquier dominio donde puedas definir una metrica de exito clara y darle a un agente un espacio de accion restringido.
Pipelines de contenido: leer el output anterior, generar nuevo contenido, validar contra reglas de calidad, puntuar el output, reintentar si esta por debajo del umbral. El output se convierte en input para el siguiente ciclo. La consistencia de voz mejora con cada iteracion porque el agente estudia lo que ya produjo.
Campanas de email: generar una variante, enviar a un segmento de prueba, medir tasa de respuesta, mantener o descartar la variante. La campana se optimiza sola con el tiempo.
Flujos de trabajo de enriquecimiento: ejecutar una secuencia de enriquecimiento, puntuar la calidad de datos, marcar vacios, modificar la secuencia, ejecutar de nuevo. Cada pasada llena huecos que la pasada anterior no encontro.
El principio es el mismo en todas partes: define la metrica, restringe el espacio de accion, deja que el loop se ejecute.
PRO TIP
La Restriccion Es la Caracteristica
Autoresearch funciona porque el espacio del problema es deliberadamente estrecho. Un archivo que el agente puede editar. Un numero para optimizar. Experimentos de cinco minutos. Si le das a un agente alcance ilimitado, deambula. Si le das un archivo y un numero, optimiza.
Esta es la leccion mas transferible. Al disenar flujos de trabajo de agentes autonomos, la tentacion es dar al agente maxima flexibilidad. Lo opuesto produce mejores resultados. Estrecha el espacio de accion. Elige una metrica. Establece un presupuesto de tiempo por iteracion. Deja que el loop se acumule.
El sistema de Karpathy alcanzo mas de 10,000 generaciones porque cada generacion es barata, rapida, y claramente evaluada. Un agente que intenta optimizar todo a la vez alcanza cero generaciones porque nunca termina un solo experimento.
CODE
Como Construir Tu Propio Loop
La receta son cuatro componentes:
1. Espacio de accion - que puede modificar el agente? Mantenlo lo mas estrecho posible. Un archivo. Una plantilla. Un bloque de configuracion.
2. Metrica de evaluacion - como sabes si el cambio ayudo? Debe ser numerico y automatizado. Loss de validacion, puntuacion anti-slop, tasa de respuesta, porcentaje de completitud de datos. Si un humano tiene que juzgar, el loop no puede ejecutarse autonomamente.
3. Presupuesto de tiempo - cuanto dura cada experimento? Suficientemente corto para iterar rapido (Karpathy usa 5 minutos). Suficientemente largo para producir una senal significativa.
4. Memoria - que lleva el agente entre iteraciones? El output de la iteracion N se convierte en contexto para la iteracion N+1. Esta es la propiedad recursiva que hace que el loop se acumule en lugar de repetirse.
No necesitas un H100 o un framework personalizado. Una sesion de Claude Code con un archivo de instrucciones markdown, un script para ejecutar, y una funcion de puntuacion es suficiente para ejecutar este patron en una sola maquina.
knowledge guide
guías relacionadas