$ man how-to/autonomous-agent-loops
סוכנים מקביליםintermediate
לולאות סוכן אוטונומיות: דפוס ה-Autoresearch
איך ריפו ה-autoresearch של Karpathy חושף את הארכיטקטורה מאחורי סוכני AI שמשפרים את עצמם
by Shawn Tenam
מהו Autoresearch
במרץ 2026, Andrej Karpathy שיחרר את autoresearch (הכרזה ב-X). שלושה קבצים. GPU אחד. סוכן AI שמשנה קוד אימון, מריץ ניסוי של 5 דקות, מעריך אם התוצאה השתפרה, שומר או זורק את השינוי, וחוזר על זה. בערך 12 ניסויים בשעה, בערך 100 במהלך הלילה, עם אפס התערבות אנושית.
הריפו עצמו הוא דמו - מודל GPT קטן שמתאמן על GPU NVIDIA בודד. אבל הדפוס שהוא מדגים הוא התרומה האמיתית. לולאות סוכן אוטונומיות עם מדד ברור, מרחב פעולה מוגבל, ואיטרציה בלתי מוגבלת.
PATTERN
ארכיטקטורת שלושת הקבצים
כל המערכת היא שלושה קבצים. prepare.py נעול - כלי עזר לטעינת נתונים והערכה שהסוכן לא יכול לגעת בהם. train.py הוא הקובץ היחיד שהסוכן משנה - מכיל את המודל, ה-optimizer, ולולאת האימון. program.md הוא איפה שבני אדם כותבים הוראות לסוכן.
הקובץ האחרון הוא שינוי הפרדיגמה. אתה לא מתכנת Python. אתה מתכנת קובץ markdown שאומר לסוכן מה לחקור. הסוכן כותב את ה-Python. Karpathy קורא לזה "תכנות ה-program.md." האדם מספק אסטרטגיה. הסוכן מספק ביצוע. הלולאה מספקת הצטברות.
PATTERN
הדפוס מיושם ל-GTM
ללולאת ה-autoresearch יש ארבעה שלבים: שנה, בדוק, הערך, שמור-או-זרוק. הדפוס הזה חל על כל תחום שבו אתה יכול להגדיר מדד הצלחה ברור ולתת לסוכן מרחב פעולה מוגבל.
Pipelines תוכן: קרא פלט קודם, צור תוכן חדש, אמת מול כללי איכות, דרג את הפלט, נסה שוב אם מתחת לסף. הפלט הופך לקלט למחזור הבא. עקביות הקול משתפרת עם כל איטרציה כי הסוכן לומד ממה שכבר ייצר.
קמפייני אימייל: צור וריאנט, שלח לסגמנט ניסוי, מדוד שיעור תשובה, שמור או זרוק את הוריאנט. הקמפיין מייעל את עצמו לאורך זמן.
תהליכי עבודה להעשרה: הרץ רצף העשרה, דרג את איכות הנתונים, סמן פערים, שנה את הרצף, הרץ שוב. כל מעבר ממלא חורים שהמעבר הקודם פספס.
העיקרון זהה בכל מקום: הגדר את המדד, הגבל את מרחב הפעולה, תן ללולאה לרוץ.
PRO TIP
אילוץ הוא התכונה
Autoresearch עובד כי מרחב הבעיה צר בכוונה. קובץ אחד שהסוכן יכול לערוך. מספר אחד לייעל. ניסויים של 5 דקות. אם אתה נותן לסוכן היקף בלתי מוגבל, הוא משוטט. אם אתה נותן לו קובץ אחד ומספר אחד, הוא מייעל.
זה הלקח הכי ניתן להעברה. כשמעצבים תהליכי עבודה של סוכן אוטונומי, הפיתוי הוא לתת לסוכן גמישות מקסימלית. ההפך מייצר תוצאות טובות יותר. צמצם את מרחב הפעולה. בחר מדד אחד. הגדר תקציב זמן לאיטרציה. תן ללולאה להצטבר.
המערכת של Karpathy הגיעה ל-10,000+ דורות כי כל דור זול, מהיר, ומוערך בבירור. סוכן שמנסה לייעל הכל בבת אחת מגיע לאפס דורות כי הוא אף פעם לא מסיים ניסוי בודד.
CODE
איך לבנות לולאה משלך
המתכון הוא ארבעה מרכיבים:
1. מרחב פעולה - מה הסוכן יכול לשנות? שמור אותו צר ככל האפשר. קובץ אחד. תבנית אחת. בלוק הגדרות אחד.
2. מדד הערכה - איך אתה יודע אם השינוי עזר? חייב להיות מספרי ואוטומטי. loss של validation, ציון אנטי-סלנג, שיעור תשובה, אחוז שלמות נתונים. אם בן אדם צריך לשפוט, הלולאה לא יכולה לרוץ אוטונומית.
3. תקציב זמן - כמה זמן כל ניסוי רץ? קצר מספיק לאיטרציה מהירה (Karpathy משתמש ב-5 דקות). ארוך מספיק לייצר סיגנל משמעותי.
4. זיכרון - מה הסוכן נושא בין איטרציות? הפלט מאיטרציה N הופך להקשר לאיטרציה N+1. זו התכונה הרקורסיבית שגורמת ללולאה להצטבר במקום לחזור על עצמה.
אתה לא צריך H100 או framework מותאם. סשן Claude Code עם קובץ הוראות markdown, סקריפט להרצה, ופונקציית דירוג מספיקים כדי להריץ את הדפוס הזה על מכונה בודדת.
knowledge guide
מדריכים קשורים