שורה תחתונה
אימוץ חלקי — קח שלושה כלים מכניים, דלג על המסגרת. "Loop engineering" הוא מונח אמיתי שנטבע ביוני 2026, אבל לא על ידי בעל הריפו: אדי אוסמני טבע אותו, וקובוס גריילינג בנה סביבו כלים. מבחינה רעיונית אין שם כלום שאתה לא עושה כבר — ה-pm-loop שלך (מכונת מצבים חסומה, מאמת בקונטקסט נקי, quarantine, compound write-back) מהודק בהרבה ממה שכתוב בריפו, שהוא בעצם צ'קליסט markdown. מה שכן שווה לגנוב: gate.yaml (תאום קריא-למכונה של מסמך הבטיחות, נאכף ב-exit code ולא בתקווה שהסוכן קרא), סולם אוטונומיה L0→L3 מפורש לכל לולאה, וזיהוי stagnation בנפרד מתקרת ניסיונות. שלושה פריטים, לא מסגרת.
מה כבר ידענו
הרצתי Recall — במאגר לא היו עובדות קודמות על הנושא הזה. זו קרקע חיצונית חדשה לחלוטין.
אבל *פנימית* זה לא מושג חדש בכלל. ה-studio כבר מחזיק שלוש שכבות של בדיוק העניין הזה:
docs/prism-docs/08-WORKFORCE-ENGINE/pm-loop-formula.md(v2, קנוני מ-2026-07-22) — מכונת מצבים רקורסיבית orchestrator-worker עם שני שעונים, חמישה פעלים,MAX_STAGE_ITERSחסום, מצבBLOCKEDטרמינלי, מאמת בקונטקסט-נקי כמושב נפרד, מסלול quarantine לתוצרים כושלים, ו-COMPOUND חד-פעמי.~/orion-os/app/cli/loop_review.py+app/work_loop/— לולאת עבודה חיה: סוקרת commits ממוזגים, מגישה findings,review_attemptsמוגדל לפני קריאת הסוקר (claim דרך SKIP LOCKED כדי שהתקרה לא תעקף),work_loop_max_review_attempts = 3, ו-terminal_reason(reviewed / exhausted / stale).- לולאות יצירתיות —
creative-skill-loop,improvement-loop,red-flag-design-loop.
כלומר: המונח חדש לנו, הפרקטיקה לא.
מה חדש
1. הריפו עצמו — אמיתי, גדול, ולא מאמר
אימתתי מול GitHub API ב-2026-07-26:
| מדד | ערך |
|---|---|
| כוכבים | 9,406 |
| Forks | 1,290 |
| Watchers | 59 |
| Commits | 320 |
| נוצר | 2026-06-09 |
| Push אחרון | 2026-07-26 (היום) |
| רישיון | MIT |
| Issues פתוחים | 23 |
זה לא מאמר ולא מניפסט — זו monorepo עובדת: 599 קבצים, 9 חבילות npm שפורסמו (loop, loop-audit, loop-init, loop-cost, loop-sync, loop-context, loop-mcp-server, loop-worktree, loop-gate), 7 דפוסי ייצור, starters, 19 stories, ו-CI שמריץ את הדפוסים על עצמו.
קצב הצמיחה חריג: 9.4k כוכבים ב-7 שבועות. מבחינת תרומות זה עדיין פרויקט של אדם אחד — cobusgreyling עם 118 commits, בוט ה-Actions עם 52, וכל שאר ~30 התורמים עם 1-19 כל אחד.
2. גריילינג לא טבע את המונח — אוסמני כן
זו הנקודה החשובה שלא ברורה מהריפו במבט ראשון. תיאור הריפו עצמו אומר (inspired by Addy Osmani and Boris Cherny), וקובץ resources/sources.md מודה בזה במפורש.
שרשרת המקור:
- אדי אוסמני — המסה המקורית, addyosmani.com, 7 ביוני 2026, שוכפלה ב-O'Reilly Radar ב-22 ביוני 2026. ההגדרה שלו: *"Loop engineering is replacing yourself as the person who prompts the agent. You design the system that does it instead."* הוא גם טבע את אוצר המילים: intent debt ("an agent starts every session cold and it will fill any hole in your intent with a confident guess"), comprehension debt, cognitive surrender, orchestration tax.
- בוריס צ'רני (ראש Claude Code באנתרופיק) — הציטוט שמניע את כל השיח: *"I don't prompt Claude anymore. I have loops running that prompt Claude and figuring out what to do. My job is to write loops."*
- פיטר שטיינברגר — *"You shouldn't be prompting coding agents anymore. You should be designing loops that prompt your agents."*
- קובוס גריילינג — Chief Evangelist ב-Kore.ai, כותב פורה מאוד ב-Medium/Substack על LLMs וסוכנים. הוא בונה הכלים במורד הזרם, לא מקור המושג. הרקורד שלו הוא אוונגליזם ותוכן בנפח גבוה, לא מחקר.
3. האם זו "תנועה"? כן — אבל בת 7 שבועות וצרה
יש כמה מפיצים עצמאיים-למחצה (O'Reilly Radar, The New Stack, IBM Think, MindStudio), אבל כמעט כולם נגזרים מאוסמני/צ'רני. שני ממצאים כנים:
- אנתרופיק לא משתמשת במונח בכלל. אוצר המילים הרשמי שלהם הוא *context engineering* ("the set of strategies for curating and maintaining the optimal set of tokens during LLM inference") ו-*harness*. הם מתארים בדיוק את אותה בעיה — כולל כשל ה-"Claude declares victory on the entire project too early" — בלי המילה loop.
- הריפו עצמו מודה בהתנגשות מונחים:
open-spek/loopפיתחה במקביל "loop engineering" במשמעות שונה לגמרי (לולאה מגודרת-בדיקות מ-Spek קפוא ליישום מאומת). גריילינג מקשר לזה מיוזמתו — סימן טוב ליושרה. - ארמין רונאכר כתב על אותו שטח בדיוק ("The Coming Loop", 23 ביוני 2026) בלי להשתמש במונח.
4. איפה הריפו דק — הבדיקה הכי חשובה
docs/adopters.md מכיל 6 שורות, מתוכן 4 הן הריפו של המתחזק עצמו. רק שני מאמצים חיצוניים מתועדים: Hermes Agent של Nous Research ו-Pluribus. כלומר: 9,406 כוכבים מול 2 אימוצים חיצוניים מתועדים. זה פער ענק בין תשומת לב לאימוץ.
בנוסף יש מבנה משפך ברור: loop-audit ממליץ אוטומטית על harness-foundry (ריפו אחר של אותו מחבר) כשהציון ≥80, ויש עוד ארבעה ריפואים אחים (memory-engineering, outerloop, goal-engineering, fleet-engineering) שכל אחד מוכר "Ready Score" משלו. הציון מודד נוכחות scaffolding, לא איכות תוצאה — והם מודים בזה בעצמם ב-story: *"Score ≠ permission — Loop Ready 90+ measures scaffold, not license to auto-fix"*.
מצד שני — ה-stories/ הן באמת טובות, כולל כישלונות כנים: הריגת CI Sweeper אחרי 4 ימים (~8M טוקנים ב-48 שעות, 11 PRs שמתוכם 3 תיקוני סימפטום ו-1 ששבר קונפיג פרודקשן), וסיפור "בעיית המאמת" בלולאת קוונט. זה החלק הכי שווה בריפו.
5. מה באמת אקשנבילי
א. gate.yaml — תאום קריא-למכונה של מסמך הבטיחות. רשימת denylist (.env, auth/, payments/, /migrations/, k8s/production/**), maxFiles: 10, ו-autoMergeAllowlist. נאכף על ידי CLI: loop-gate check --action <type> --paths <files> → exit 2 = escalate, 0 = proceed. הרציונל מנוסח היטב: *"instead of relying on the loop to have read this file"*.
ב. loop-context — מפסק זרם דטרמיניסטי. בלי קריאת LLM ("cheap enough to run on every iteration"). ארבעה אותות נפרדים:
--max-iterations(ברירת מחדל 10)--stagnation(3) — אותה שגיאה N פעמים ברצף--no-progress(5) — N כשלונות רצופים--token-budget— תקציב מצטבר
Exit 0 המשך / 2 escalate. בנוסף מעקב תקציב יומי חוצה-ריצות ב-daily-spend.<pattern>.json עם hook --on-exceed.
ג. מכפילי עלות אורקסטרציה ב-loop-cost: single 1x · maker-checker 2x · parallel:N = N+1 · debate:R = 1+R. מכפיל מעל 2x מפיק אזהרה.
ד. סולם L0→L3: L0 טיוטה · L1 דיווח-בלבד · L2 תיקונים מסויעים עם מאמת · L3 ללא השגחה. הכלל: *"Never skip L1 for a new pattern on a production repo"*.
ה. קטלוג כשלים עם דירוג חומרה (S1 מעצבן / S2 מזיק / S3 קריטי): Infinite Fix Loop, State Rot, Verifier Theater, Token Burn, Over-Reach, Comprehension Debt Spiral, Parallel Collision, Escalation Failure.
ו. העיקרון החד ביותר בכל הריפו — מסיפור הקוונט: *"The maker/checker split is worthless unless the checker measures something the maker cannot fake."* הדגמה: אסטרטגיה עם Sharpe של +2.54 in-sample ו-−4.33 out-of-sample; מאמת LLM היה מאשר, מאמת נומרי דוחה. *"That refusal is the product."*
מה חדש באמת מול מה ששם לדבר ידוע: הרוב המכריע הוא שם לפרקטיקה מוכרת. התרומה האמיתית היא (1) אוצר מילים לכשלים — verifier theater, intent debt, state rot, comprehension debt — שהוא כלי סקירה שימושי, ו-(2) שלושת האַרטִיפָקְטִים המכניים למעלה. שום טכניקה חדשה.
מה זה באמת אומר לנו
מה שכבר יש לך חזק יותר — אל תיגע
| נושא | ב-loop-engineering | ב-PRISM/Orion |
|---|---|---|
| חסימת לולאה | צ'קליסט markdown "hard cap e.g. 3" | MAX_STAGE_ITERS + מצב BLOCKED טרמינלי + guards ממצים ב-pm-loop v2 |
| תקרת ניסיונות | ledger JSON חיצוני | review_attempts++ דורבילי לפני קריאת הסוקר, claim דרך SKIP LOCKED — לא ניתן לעקיפה |
| מאמת נפרד | "different instructions" | מושב Verifier בקונטקסט-נקי שלא ראה את ההנמקה המייצרת |
| תוצרים כושלים | לא מטופל | מסלול quarantine — לא מקודמים ל-canonical state |
| למידה מצטברת | לא קיים | COMPOUND + promotions.log + scorecard /7 שמזין את improvement-loop |
| ביסוס אקדמי | אפס ציטוטים | Huang et al. 2310.01798, Reflexion, Self-Refine, Anthropic multi-agent, Cognition |
הריפו לא מצטט שום מחקר. ה-pm-loop שלך כן. זה לא פרט טכני — זה אומר שהמסגרת שלך יודעת *למה* מאמת עצמי נכשל, והם רק יודעים *ש*הוא נכשל.
מה כן לאמץ — שלושה פריטים
1. gate.yaml — ההחזר הגבוה ביותר. היום כללי הבטיחות שלך חיים בפרוזה (constitution, CLAUDE.md, safety docs) ונאכפים בכך שהסוכן קרא אותם. הריפו מספק את התאום החסר: קובץ YAML + CLI שמחזיר exit code. תרגום ל-PRISM: קובץ denylist/allowlist קריא-למכונה שמריצים לפני כל commit אוטומטי, כולל תקרת maxFiles. זה בדיוק מה שחסר כשלולאות רצות ללא השגחה.
2. סולם L0→L3 כתכונה מפורשת של כל לולאה. יש לך שלבים ושערי P6, אבל אין דרגת אוטונומיה מוצהרת פר-לולאה עם משמעת "אף פעם לא מדלגים על L1". רלוונטי ישירות ללֵיינים היצירתיים (script/image/aviv) ולכל אוטומציה מתוזמנת חדשה. הכלל שלהם — *שבועיים משעממים של דיווח-בלבד לפני שמפעילים כתיבה* — הוא בדיוק הסוג של גדר שמונעת את סיפור ה-8M טוקנים.
3. Stagnation כאות נפרד מתקרת ניסיונות. גם ה-≤3 rework וגם max_review_attempts=3 סופרים ניסיונות. loop-context מוסיף שני אותות שסופר ניסיונות מפספס: *אותה שגיאה 3 פעמים ברצף* ו-*5 כשלונות רצופים*. זול מאוד להוסיף ל-work_loop ול-DECIDE של ה-pm-loop, ותופס את המקרה "3 ניסיונות זהים" שכיום נראה כמו ניצול תקין של התקציב.
שקול (שוליים)
- מכפילי עלות אורקסטרציה כנוסחה ל-EFFORT-SCALE gate: maker-checker ×2, parallel:N ×(N+1), debate:R ×(1+R). ל-gate שלך אין כיום נוסחת עלות מפורשת לפני dispatch.
- אוצר המילים לכשלים כשמות בצ'קליסט סקירה: verifier theater, state rot, comprehension debt spiral.
מיותר — דלג
- 7 הדפוסים (daily triage, PR babysitter, CI sweeper, dependency sweeper...) — יש לך כבר
work_loopsweep,coo_sweep.py, קלאוס. loop-auditscore — מודד נוכחות קבצים. ה-scorecard /7 שלך מודד ריצות אמיתיות. הציון שלהם גרוע יותר, והם מודים בזה.- 9 חבילות ה-npm — כלי Node לבית Python/Astro, ומשפך לריפואים האחרים של המחבר.
- harness-foundry / outerloop / fleet-engineering — יש לך
workflow_runner+ four-layer factory model + capability registry.
פסק דין
המסגרת עצמה היא rebranding של מה שאתה עושה, ואתה עושה את החלק הקשה טוב יותר. אל תאמץ את השפה, אל תשנה את ה-pm-loop, ואל תתרשם מ-9.4k כוכבים מול 2 מאמצים חיצוניים. קח את שלושת האַרטִיפָקְטִים המכניים ולך הלאה. אם אתה קורא רק דבר אחד — קרא את stories/ (הכישלונות הכנים), לא את ה-README.
מה לא הצלחתי לאמת
- עמוד IBM Think על loop engineering — קיבלתי HTTP 403 ולא הצלחתי לקרוא אותו בעצמי. חיפוש טען שהוא קיים; לא מאושר ממקור ראשון.
- הציטוט של בוריס צ'רני — מצוטט בריפו ובכל המשניים, אבל אין לו מקור ראשון שהצלחתי למשוך. הוא מתפוצץ דרך X ופודקאסט. הריפו עצמו כותב "Public statements" בלי קישור. מסומן
unconfirmedכציטוט מדויק. - ניסוח ה-inner loop מול outer loop שיוחס לאוסמני ("delegating the inner loop is leverage; delegating the outer loop is abdication") — משכתי גם את המקור וגם את המראה ב-O'Reilly ולא קיבלתי את הניסוח הזה בחזרה.
unconfirmed. - איכות צמיחת הכוכבים — 9.4k ב-7 שבועות עם CI שמעדכן גרף star-history יומי וקישוריות צולבת ל-5 ריפואים אחים של אותו מחבר. אין לי שום ראיה לחוסר אותנטיות, אבל גם לא הצלחתי לאמת שהצמיחה אורגנית.
- שני המאמצים החיצוניים (Nous Research hermes-agent, Pluribus) — לא אימתתי עצמאית שהם באמת מריצים לולאות בייצור.
- האם מישהו הריץ את הדפוסים האלה בפרודקשן אמיתי מעבר למתחזק — לא מצאתי ראיה. רוב ה-
stories/הן של המתחזק עצמו.