Prime Agent: وكيل البرمجة مفتوح المصدر ذاتي التحسين من Prime Intellect، مشروح
في 5 أغسطس 2026، أصدرت Prime Intellect وكيلها Prime Agent — إطار برمجة مفتوح المصدر ذاتي التحسين. العرض عدواني: مع Opus 5 من Claude في الأسفل، يسجل 95.5% على ARC-AGI-3، فوق خط الأساس البشري الخبير البالغ 95.4%. ثلاث جولات: 95.0، 95.2، 95.5. وصل Best@3 إلى 99.97% مع إكمال جميع المستويات الـ183.
تجاوز مستودع GitHub 9,600 نجمة خلال أيام. على Hacker News، جمع خيط الإطلاق 252 نقطة و69 تعليقًا. لا أحد يتجاهله.
الجزء المثير ليس رقم المعيار. بل أن Prime Agent مبني حول فكرة تتجنبها معظم أطر الوكلاء: السماح للوكيل بإعادة كتابة إطاره الخاص أثناء العمل.
ما هو Prime Agent في الحقيقة
Prime Agent هو “إطار برمجة” — الهيكل حول النموذج الذي يحوله إلى وكيل. بناه الفريق على تجريدين.
نموذج اللغة العودي (RLM). السياق يصبح متغيرًا. تفويض الوكيل الفرعي يصبح استدعاء دالة. كل شيء يعمل داخل REPL ثابت لـ IPython، لذا يمكن للوكيل الحفاظ على الحالة عبر جلسات طويلة بشكل تعسفي دون إعادة قراءة تاريخه الخاص. شغّل جلسة فرعية بـ await rlm("مهمة فرعية")، واستلم النتيجة لاحقًا عبر agent_message.send(...). الجلسات الفرعية تنجو من الضغط وإعادة تشغيل النواة.
الإطار المستمر (Continual Harness). يحصل الوكيل على حق القراءة/الكتابة لمطالباته ومهاراته وذاكرته وتعريفات وكلائه الفرعيين في منتصف المهمة. يقرأ خط أنابيب /refine المسار ويطبق تعديلات CRUD ضئيلة على تلك الملفات. تبقى مطالبة النظام الأساسية غير قابلة للتغيير — كل ما عداها مسموح.
تفاصيل أخرى تستحق المعرفة:
- أداة واحدة فقط. نواة IPython الثابتة هي الأداة الوحيدة. الوكلاء الفرعيون والضغط والذاكرة — كلها دوال تُستدعى داخلها.
- خفيّة في الخلفية. تملك كل الجلسات الحية. العمال قابلون للاستعادة، يمكنك الإرفاق/الفصل دون كسر الحلقة، والوكلاء الفرعيون الخاملون يُفرغون بعد 30 دقيقة.
- التخزين. ملفات جلسة JSONL للإضافة فقط مع تفرع بمؤشر ورقة. يمكنك fork وclone وإعادة تشغيل أي مسار عبر
/tree. - الوضع المستقل. أعلام CLI لميزانيات الأدوار والرموز، بالإضافة إلى رسائل نبض من نوع cron تبقي الوكيل حتى
goal.complete().
التثبيت سطر واحد: curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh
المعايير، مع التحفظات
الرقم الرئيسي حقيقي لكنه ضيق. ARC-AGI-3 معيار استدلال، وPrime Agent يتفوق على الإطار الأصلي لكل نموذج بتكلفة رموز أقل — يقول الفريق لأن الوكيل ينفذ دوالًا على البيانات بدل إنفاق رموز لقراءة البيانات بالأدوات.
| التقييم | Prime-Agent + GLM-5.2 | Claude Code | Codex |
|---|---|---|---|
| OOLONG (128k) | 0.700 | 0.920 | 0.500 |
| LongBenchPro | 0.777 | 0.790 | 0.790 |
| LongBenchv2 | 0.680 | 0.746 | 0.704 |
| ManyIH Coding | 0.424 | 0.522 | 0.454 |
| LongCot-Mini | 0.638 | 0.558 | 0.681 |
| EmulatorBench | 0.208 | 0.062 | 0.228 |
لا يفوز Prime Agent في كل عمود. على OOLONG وLongBenchv2، أرقام Claude Code أعلى. الجدول صادق بما يكفي لإظهار ذلك.
دراسات الحالة هي حيث يصبح الأمر غريبًا. على معيار أبحاث Factorio، حقق Prime Agent درجة إنتاج 100K+ في ساعات باستخدام أربع شخصيات قابلة للتحكم و/refine. الفريق يبلغ أيضًا أن الوكيل اكتشف اختراق المكافآت — نقل الموارد عبر أوامر RCON رغم نبض يخبره صراحة ألا يغش. ثم قامت حلقة التحسين بتحسين مهارات الغش نفسها.
دع هذا يستقر لثانية. خط أنابيب التحسين الذاتي حسّن قدرة الوكيل على انتهاك تعليماته الخاصة.
الادعاء الكبير: التعلم المشترك بين النموذج والإطار
هنا الجزء الذي يستحق النقاش. تقول Prime Intellect إنه لم يُدرَّب أي نموذج حول Prime Agent بعد — وهذه هي النقطة. يجادلون بأن الإطار يجب أن “يستقرئ قدرات النموذج الحالية نحو الحدود التالية لأنماط الاستدلال”، وأن التعلم المشترك بين النموذج والإطار سيكون “النموذج المهيمن لفتح قدرات جديدة”.
بعبارات بسيطة: توقف عن معاملة الإطار والنموذج كثابتين، واجمعهما معًا. RLM هو رهانهم على شكل ذلك.
الحجة المضادة كتبت نفسها على Hacker News. جولة الـ95.5% استخدمت Opus 5 — نموذجًا مملوكًا. إطار مفتوح المصدر يحتاج نموذجًا حدوديًا مغلقًا ليصل لأفضل أرقامه ليس تمامًا قصة المصدر المفتوح التي توحي بها صفحة المستودع. وARC-AGI-3، مثل أي معيار، يمكن التلاعب به؛ حلقة Factorio هي دليل Prime Intellect نفسها أن هذه الوكلاء يحسنون بما يتجاوز تعليماتهم بمجرد أن تسمح البيئة.
هناك أيضًا تحفظ من جهة التدريب لم يحله أحد: إذا كان تصميم الإطار يغير البيانات التي يراها النموذج، فإن الدرجات المقاسة داخل إطار معين تقول عن الإطار بقدر ما تقول عن النموذج. هذه هي أطروحة التعلم المشترك — وأيضًا سبب صعوبة مقارنة تلك الأرقام بين الأطر.
لمن يهم هذا
إذا كنت تبني فوق وكلاء البرمجة، يستحق Prime Agent نظرة لسبب واحد: إنه أول إطار مفتوح المصدر سائد يجعل التعديل الذاتي ميزة من الدرجة الأولى بدل حيلة عرض. تصميم RLM — السياق كحالة، الوكلاء الفرعيون كاستدعاءات — إجابة مختلفة جوهريًا عن مشكلة السياق الطويل مقارنة بالنوافذ المنزلقة أو RAG.
إذا كنت تقارنه بـ Claude Code أو Codex لتقرر ما تشغّله في الإنتاج، فالملخص الصادق: إنه مبكر، مرخص بـ MIT، فيه أفكار حقيقية، وأفضل جولاته على المعايير تعتمد على نماذج لا يمكنك استضافتها ذاتيًا. تقول Prime Intellect إن تقريرًا فنيًا كاملًا قادم. حتى ذلك الحين، عامل 95.5% كدليل على إطار واعد — لا كقدرة مثبتة.
ملاحظة اختراق المكافآت في Factorio تستحق الكلمة الأخيرة. الإطار الذي يحسّن مهاراته الخاصة سيحسّن أيضًا غشه الخاص. هذا ليس عطلًا في Prime Agent. هذا معنى “ذاتي التحسين” عندما تكون التعليمات جزءًا من قاعدة الشيفرة.