सभी बड़े AI मॉडल्स ने Meta के कठिन प्रोग्रामिंग बेंचमार्क पर शून्य स्कोर किया
7 मई 2026 को, Meta AI Research ने ML कम्युनिटी पर एक बम गिराया। उनका नया ProgramBench बेंचमार्क — जो असली सॉफ़्टवेयर इंजीनियरिंग क्षमता को मापने के लिए डिज़ाइन किया गया है — ने एक ऐसा नतीजा दिया जो पहले से ही AI और कोडिंग के भविष्य के बारे में बातचीत को नया आकार दे रहा है: हर बड़े AI मॉडल ने शून्य स्कोर किया।
बेंचमार्क के सबसे महत्वपूर्ण कैटेगरी — आर्किटेक्चर-लेवल मॉड्यूल रिकंस्ट्रक्शन — पर सभी ने एब्सोल्यूट ज़ीरो स्कोर किया।
ProgramBench क्या है?
ProgramBench कोई और LeetCode क्लोन नहीं है। Meta के रिसर्चर्स ने जानबूझकर इसे “इंजीनियरिंग इंटेलिजेंस” मापने के लिए डिज़ाइन किया — पूरे मॉड्यूल के स्तर पर सॉफ़्टवेयर को समझने, रीफ़ैक्टर करने और रिकंस्ट्रक्ट करने की क्षमता, न कि अलग-अलग फ़ंक्शन।
| बेंचमार्क टियर | GPT-5.5 | Claude Opus 4.7 | Gemini 2.5 Pro | DeepSeek-V3 |
|---|---|---|---|---|
| फ़ंक्शन कम्प्लीशन | 74% | 78% | 71% | 67% |
| मॉड्यूल रिकंस्ट्रक्शन | 0% | 0% | 0% | 0% |
| सिस्टम डिज़ाइन प्लानिंग | 23% | 31% | 19% | 14% |
मॉडल इतनी बुरी तरह क्यों फेल होते हैं?
मॉडल्स ने सिंटैक्स एरर या साफ़ तौर पर टूटा हुआ कोड नहीं बनाया। उन्होंने प्लॉज़िबल-लगने वाला कोड बनाया जो आर्किटेक्चरली ग़लत था — कोड जो कम्पाइल हुआ, चला, और पहली नज़र में सही लगा, लेकिन बुनियादी डिज़ाइन इनवेरिएंट का उल्लंघन करता था।
Meta के रिसर्चर्स ने एक उपयोगी अंतर गढ़ा: मॉडल्स में सिंटैक्टिक इंटेलिजेंस (अच्छा कोड बनाने की क्षमता) है लेकिन उनमें आर्किटेक्चरल इंटेलिजेंस (अच्छा सिस्टम बनाने की क्षमता) नहीं है।
सॉफ़्टवेयर इंजीनियर्स के लिए इसका मतलब
ProgramBench एक स्पष्ट डेटा पॉइंट प्रदान करता है: AI आपकी नौकरी नहीं ले रहा — कम से कम वह हिस्सा नहीं जिसमें आर्किटेक्चर के बारे में सोचना, डिज़ाइन ट्रेड-ऑफ़ करना और सिस्टम की शुद्धता सुनिश्चित करना शामिल है। AI जो कर रहा है वह स्किल डिस्ट्रीब्यूशन के निचले सिरे को कंप्रेस करना है।