needhelp
← Back to blog

सभी बड़े AI मॉडल्स ने Meta के कठिन प्रोग्रामिंग बेंचमार्क पर शून्य स्कोर किया

by needhelp
meta
programming
benchmark
ai-evaluation
software-engineering

7 मई 2026 को, Meta AI Research ने ML कम्युनिटी पर एक बम गिराया। उनका नया ProgramBench बेंचमार्क — जो असली सॉफ़्टवेयर इंजीनियरिंग क्षमता को मापने के लिए डिज़ाइन किया गया है — ने एक ऐसा नतीजा दिया जो पहले से ही AI और कोडिंग के भविष्य के बारे में बातचीत को नया आकार दे रहा है: हर बड़े AI मॉडल ने शून्य स्कोर किया

बेंचमार्क के सबसे महत्वपूर्ण कैटेगरी — आर्किटेक्चर-लेवल मॉड्यूल रिकंस्ट्रक्शन — पर सभी ने एब्सोल्यूट ज़ीरो स्कोर किया।

ProgramBench क्या है?

ProgramBench कोई और LeetCode क्लोन नहीं है। Meta के रिसर्चर्स ने जानबूझकर इसे “इंजीनियरिंग इंटेलिजेंस” मापने के लिए डिज़ाइन किया — पूरे मॉड्यूल के स्तर पर सॉफ़्टवेयर को समझने, रीफ़ैक्टर करने और रिकंस्ट्रक्ट करने की क्षमता, न कि अलग-अलग फ़ंक्शन।

बेंचमार्क टियर GPT-5.5 Claude Opus 4.7 Gemini 2.5 Pro DeepSeek-V3
फ़ंक्शन कम्प्लीशन 74% 78% 71% 67%
मॉड्यूल रिकंस्ट्रक्शन 0% 0% 0% 0%
सिस्टम डिज़ाइन प्लानिंग 23% 31% 19% 14%

मॉडल इतनी बुरी तरह क्यों फेल होते हैं?

मॉडल्स ने सिंटैक्स एरर या साफ़ तौर पर टूटा हुआ कोड नहीं बनाया। उन्होंने प्लॉज़िबल-लगने वाला कोड बनाया जो आर्किटेक्चरली ग़लत था — कोड जो कम्पाइल हुआ, चला, और पहली नज़र में सही लगा, लेकिन बुनियादी डिज़ाइन इनवेरिएंट का उल्लंघन करता था।

Meta के रिसर्चर्स ने एक उपयोगी अंतर गढ़ा: मॉडल्स में सिंटैक्टिक इंटेलिजेंस (अच्छा कोड बनाने की क्षमता) है लेकिन उनमें आर्किटेक्चरल इंटेलिजेंस (अच्छा सिस्टम बनाने की क्षमता) नहीं है।

सॉफ़्टवेयर इंजीनियर्स के लिए इसका मतलब

ProgramBench एक स्पष्ट डेटा पॉइंट प्रदान करता है: AI आपकी नौकरी नहीं ले रहा — कम से कम वह हिस्सा नहीं जिसमें आर्किटेक्चर के बारे में सोचना, डिज़ाइन ट्रेड-ऑफ़ करना और सिस्टम की शुद्धता सुनिश्चित करना शामिल है। AI जो कर रहा है वह स्किल डिस्ट्रीब्यूशन के निचले सिरे को कंप्रेस करना है।

Share this page