needhelp
← Back to blog

সব বড় AI মডেল Meta-র কঠিন প্রোগ্রামিং বেঞ্চমার্কে শূন্য পেয়েছে

by needhelp
meta
programming
benchmark
ai-evaluation
software-engineering

৭ মে, ২০২৬-এ, Meta AI Research মেশিন লার্নিং কমিউনিটির ওপর একটি বোমা ফেলেছে। তাদের নতুন ProgramBench বেঞ্চমার্ক — খেলনা প্রোগ্রামিং পাজলের পরিবর্তে প্রকৃত সফটওয়্যার ইঞ্জিনিয়ারিং ক্ষমতা পরীক্ষার জন্য ডিজাইন করা একটি ডেটাসেট — এমন একটি ফলাফল তৈরি করেছে যে এটি AI এবং কোডিংয়ের ভবিষ্যৎ নিয়ে কথোপকথন পুনর্নির্মাণ করছে: প্রত্যেক বড় AI মডেল শূন্য পেয়েছে

কম স্কোর নয়। হতাশাজনক স্কোর নয়। বেঞ্চমার্কের সবচেয়ে অর্থপূর্ণ ক্যাটাগরিতে — আর্কিটেকচার-লেভেল মডিউল পুনর্গঠন — পরম শূন্য

ProgramBench কী?

ProgramBench আরেকটি LeetCode ক্লোন নয়। Meta-র গবেষকরা ইচ্ছাকৃতভাবে এটি ডিজাইন করেছেন যা তারা “ইঞ্জিনিয়ারিং ইন্টেলিজেন্স” বলে তা পরিমাপ করার জন্য — পুরো মডিউলের স্তরে সফটওয়্যার বোঝার, রিফ্যাক্টর করার এবং পুনর্গঠন করার ক্ষমতা, পৃথক ফাংশন নয়। বেঞ্চমার্চ তিনটি স্তর নিয়ে গঠিত:

  • টিয়ার ১ — ফাংশন কমপ্লিশন (FC): ফাংশন সিগনেচার এবং ডকস্ট্রিং দেওয়া, বডি সম্পূর্ণ করো
  • টিয়ার ২ — মডিউল রিকনস্ট্রাকশন (MR): আংশিকভাবে রিড্যাক্টেড মাল্টি-ফাইল কোডবেস দেওয়া, অনুপস্থিত ইমপ্লিমেন্টেশন পুনর্গঠন করো
  • টিয়ার ৩ — সিস্টেম ডিজাইন প্ল্যানিং (SDP): উচ্চ-স্তরের স্পেসিফিকেশন দেওয়া, কোহেরেন্ট মডিউল ডিকম্পোজিশন তৈরি করো

মডেল টিয়ার ১-এ পাসেবল পারফর্ম করেছে। Claude Opus 4.7 ফাংশন কমপ্লিশনে ৭৮% পেয়েছে। GPT-5.5 ৭৪% পেয়েছে। এমনকি DeepSeek-V3-এর মতো ওপেন-সোর্স মডেল ৬০-৭০% রেঞ্জে সম্মানজনক স্কোর পেয়েছে।

টিয়ার ৩-এ তীব্র পতন দেখা গেছে। GPT-5.5 সিস্টেম ডিজাইন প্ল্যানিংয়ে ২৩% পেয়েছে। Claude Opus 4.7 ৩১% পেয়েছে। কিন্তু এই স্কোরগুলি, যদিও দুর্বল, শিরোনাম ছিল না।

টিয়ার ২ — মডিউল রিকনস্ট্রাকশন — যেখানে প্রতিটি মডেল শূন্য পেয়েছে।

মডেল এত সম্পূর্ণভাবে ব্যর্থ হয় কেন?

ব্যর্থতার মোড শিক্ষণীয়। মডেলগুলি সিনট্যাক্স এরর বা স্পষ্টভাবে ভাঙা কোড তৈরি করেনি। তারা প্লসিবল-লুকিং কোড তৈরি করেছে যা আর্কিটেকচারালি ভুল ছিল — কোড যা কম্পাইল হয়, চলে এবং প্রথম নজরে সঠিক মনে হয়, কিন্তু মৌলিক ডিজাইন ইনভেরিয়েন্ট লঙ্ঘন করে, ডিকপল্ড কম্পোনেন্টের মধ্যে লুকানো কাপলিং চালু করে, এবং ক্রস-কাটিং কনসার্ন উপেক্ষা করে।

এটি একটি গভীর সত্য প্রকাশ করে যে বর্তমান LLM কীভাবে কাজ করে। এরা প্যাটার্ন ম্যাচার লোকাল কনটেক্সট উইন্ডোতে প্রশিক্ষিত — ফাংশনের পরের কয়েক লাইন সম্পূর্ণ করতে উজ্জ্বল, কিন্তু আন্তঃসংযুক্ত কম্পোনেন্টের সিস্টেমে সেই লাইনগুলি কীভাবে ফিট হয় তা নিয়ে যুক্তি দিতে মৌলিকভাবে অক্ষম।

ইঞ্জিনিয়ারিং ইন্টেলিজেন্স: পরবর্তী ফ্রন্টিয়ার

“ইঞ্জিনিয়ারিং ইন্টেলিজেন্স” শব্দটি ব্যবহারিক আলোচনায় “AGI”-র উত্তরসূরি হিসেবে ট্র্যাকশন পাচ্ছে। এটি একটি মডেল পুনরাবৃত্ত ফিবোনাচি ফাংশন লিখতে বা ডায়নামিক প্রোগ্রামিং পাজল সমাধান করতে পারে কিনা তা নিয়ে নয় — প্রতিটি বড় মডেল বছর আগেই সেই বার পেরিয়েছে।

ProgramBench বলছে আজকের কোনো মডেলেরই ইঞ্জিনিয়ারিং ইন্টেলিজেন্সের প্রাথমিক রূপও নেই। তারা এক্সিলারেশনের টুল — বয়লারপ্লেট লেখা, টেস্ট কেস জেনারেট করা, কোড ব্যাখ্যা করা — কিন্তু একটি সিস্টেম হিসেবে সফটওয়্যার নিয়ে যুক্তি দিতে পারে না।

যে প্রথম মডেল মডিউল রিকনস্ট্রাকশনে শূন্যের উপরে স্কোর করতে পারবে — সেই ঘাট পেরোনো একজনের কাছে কেবল ভালো অটোকমপ্লিট ইঞ্জিনই থাকবে না, বরং এমন একটি মেশিন থাকবে যে সত্যিকার অর্থে সফটওয়্যার ইঞ্জিনিয়ার করতে পারে।

Share this page