কেন ২০% ট্রেনিং ডেটা ১০০%-কে হারাতে পারে — OST ফ্রেমওয়ার্ক ব্যাখ্যা করা হয়েছে
বড় মাল্টিমোডাল মডেল ট্রেনিং ব্যয়বহুল। এতটাই ব্যয়বহুল যে ডিফল্ট কৌশল — সমস্ত উপলব্ধ ডেটা ব্যবহার করা — ক্রমশ খরচের কারণে নয়, বরং কার্যকারিতার কারণে প্রশ্নবিদ্ধ হচ্ছে।
চীন থেকে গবেষকদের একটি নতুন পেপার, Efficient Data Selection for Multimodal Models via Incremental Optimization Utility (arXiv:2605.07488), একটি ফ্রেমওয়ার্ক প্রস্তাব করেছে যার নাম OST (One-Step-Train) যা এই প্রশ্নটিকে একটি আনুষ্ঠানিক অপ্টিমাইজেশন সমস্যায় পরিণত করে। ফলাফল আশ্চর্যজনক: শীর্ষ ২০% স্যাম্পলে ট্রেনিং ১০০%-এ ট্রেনিংকে ৮.৮ পয়েন্টে হারায়, কম্পিউট খরচ ৪৩% কমিয়ে।
সমস্যা: সব ডেটা সমান নয়
বর্তমান ডেটা কিউরেশন পদ্ধতি হলো LLM-as-a-Judge — প্রতিটি ট্রেনিং স্যাম্পলের কোয়ালিটি স্কোর করতে GPT-5-এর মতো বড় মডেল ব্যবহার করা, তারপর স্কোর অনুযায়ী ফিল্টার করা। এটি কাজ করে, কিন্তু:
১. নিষিদ্ধভাবে ব্যয়বহুল — ট্রেনিং শুরুর আগেই পুরো ডেটাসেটে ইনফারেন্স খরচ দিতে হচ্ছে ২. সিম্যান্টিক্যালি হিউরিস্টিক — LLM-এর বিচার করা “কোয়ালিটি” ট্রেনিং ইউটিলিটির সাথে সম্পর্কযুক্ত নয় ৩. অবোধ্য — তুমি ব্যাখ্যা করতে পারো না কেন একটি স্যাম্পল কম স্কোর পেল
আরও খারাপ, কিছু নিম্ন-মানের স্যাম্পল টক্সিক — তারা আসলে পূর্ণ-ডেটা ট্রেনিংয়ের সময় পারফরম্যান্স রিগ্রেশন ঘটায়।
সমাধান: মার্জিনাল ইউটিলিটি, সিম্যান্টিক কোয়ালিটি নয়
OST ডেটা সিলেকশনকে একটি ইনক্রিমেন্টাল অপ্টিমাইজেশন ইউটিলিটি সমস্যা হিসেবে পুনর্গঠন করে। মূল অন্তর্দৃষ্টি র্যাডিকাল: একটি স্যাম্পল “ভালো” কিনা জিজ্ঞেস করো না — জিজ্ঞেস করো ট্রেনিং সেটে যোগ করলে মডেলের কতটা উন্নতি হয়।
১. প্রক্সি মডেল: ডেটার একটি সাবসেটে একটি ছোট, হালকা মডেল ট্রেন করো ২. সিঙ্গেল-স্টেপ সিমুলেশন: প্রতিটি প্রার্থী স্যাম্পলের জন্য, প্রক্সি মডেলে একক গ্রেডিয়েন্ট আপডেট স্টেপ সিমুলেট করো। ভ্যালিডেশন সেটে লসের পরিবর্তন মাপো — এটি স্যাম্পলের মার্জিনাল ইউটিলিটি ৩. ইউটিলিটি র্যাঙ্কিং: মার্জিনাল ইউটিলিটি অনুযায়ী সব স্যাম্পল র্যাঙ্ক করো ৪. অটোমেটিক টক্সিসিটি ডিটেকশন: যেসব স্যাম্পলের নেগেটিভ মার্জিনাল ইউটিলিটি আছে (ভ্যালিডেশন লস বাড়ায়) সেগুলো টক্সিক হিসেবে শনাক্ত হয়
নাম্বারগুলো: কতটা ভালো?
| পদ্ধতি | ব্যবহৃত ডেটা | Δ বনাম ফুল-SFT | খরচ হ্রাস |
|---|---|---|---|
| ফুল-SFT (বেসলাইন) | ১০০% | ০ | ০% |
| LLM-as-a-Judge | ৫০% | +১.৮ পয়েন্ট | ~৫০% |
| OST (top-20) | ২০% | +৮.৮ পয়েন্ট | ৪৩% |
top-20 ফলাফল শিরোনাম: ৮০% কম ডেটা ব্যবহার করে, OST সবকিছুর ওপর ট্রেনিং থেকে ৮.৮ পয়েন্ট নেট উন্নতি অর্জন করে।
ইঞ্জিনিয়ারিং প্রভাব
১. সবকিছুর ওপর ট্রেনিং বন্ধ করো। “আরও ডেটা = ভালো মডেল” এই ডিফল্ট অনুমান মাল্টিমোডাল ট্রেনিংয়ের জন্য অভিজ্ঞতাসিদ্ধভাবে মিথ্যা।
২. টক্সিসিটি ডিটেকশন একটি সাইড ইফেক্ট। কোন ডেটা তোমার মডেলের ক্ষতি করে তা জানা কমপক্ষে কোন ডেটা সাহায্য করে তা জানার মতোই গুরুত্বপূর্ণ।
৩. প্রক্সি আর্কিটেকচার গুরুত্বপূর্ণ। OST-র পারফরম্যান্স নির্ভর করে প্রক্সি মডেল পূর্ণ মডেলের জন্য একটি যুক্তিসঙ্গত স্ট্যান্ড-ইন কিনা।
বিগার পিকচার
OST প্রমাণের একটি ক্রমবর্ধমান অংশ যে ডেটা কোয়ালিটি > ডেটা কোয়ান্টিটি পোস্ট-স্কেলিং-ল যুগে। OST ২০% ডেটা দিয়ে +৮.৮ পয়েন্ট অর্জন করে — এটি শুধু টাকা বাঁচানো নয়। এটি একটি প্রুফ অফ কনসেপ্ট যে ডেটা সিলেকশন একটি লার্নেবল অপ্টিমাইজেশন সমস্যা, হিউরিস্টিক আর্ট ফর্ম নয়।