needhelp
← Back to blog

কেন ২০% ট্রেনিং ডেটা ১০০%-কে হারাতে পারে — OST ফ্রেমওয়ার্ক ব্যাখ্যা করা হয়েছে

by needhelp
ai
machine-learning
data-selection
training
arxiv

বড় মাল্টিমোডাল মডেল ট্রেনিং ব্যয়বহুল। এতটাই ব্যয়বহুল যে ডিফল্ট কৌশল — সমস্ত উপলব্ধ ডেটা ব্যবহার করা — ক্রমশ খরচের কারণে নয়, বরং কার্যকারিতার কারণে প্রশ্নবিদ্ধ হচ্ছে।

চীন থেকে গবেষকদের একটি নতুন পেপার, Efficient Data Selection for Multimodal Models via Incremental Optimization Utility (arXiv:2605.07488), একটি ফ্রেমওয়ার্ক প্রস্তাব করেছে যার নাম OST (One-Step-Train) যা এই প্রশ্নটিকে একটি আনুষ্ঠানিক অপ্টিমাইজেশন সমস্যায় পরিণত করে। ফলাফল আশ্চর্যজনক: শীর্ষ ২০% স্যাম্পলে ট্রেনিং ১০০%-এ ট্রেনিংকে ৮.৮ পয়েন্টে হারায়, কম্পিউট খরচ ৪৩% কমিয়ে।

সমস্যা: সব ডেটা সমান নয়

বর্তমান ডেটা কিউরেশন পদ্ধতি হলো LLM-as-a-Judge — প্রতিটি ট্রেনিং স্যাম্পলের কোয়ালিটি স্কোর করতে GPT-5-এর মতো বড় মডেল ব্যবহার করা, তারপর স্কোর অনুযায়ী ফিল্টার করা। এটি কাজ করে, কিন্তু:

১. নিষিদ্ধভাবে ব্যয়বহুল — ট্রেনিং শুরুর আগেই পুরো ডেটাসেটে ইনফারেন্স খরচ দিতে হচ্ছে ২. সিম্যান্টিক্যালি হিউরিস্টিক — LLM-এর বিচার করা “কোয়ালিটি” ট্রেনিং ইউটিলিটির সাথে সম্পর্কযুক্ত নয় ৩. অবোধ্য — তুমি ব্যাখ্যা করতে পারো না কেন একটি স্যাম্পল কম স্কোর পেল

আরও খারাপ, কিছু নিম্ন-মানের স্যাম্পল টক্সিক — তারা আসলে পূর্ণ-ডেটা ট্রেনিংয়ের সময় পারফরম্যান্স রিগ্রেশন ঘটায়।

সমাধান: মার্জিনাল ইউটিলিটি, সিম্যান্টিক কোয়ালিটি নয়

OST ডেটা সিলেকশনকে একটি ইনক্রিমেন্টাল অপ্টিমাইজেশন ইউটিলিটি সমস্যা হিসেবে পুনর্গঠন করে। মূল অন্তর্দৃষ্টি র্যাডিকাল: একটি স্যাম্পল “ভালো” কিনা জিজ্ঞেস করো না — জিজ্ঞেস করো ট্রেনিং সেটে যোগ করলে মডেলের কতটা উন্নতি হয়।

১. প্রক্সি মডেল: ডেটার একটি সাবসেটে একটি ছোট, হালকা মডেল ট্রেন করো ২. সিঙ্গেল-স্টেপ সিমুলেশন: প্রতিটি প্রার্থী স্যাম্পলের জন্য, প্রক্সি মডেলে একক গ্রেডিয়েন্ট আপডেট স্টেপ সিমুলেট করো। ভ্যালিডেশন সেটে লসের পরিবর্তন মাপো — এটি স্যাম্পলের মার্জিনাল ইউটিলিটি ৩. ইউটিলিটি র্যাঙ্কিং: মার্জিনাল ইউটিলিটি অনুযায়ী সব স্যাম্পল র্যাঙ্ক করো ৪. অটোমেটিক টক্সিসিটি ডিটেকশন: যেসব স্যাম্পলের নেগেটিভ মার্জিনাল ইউটিলিটি আছে (ভ্যালিডেশন লস বাড়ায়) সেগুলো টক্সিক হিসেবে শনাক্ত হয়

নাম্বারগুলো: কতটা ভালো?

পদ্ধতি ব্যবহৃত ডেটা Δ বনাম ফুল-SFT খরচ হ্রাস
ফুল-SFT (বেসলাইন) ১০০% ০%
LLM-as-a-Judge ৫০% +১.৮ পয়েন্ট ~৫০%
OST (top-20) ২০% +৮.৮ পয়েন্ট ৪৩%

top-20 ফলাফল শিরোনাম: ৮০% কম ডেটা ব্যবহার করে, OST সবকিছুর ওপর ট্রেনিং থেকে ৮.৮ পয়েন্ট নেট উন্নতি অর্জন করে।

ইঞ্জিনিয়ারিং প্রভাব

১. সবকিছুর ওপর ট্রেনিং বন্ধ করো। “আরও ডেটা = ভালো মডেল” এই ডিফল্ট অনুমান মাল্টিমোডাল ট্রেনিংয়ের জন্য অভিজ্ঞতাসিদ্ধভাবে মিথ্যা।

২. টক্সিসিটি ডিটেকশন একটি সাইড ইফেক্ট। কোন ডেটা তোমার মডেলের ক্ষতি করে তা জানা কমপক্ষে কোন ডেটা সাহায্য করে তা জানার মতোই গুরুত্বপূর্ণ।

৩. প্রক্সি আর্কিটেকচার গুরুত্বপূর্ণ। OST-র পারফরম্যান্স নির্ভর করে প্রক্সি মডেল পূর্ণ মডেলের জন্য একটি যুক্তিসঙ্গত স্ট্যান্ড-ইন কিনা।

বিগার পিকচার

OST প্রমাণের একটি ক্রমবর্ধমান অংশ যে ডেটা কোয়ালিটি > ডেটা কোয়ান্টিটি পোস্ট-স্কেলিং-ল যুগে। OST ২০% ডেটা দিয়ে +৮.৮ পয়েন্ট অর্জন করে — এটি শুধু টাকা বাঁচানো নয়। এটি একটি প্রুফ অফ কনসেপ্ট যে ডেটা সিলেকশন একটি লার্নেবল অপ্টিমাইজেশন সমস্যা, হিউরিস্টিক আর্ট ফর্ম নয়।

Share this page