needhelp
← Back to blog

چرا ۲۰٪ داده‌های آموزش می‌توانند ۱۰۰٪ را شکست دهند — چارچوب OST توضیح داده شده

by needhelp
ai
machine-learning
data-selection
training
arxiv

آموزش مدل‌های چندحالته بزرگ گران است. آنقدر گران که استراتژی پیش‌فرض—استفاده از همه داده‌های موجود—به طور فزاینده‌ای نه به دلیل هزینه، بلکه به دلیل اثربخشی زیر سوال می‌رود.

یک مقاله جدید از محققان چین، Efficient Data Selection for Multimodal Models via Incremental Optimization Utility، چارچوبی به نام OST (One-Step-Train) را پیشنهاد می‌کند که این سوال را به یک مسئله بهینه‌سازی صوری تبدیل می‌کند. نتیجه شگفت‌آور است: آموزش روی ۲۰٪ برتر نمونه‌ها از آموزش روی ۱۰۰٪ با ۸.۸ امتیاز بهتر عمل می‌کند، در حالی که هزینه‌های compute را ۴۳٪ کاهش می‌دهد.

مشکل: همه داده‌ها برابر نیستند

رویکرد رایج برای curation داده برای آموزش LLM LLM-as-a-Judge است—استفاده از یک مدل بزرگ‌تر برای امتیازدهی کیفیت هر نمونه آموزشی. این کار می‌کند، اما: گران است، اکتشافی است و قابل تفسیر نیست.

راه‌حل: مطلوبیت حاشیه‌ای، نه کیفیت معنایی

OST انتخاب داده را به عنوان یک مسئله مطلوبیت بهینه‌سازی افزایشی فرمول‌بندی می‌کند. بینش کلیدی رادیکال است: نپرس آیا یک نمونه «خوب» است—بپرس چقدر مدل را بهبود می‌بخشد اگر به مجموعه آموزش اضافه شود.

اعداد: چقدر بهتر؟

روش داده استفاده‌شده Δ در مقابل Full-SFT کاهش هزینه
Full-SFT ۱۰۰٪ ۰ ۰٪
OST (top-۵۰) ۵۰٪ +۱.۸ امتیاز ۴۳٪
OST (top-۲۰) ۲۰٪ +۸.۸ امتیاز ۴۳٪

نتیجه top-20 تیتر است: با استفاده از ۸۰٪ داده کمتر، OST بهبود خالص ۸.۸ امتیازی نسبت به آموزش روی همه چیز به دست می‌آورد.


References

Share this page