needhelp
← Back to blog

Почему 20% данных побеждают 100% — фреймворк OST

by needhelp
ai
machine-learning
data-selection
training
arxiv

Обучение больших мультимодальных моделей дорого. Настолько дорого, что стратегия «используйте все данные» все чаще ставится под вопрос — не по стоимости, а по эффективности.

Новая статья Efficient Data Selection for Multimodal Models via Incremental Optimization Utility предлагает фреймворк OST (One-Step-Train). Результат удивителен: обучение на топ-20% сэмплов превосходит обучение на 100% на 8.8 баллов, сокращая вычислительные затраты на 43%.

Проблема: не все данные равны

Подход LLM-as-a-Judge для отбора данных дорог, эвристичен и неинтерпретируем. Низкокачественные сэмплы могут быть токсичными — вызывать регресс производительности.

Решение: маржинальная полезность

OST переформулирует отбор данных как задачу инкрементальной оптимизационной полезности. Не спрашивайте «хорош ли сэмпл» — спрашивайте «насколько он улучшает модель».

Механизм:

  1. Proxy Model — маленькая модель на подмножестве данных
  2. Single-Step Simulation — симуляция одного градиентного шага на прокси
  3. Utility Ranking — ранжирование по полезности
  4. Toxicity Detection — автоматическое исключение сэмплов с отрицательной полезностью

Результаты

Метод Данные Δ vs Full-SFT
Full-SFT 100% 0
OST (top-50) 50% +1.8 над LLM-as-a-Judge
OST (top-20) 20% +8.8 над Full-SFT

Модель на 100% данных хуже, чем на 20%, отобранных OST. Больше данных сделало модель глупее.

Инженерные выводы

  1. Перестаньте учить на всем — дефолт «больше данных = лучше» эмпирически ложен
  2. Токсичность как побочный эффект — знание какие данные вредят модели не менее ценно
  3. Архитектура прокси важна — прокси должен быть из того же семейства

OST — часть растущего корпуса доказательств, что качество данных > количество данных в пост-scaling law эру.

Share this page