Почему 20% данных побеждают 100% — фреймворк OST
Обучение больших мультимодальных моделей дорого. Настолько дорого, что стратегия «используйте все данные» все чаще ставится под вопрос — не по стоимости, а по эффективности.
Новая статья Efficient Data Selection for Multimodal Models via Incremental Optimization Utility предлагает фреймворк OST (One-Step-Train). Результат удивителен: обучение на топ-20% сэмплов превосходит обучение на 100% на 8.8 баллов, сокращая вычислительные затраты на 43%.
Проблема: не все данные равны
Подход LLM-as-a-Judge для отбора данных дорог, эвристичен и неинтерпретируем. Низкокачественные сэмплы могут быть токсичными — вызывать регресс производительности.
Решение: маржинальная полезность
OST переформулирует отбор данных как задачу инкрементальной оптимизационной полезности. Не спрашивайте «хорош ли сэмпл» — спрашивайте «насколько он улучшает модель».
Механизм:
- Proxy Model — маленькая модель на подмножестве данных
- Single-Step Simulation — симуляция одного градиентного шага на прокси
- Utility Ranking — ранжирование по полезности
- Toxicity Detection — автоматическое исключение сэмплов с отрицательной полезностью
Результаты
| Метод | Данные | Δ vs Full-SFT |
|---|---|---|
| Full-SFT | 100% | 0 |
| OST (top-50) | 50% | +1.8 над LLM-as-a-Judge |
| OST (top-20) | 20% | +8.8 над Full-SFT |
Модель на 100% данных хуже, чем на 20%, отобранных OST. Больше данных сделало модель глупее.
Инженерные выводы
- Перестаньте учить на всем — дефолт «больше данных = лучше» эмпирически ложен
- Токсичность как побочный эффект — знание какие данные вредят модели не менее ценно
- Архитектура прокси важна — прокси должен быть из того же семейства
OST — часть растущего корпуса доказательств, что качество данных > количество данных в пост-scaling law эру.