훈련 데이터의 20%가 100%를 이길 수 있는 이유 — OST 프레임워크 설명
by needhelp
ai
machine-learning
data-selection
training
arxiv
대규모 멀티모달 모델 훈련은 비싸다. 너무 비싸서, 기본 전략(사용 가능한 모든 데이터 사용)이 비용뿐만 아니라 효과성 측면에서 점점 의문시되고 있다.
중국 연구자들의 새 논문, Efficient Data Selection for Multimodal Models via Incremental Optimization Utility (arXiv:2605.07488)는 OST (One-Step-Train) 프레임워크를 제안한다. 결과는 놀랍다: 상위 20% 샘플로 훈련하면 100%로 훈련한 것보다 8.8점 높은 성능을 내면서 컴퓨팅 비용은 43% 절감.
문제: 모든 데이터가 동등하게 생성되지 않음
LLM-as-a-Judge 접근법은 작동하지만:
- 엄청나게 비싸다 — 훈련 시작 전에 전체 데이터셋에 추론 비용 지불
- 의미론적 휴리스틱 — LLM이 판단한 “품질”이 훈련 효용과 반드시 상관관계가 있지는 않음
- 해석 불가능 — 샘플이 왜 낮은 점수를 받았는지 설명 불가
해결책: 의미론적 품질이 아닌 한계 효용
OST는 데이터 선택을 증분 최적화 효용 문제로 재구성한다. 핵심 통찰은 급진적: 샘플이 “좋은지” 묻지 말고 — 훈련 세트에 추가될 때 모델을 얼마나 개선하는지 물어라.
References
- arXiv:2605.07488 — Efficient Data Selection for Multimodal Models via Incremental Optimization Utility