needhelp
← Back to blog

Kenapa 20% Data Pelatihan Bisa Kalahkan 100% — Framework OST Dijelaskan

by needhelp
ai
machine-learning
data-selection
training
arxiv

Melatih model multimodal besar itu mahal. Begitu mahalnya sehingga strategi default — gunakan semua data yang tersedia — semakin dipertanyakan bukan karena biaya, tapi karena efektivitas.

Paper baru dari peneliti China, Efficient Data Selection for Multimodal Models via Incremental Optimization Utility (arXiv:2605.07488), mengusulkan framework bernama OST (One-Step-Train) yang mengubah pertanyaan ini menjadi masalah optimasi formal. Hasilnya mengejutkan: pelatihan pada 20% sampel teratas mengungguli pelatihan pada 100% sebesar 8.8 poin, sambil memangkas biaya komputasi 43%.

Masalahnya: Tidak Semua Data Sama

Pendekatan kurasi data yang lazim untuk pelatihan LLM adalah LLM-as-a-Judge — gunakan model lebih besar untuk menilai kualitas setiap sampel pelatihan. Ini bekerja, tapi:

  1. Mahal — Anda membayar biaya inferensi di seluruh dataset sebelum pelatihan dimulai
  2. Heuristik semantik — “Kualitas” yang dinilai LLM tidak selalu berkorelasi dengan utilitas pelatihan
  3. Tidak dapat diinterpretasi — Anda tidak bisa menjelaskan kenapa sampel dinilai rendah

Lebih buruk lagi, beberapa sampel berkualitas rendah beracun — mereka menyebabkan regresi kinerja selama pelatihan data penuh.

Solusinya: Utilitas Marginal, Bukan Kualitas Semantik

OST merumuskan ulang seleksi data sebagai masalah incremental optimization utility. Wawasan kuncinya radikal: jangan tanya apakah sampel itu ‘baik’ — tanya seberapa banyak ia meningkatkan model jika ditambahkan ke set pelatihan.

Angkanya: Seberapa Lebih Baik?

Metode Data Digunakan Δ vs Full-SFT Pengurangan Biaya
Full-SFT 100% 0 0%
LLM-as-a-Judge 50% +1.8 pts ~50%
OST (top-20) 20% +8.8 pts 43%

Hasil top-20 adalah berita utama: menggunakan 80% lebih sedikit data, OST mencapai peningkatan bersih 8.8 poin dibanding pelatihan pada segalanya.

Kenapa Ini Bekerja

Intuisi di balik OST berasal dari fenomena terkenal dalam optimasi: tidak semua contoh berkontribusi sama pada generalisasi. Beberapa sinyal tinggi — mereka mengajari model sesuatu yang belum diketahui. Yang lain sinyal rendah — mereka mengulangi apa yang sudah dipelajari model.

OST menggunakan model proxy kecil untuk memperkirakan utilitas sebenarnya dari setiap sampel. Proxy berfungsi sebagai pengganti murah untuk model penuh.

Implikasi Engineering

1. Berhenti Melatih pada Semuanya

Asumsi default — “lebih banyak data = model lebih baik” — secara empiris salah untuk pelatihan multimodal.

2. Deteksi Toksisitas adalah Efek Samping

Kemampuan OST mengidentifikasi sampel dengan utilitas marginal negatif mungkin lebih berharga dari efisiensi pelatihannya.

3. Arsitektur Proxy Penting

OST bergantung pada model proxy yang menjadi pengganti yang masuk akal untuk model penuh.

Gambaran Besar

OST adalah bagian dari bukti yang berkembang bahwa kualitas data > kuantitas data di era pasca-scaling-law. Fakta bahwa OST mencapai +8.8 poin dengan 20% data bukan hanya tentang menghemat uang. Ini bukti konsep bahwa seleksi data adalah masalah optimasi yang bisa dipelajari, bukan bentuk seni heuristik.

Share this page