SubQ: LLM Subquadratic dengan Konteks 12M Token dan Biaya 1.000x Lebih Murah
Pada 5 Mei 2026, startup berbasis Miami bernama Subquadratic muncul dari mode stealth dengan klaim berani: model mereka SubQ adalah LLM pertama yang dibangun di atas arsitektur subquadratic sejati, mampu memproses 12 juta token dalam satu jendela konteks dengan biaya komputasi sangat kecil dari model terkemuka saat ini.
Responsnya langsung — dan tajam terbelah.
Inovasi Inti: Subquadratic Sparse Attention (SSA)
Fitur utamanya adalah SSA, mekanisme sparse attention yang secara fundamental mengubah cara model berskala dengan panjang konteks.
Masalah perhatian Transformer standar berskala sebagai O(n²) — gandakan konteks, empat kali lipat komputasi. Pada 1 juta token, attention saja akan membutuhkan triliunan operasi.
SSA menggantikan matriks attention padat dengan mekanisme seleksi sparse berbasis konten. Model secara dinamis memilih token mana yang akan diperhatikan, mengurangi kompleksitas ke skala mendekati linear O(n).
Biaya
| Tugas | SubQ | Claude Opus | Rasio Biaya |
|---|---|---|---|
| RULER 128K | $8 | ~$2.600 | ~325x lebih murah |
| SWE-Bench | ~$0.50 | ~$5 | ~10x lebih murah |
| MRCR v2 1M | ~$50 | ~$15.000 (est.) | ~300x lebih murah |
Jika angka ini benar, implikasinya sangat besar.
Skeptisisme
Komunitas riset AI telah mengangkat beberapa kekhawatiran: tidak ada paper teknis, bobot tertutup, benchmarking sempit, dan celah 17 poin antara riset dan produksi.
Kenapa Ini Penting
Bahkan dengan skeptisisme, SubQ mewakili momen berarti. Penghalang kuadratik adalah kendala besar terakhir pada arsitektur Transformer. Siapa pun yang memecahkan scaling subquadratic membuka use case fundamental baru.