needhelp
← Back to blog

अनुकूली समानांतर तर्क: LLM जो तय करते हैं कि कब मल्टी-टास्क करना है

by needhelp
llm
तर्क
समानांतर-कंप्यूटिंग
एआई-अनुसंधान
अनुमान

अनुकूली समानांतर तर्क

बड़े भाषा मॉडल तर्क करने में महान हैं — लेकिन वे धीमे हैं। किसी LLM से एक जटिल गणित समस्या हल करने या मल्टी-फ़ाइल कोडबेस डीबग करने के लिए कहें, और यह कदम दर कदम, एक विचार एक बार में आगे बढ़ेगा। उस अनुक्रमिक दृष्टिकोण का एक नाम है: चेन-ऑफ़-थॉट तर्क। और इसमें एक समस्या है: जैसे-जैसे तर्क श्रृंखला बढ़ती है, विलंबता भी बढ़ती है — और मॉडल के अपने विचारों में खो जाने की संभावना भी, एक घटना जिसे शोधकर्ता “संदर्भ भ्रष्टाचार” कहते हैं।

शोध की एक नई लहर इसे बदल रही है। अनुकूली समानांतर तर्क LLM को स्वायत्त रूप से यह तय करने देता है कि कब किसी कार्य को उप-कार्यों में विभाजित करना है, कितने समानांतर चलाने हैं, और परिणामों का समन्वय कैसे करना है। यह एक व्यक्ति के सब कुछ क्रम में करने और एक टीम लीड के बीच का अंतर है जो जानता है कि कब प्रतिनिधित्व करना है।

अनुक्रमिक बनाम समानांतर

अनुक्रमिक तर्क की समस्या

पारंपरिक LLM तर्क इस तरह काम करता है: चरण 1 सोचें, फिर चरण 2, फिर चरण 3। प्रत्येक चरण पिछले के आउटपुट पर निर्भर करता है। यह सरल कार्यों के लिए काम करता है, लेकिन टूट जाता है जब:

  • विलंबता बढ़ती जाती है — 50 अनुक्रमिक चरण प्रत्येक 200ms के साथ = 10 सेकंड प्रतीक्षा
  • संदर्भ भ्रष्टाचार — जितनी लंबी श्रृंखला, उतना ही मॉडल मूल आशय से भटकता है
  • खोज महंगी है — यदि चरण 3 में 5 संभावित शाखाएँ हैं, तो उन सभी को अनुक्रमिक रूप से खोजना बेहद धीमा है

रीयल-टाइम अनुप्रयोगों — कोडिंग असिस्टेंट, वॉयस एजेंट, स्वायत्त सिस्टम — के लिए ये देरी केवल कष्टप्रद नहीं हैं। ये डीलब्रेकर हैं।

अनुकूली समानांतर तर्क क्या है?

मुख्य विचार सरल है: मॉडल को अपनी समानांतरता रणनीति स्वयं तय करने दें। एक निश्चित नियम (“हमेशा 4 समानांतर थ्रेड चलाएं”) के बजाय, अनुकूली तर्क LLM को तीन सवालों के जवाब देने की स्वायत्तता देता है:

निर्णय प्रश्न
कब विघटित करें क्या यह कार्य समानांतरीकरण से लाभ उठाने के लिए पर्याप्त जटिल है?
कितने थ्रेड कितने स्वतंत्र उप-कार्य एक साथ खोजे जा सकते हैं?
कैसे समन्वय करें समानांतर थ्रेड के परिणामों को कैसे मर्ज और संश्लेषित किया जाना चाहिए?

यह उल्लेखनीय रूप से समान है कि कैसे एक कुशल मानव इंजीनियर काम करता है: आसान कामों को अनुक्रमिक रूप से निपटाएं, अस्पष्टता का सामना करने पर समानांतर जांच में विभाजित हों, फिर निष्कर्षों को एक सुसंगत निष्कर्ष में मर्ज करें।

मुख्य शोध: ThreadWeaver और Multiverse

Berkeley AI Research (BAIR) के दो हालिया शोधपत्र इस प्रतिमान को आगे बढ़ा रहे हैं:

ThreadWeaver

ThreadWeaver LLM तर्क के लिए गतिशील थ्रेड प्रबंधन प्रस्तुत करता है। मॉडल ब्रांचिंग पॉइंट — कई संभावित समाधान पथ — का सामना करने पर समानांतर थ्रेड बनाना सीखता है, और जब एक दिशा के लिए पर्याप्त सबूत जमा हो जाते हैं तो उन्हें मर्ज कर देता है।

Multiverse

Multiverse अवधारणा को आगे ले जाता है, समानांतर तर्क को एक ट्री सर्च समस्या के रूप में मानता है। मॉडल एक साथ कई “ब्रह्मांडों” में तर्क बनाए रखता है, अप्रतिम शाखाओं को जल्दी काटता है और प्रतिम शाखाओं पर खोज को गहरा करता है।

प्रदर्शन तुलना

दोनों दृष्टिकोण गणित और कोड बेंचमार्क पर महत्वपूर्ण लाभ दिखाते हैं जबकि एंड-टू-एंड विलंबता को नाटकीय रूप से कम करते हैं। कुछ बेंचमार्क पर, समानांतर दृष्टिकोण आधे से भी कम समय में अनुक्रमिक तर्क के समान सटीकता प्राप्त करते हैं।

यह क्यों मायने रखता है

निश्चित से अनुकूली समानांतरता में बदलाव तीन कारणों से मायने रखता है:

1. रीयल-टाइम AI व्यवहार्य हो जाता है। वॉयस असिस्टेंट और कोडिंग कोपायलट को सब-सेकंड प्रतिक्रिया समय चाहिए। अनुकूली समानांतरता जटिल तर्क कार्यों से सेकंड कम कर सकती है।

2. अधिक कुशल कंप्यूट उपयोग। 4 समानांतर छोटी श्रृंखलाएं चलाना एक बहुत लंबी श्रृंखला से सस्ता हो सकता है — विशेष रूप से बैचिंग और थ्रेड्स के बीच KV-कैश साझाकरण के साथ।

3. बेहतर तर्क गुणवत्ता। स्वतंत्र समानांतर खोज मॉडल के गलत प्रारंभिक चरण में फंसने और शेष श्रृंखला में उसका बचाव करने के जोखिम को कम करती है।

बड़ी तस्वीर

यह एक व्यापक प्रवृत्ति का हिस्सा है: LLM अपने कंप्यूट उपयोग में अधिक स्वायत्त हो रहे हैं। हमने इसे इन्फ्रेंस-टाइम स्केलिंग (मॉडल कठिन समस्याओं पर अधिक सोचते हैं) के साथ देखा, और अब इन्फ्रेंस-टाइम समानांतरता (मॉडल शाखित समस्याओं पर व्यापक सोचते हैं) के साथ।

अंतिम लक्ष्य एक ऐसा मॉडल है जो अपने सामने विशिष्ट समस्या की कठिनाई के आधार पर गतिशील रूप से कंप्यूट — समय और समानांतरता — आवंटित करता है। एक सरल प्रश्न को त्वरित अनुक्रमिक उत्तर मिलता है। एक कठिन को मेटा-तर्क परत द्वारा समन्वित और मर्ज किए गए समानांतर तर्क थ्रेड का एक बेड़ा मिलता है।

यह केवल LLM को तेज़ बनाने के बारे में नहीं है। यह उन्हें इस बारे में अधिक स्मार्ट बनाने के बारे में है कि वे कैसे सोचते हैं।

संदर्भ

Share this page