StepAudio 2.5: रियल-टाइम वॉइस AI जो आपकी इमोशन पढ़ता है
by needhelp
Voice AI
StepFun
Real-Time
Emotion AI
Speech
वॉइस AI सालों से अनकैनी वैली में फँसा हुआ था — तकनीकी रूप से प्रभावशाली लेकिन इमोशनली फ़्लैट। StepFun का नया StepAudio 2.5 शायद वह मॉडल है जो आखिरकार गैप को पाटता है। यह आपकी आवाज़ में कंपन, मुश्किल शब्द से पहले का ठहराव सुन सकता है, और वास्तविक रूप से उपयुक्त इमोशनल टोन में जवाब दे सकता है।
ट्रांसक्रिप्शन से परे
ज़्यादातर वॉइस मॉडल दो काम करते हैं: स्पीच को टेक्स्ट में ट्रांसक्राइब करना, और टेक्स्ट को वापस स्पीच में बदलना। StepAudio 2.5 एक तीसरा आयाम जोड़ता है: पैरालिंग्विस्टिक अंडरस्टैंडिंग।
मॉडल कैप्चर करता है:
- वॉइस टोन — खुश, उदास, निराश, भ्रमित, उत्साहित
- स्पीच रिदम — हिचकिचाहट, तेज़ी, कॉन्फ़िडेंस शिफ़्ट
- इमोशनल वैलेंस — पॉज़िटिव, नेगेटिव, न्यूट्रल
- नॉन-वर्बल सिग्नल्स — आहें, हँसी, फ़िलर शब्द
एक मिलियन पर्सनाज़, एक API
StepAudio 2.5 की सबसे दिलचस्प बात इसका पर्सना कस्टमाइज़ेशन API है। कुछ प्रीसेट वॉइसेज़ के बजाय, मॉडल आपको नेचुरल लैंग्वेज प्रॉम्प्ट के ज़रिए कस्टम पर्सनैलिटी डिफ़ाइन करने देता है।