needhelp
← Back to blog

StepAudio 2.5: रियल-टाइम वॉइस AI जो आपकी इमोशन पढ़ता है

by needhelp
Voice AI
StepFun
Real-Time
Emotion AI
Speech

वॉइस AI सालों से अनकैनी वैली में फँसा हुआ था — तकनीकी रूप से प्रभावशाली लेकिन इमोशनली फ़्लैट। StepFun का नया StepAudio 2.5 शायद वह मॉडल है जो आखिरकार गैप को पाटता है। यह आपकी आवाज़ में कंपन, मुश्किल शब्द से पहले का ठहराव सुन सकता है, और वास्तविक रूप से उपयुक्त इमोशनल टोन में जवाब दे सकता है।

ट्रांसक्रिप्शन से परे

ज़्यादातर वॉइस मॉडल दो काम करते हैं: स्पीच को टेक्स्ट में ट्रांसक्राइब करना, और टेक्स्ट को वापस स्पीच में बदलना। StepAudio 2.5 एक तीसरा आयाम जोड़ता है: पैरालिंग्विस्टिक अंडरस्टैंडिंग

मॉडल कैप्चर करता है:

  • वॉइस टोन — खुश, उदास, निराश, भ्रमित, उत्साहित
  • स्पीच रिदम — हिचकिचाहट, तेज़ी, कॉन्फ़िडेंस शिफ़्ट
  • इमोशनल वैलेंस — पॉज़िटिव, नेगेटिव, न्यूट्रल
  • नॉन-वर्बल सिग्नल्स — आहें, हँसी, फ़िलर शब्द

एक मिलियन पर्सनाज़, एक API

StepAudio 2.5 की सबसे दिलचस्प बात इसका पर्सना कस्टमाइज़ेशन API है। कुछ प्रीसेट वॉइसेज़ के बजाय, मॉडल आपको नेचुरल लैंग्वेज प्रॉम्प्ट के ज़रिए कस्टम पर्सनैलिटी डिफ़ाइन करने देता है।

References

Share this page