StepAudio 2.5: هوش مصنوعی صدای real-time که احساسات شما را میخواند
by needhelp
Voice AI
StepFun
Real-Time
Emotion AI
Speech
هوش مصنوعی صدا سالها در دره وهمانگیز گیر کرده بود—از نظر فنی چشمگیر اما از نظر احساسی تخت. StepAudio 2.5 که توسط StepFun منتشر شده ممکن است مدلی باشد که بالاخره شکاف را پر میکند. میتواند به لرزش صدایت گوش دهد، به مکث قبل از یک کلمه سخت گوش دهد و با لحن احساسی واقعاً مناسب پاسخ دهد.
فراتر از رونویسی
بیشتر مدلهای صدا دو کار انجام میدهند: رونویسی گفتار به متن و تبدیل متن به گفتار. StepAudio 2.5 یک بعد سوم اضافه میکند: درک فرازبانی.
مدل ثبت میکند:
- لحن صدا — شاد، غمگین، ناامید، سردرگم، هیجانزده
- ریتم گفتار — تردیدها، شتابها، تغییرات اطمینان
- ارزش احساسی — مثبت، منفی، خنثی با شدت دانهبندیشده
- سیگنالهای غیرکلامی — آه، خنده، کلمات پرکننده
یک میلیون شخصیت، یک API
persona = stepaudio.create_persona( tone="گرم و صبور", pace="متعادل، برای سوالات مکث میکند", emotion="تشویقکننده، پیروزیهای کوچک را جشن میگیرد", role="معلم ریاضی برای دانشآموزان متوسطه")StepFun ادعا میکند توسعهدهندگان میتوانند با ترکیب پارامترهای لحن، سرعت، احساس و نقش، «میلیونها شخصیت صدای منحصربهفرد» تولید کنند.