needhelp
← Back to blog

StepAudio 2.5: هوش مصنوعی صدای real-time که احساسات شما را می‌خواند

by needhelp
Voice AI
StepFun
Real-Time
Emotion AI
Speech

StepAudio 2.5 Emotion Voice

هوش مصنوعی صدا سال‌ها در دره وهم‌انگیز گیر کرده بود—از نظر فنی چشمگیر اما از نظر احساسی تخت. StepAudio 2.5 که توسط StepFun منتشر شده ممکن است مدلی باشد که بالاخره شکاف را پر می‌کند. می‌تواند به لرزش صدایت گوش دهد، به مکث قبل از یک کلمه سخت گوش دهد و با لحن احساسی واقعاً مناسب پاسخ دهد.

فراتر از رونویسی

بیشتر مدل‌های صدا دو کار انجام می‌دهند: رونویسی گفتار به متن و تبدیل متن به گفتار. StepAudio 2.5 یک بعد سوم اضافه می‌کند: درک فرازبانی.

مدل ثبت می‌کند:

  • لحن صدا — شاد، غمگین، ناامید، سردرگم، هیجان‌زده
  • ریتم گفتار — تردیدها، شتاب‌ها، تغییرات اطمینان
  • ارزش احساسی — مثبت، منفی، خنثی با شدت دانه‌بندی‌شده
  • سیگنال‌های غیرکلامی — آه، خنده، کلمات پرکننده

یک میلیون شخصیت، یک API

persona = stepaudio.create_persona(
tone="گرم و صبور",
pace="متعادل، برای سوالات مکث می‌کند",
emotion="تشویق‌کننده، پیروزی‌های کوچک را جشن می‌گیرد",
role="معلم ریاضی برای دانش‌آموزان متوسطه"
)

StepFun ادعا می‌کند توسعه‌دهندگان می‌توانند با ترکیب پارامترهای لحن، سرعت، احساس و نقش، «میلیون‌ها شخصیت صدای منحصربه‌فرد» تولید کنند.

Share this page