StepAudio 2.5: голосовой AI в реальном времени, читающий эмоции
by needhelp
Voice AI
StepFun
Real-Time
Emotion AI
Speech
Голосовой AI годами застревал в зловещей долине — технически впечатляюще, но эмоционально плоско. StepAudio 2.5 — возможно, модель, которая наконец перекинет мост. Она слышит дрожь в голосе, паузу перед трудным словом и отвечает с подлинно уместным эмоциональным тоном.
За пределами транскрипции
Большинство голосовых моделей делают две вещи: транскрибируют речь и синтезируют обратно. StepAudio 2.5 добавляет третье измерение: паралингвистическое понимание.
Модель улавливает:
- Тон голоса — радость, грусть, фрустрация, удивление, волнение
- Ритм речи — колебания, ускорения, сдвиги уверенности
- Эмоциональная валентность — позитив, негатив, нейтрал с гранулярной интенсивностью
- Невербальные сигналы — вздохи, смех, слова-паразиты
Миллион персонажей, один API
persona = stepaudio.create_persona( tone="теплый и терпеливый", pace="умеренный, паузы для вопросов", emotion="ободряющий, празднует маленькие победы", role="репетитор математики для средней школы")StepFun утверждает, что разработчики могут создавать «миллионы уникальных голосовых персон», комбинируя параметры тона, темпа, эмоций и роли.
Реальные применения
- Психическое здоровье — AI-компаньоны, обнаруживающие дистресс в голосе
- Образование — репетиторы, меняющие тон по уровню понимания
- Тренировка собеседований — реалистичные интервью с эмоциональной обратной связью
- Доступность — естественные голосовые интерфейсы для людей с нарушениями речи
StepAudio 2.5 обошла всех конкурентов в бенчмарках выразительности и эмоциональной точности.