OpenAI запускает модель перевода в реальном времени: языковые барьеры рушатся мгновенно
by needhelp
openai
translation
speech-to-speech
api
real-time-ai
Новая эра кросс-языковой коммуникации
7 мая 2026 года OpenAI представил прорывную модель перевода речи в реальном времени. В отличие от предыдущих пайплайнов (ASR → MT → TTS), новая модель выполняет прямой перевод в единой архитектуре, достигая задержки менее 300 миллисекунд.
Результат — почти мгновенный перевод, ощущаемый естественно в диалоге. Модель сохраняет тон, эмоции и просодию.
Как это работает
Архитектура отображает исходные акустические признаки напрямую в целевые акустические признаки через общее мультиязычное латентное пространство.
- Единый encoder-decoder на миллионах часов мультиязычной речи, более 100 языковых пар
- Streaming inference — начинает перевод до завершения предложения
- Сохранение голоса — pitch, тембр, стиль сохраняются
- Контекстный перевод — использует историю диалога
API для разработчиков
curl https://api.openai.com/v1/audio/translations \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -F "audio=@conversation.wav" \ -F "source_language=ja" \ -F "target_language=en" \ -F "mode=streaming" \ -F "voice_preservation=true" \ -o translated_audio.wavРежимы: streaming (реальное время), batch (записи), simultaneous (конференции). WebSocket для двусторонних диалогов.
Влияние на индустрии
- Поддержка клиентов — один агент на всех языках
- Медицина — врач говорит напрямую с пациентом
- Образование — лекции без языкового барьера
- Путешествия — отели, рестораны, навигация без языка