needhelp
← Back to blog

OpenAI запускает модель перевода в реальном времени: языковые барьеры рушатся мгновенно

by needhelp
openai
translation
speech-to-speech
api
real-time-ai

Новая эра кросс-языковой коммуникации

7 мая 2026 года OpenAI представил прорывную модель перевода речи в реальном времени. В отличие от предыдущих пайплайнов (ASR → MT → TTS), новая модель выполняет прямой перевод в единой архитектуре, достигая задержки менее 300 миллисекунд.

Результат — почти мгновенный перевод, ощущаемый естественно в диалоге. Модель сохраняет тон, эмоции и просодию.

Как это работает

Архитектура отображает исходные акустические признаки напрямую в целевые акустические признаки через общее мультиязычное латентное пространство.

  • Единый encoder-decoder на миллионах часов мультиязычной речи, более 100 языковых пар
  • Streaming inference — начинает перевод до завершения предложения
  • Сохранение голоса — pitch, тембр, стиль сохраняются
  • Контекстный перевод — использует историю диалога

API для разработчиков

Terminal window
curl https://api.openai.com/v1/audio/translations \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-F "audio=@conversation.wav" \
-F "source_language=ja" \
-F "target_language=en" \
-F "mode=streaming" \
-F "voice_preservation=true" \
-o translated_audio.wav

Режимы: streaming (реальное время), batch (записи), simultaneous (конференции). WebSocket для двусторонних диалогов.

Влияние на индустрии

  • Поддержка клиентов — один агент на всех языках
  • Медицина — врач говорит напрямую с пациентом
  • Образование — лекции без языкового барьера
  • Путешествия — отели, рестораны, навигация без языка

References

Share this page