Thinking Machines переопределяет «реальное время» AI — почему 276B параметров меняет все
На этой неделе новая AI-компания Thinking Machines выпустила модель мультимодального взаимодействия на 276B параметров, которую сообщество описывает как «brutal frame mog» — полное переопределение того, что значит «AI-взаимодействие в реальном времени».
Что «реальное время» значит на самом деле
| Тип | Типичная задержка |
|---|---|
| Текст | 0.5–2s |
| Голос | 2–5s end-to-end |
| Мультимодальное | 3–8s |
Проблема архитектурная, не инженерная: синхронная модель запрос-ответ.
Что Thinking Machines сделали иначе
Асинхронная front-back архитектура: front-end (300ms, эмоции, контекст), back-end (276B, глубокое рассуждение). Как System 1 / System 2 в когнитивной науке.
Нативная мультимодальность — общее латентное пространство для аудио, видео, текста.
Бенчмарки сообщества:
- Голос: < 500ms (против 2-5s)
- Эмоции: одновременно с речью
- Мультимодальное: ~1s (против 3-8s)
Почему задержка важна
Разница между 500ms и 3s в голосе — разница между «разговором с человеком» и «разговором с компьютером».
Если Thinking Machines удастся продуктивизировать эту архитектуру в масштабе, это заставит каждую крупную AI-лабораторию перепроектировать стек взаимодействия.