Дорожная карта Карпати: эволюция AI-вывода от текста к нейронному видео
Andrej Karpathy опубликовал тред на 13K лайков с конкретной дорожной картой эволюции AI-человеческого взаимодействия. Теза: аудио — предпочтительный ввод для человека, но зрение — предпочтительный вывод. Треть коры мозга посвящена визуальной обработке.
Пять (или N) стадий AI-вывода
Стадия 1: сырой текст
«Трудно и утомительно читать.» Эпоха GPT-2.
Стадия 2: Markdown ← текущий дефолт
Жирный, курсив, заголовки, таблицы. «Немного легче для глаз.» Большинство LLM — ChatGPT, Claude, Gemini.
Стадия 3: HTML ← ранняя, но формируется
Karpathy рекомендует просить LLM «оформить ответ как HTML». Слайд-шоу, интерактивные дашборды.
Стадия 4: интерактивное нейронное видео
«Интерактивные видео, генерируемые напрямую диффузионной нейросетью» — не видеофайл, а рендер в реальном времени.
Стадия N: полный mind-meld
Интерфейс мозг-компьютер в стиле Neuralink. Далеко, но огромный прогресс возможен до этого.
Почему это важно
Асимметрия: аудио как ввод (быстро, естественно), визуал как вывод (10-полосное шоссе в мозг). AI сейчас общается текстом — как через приоткрытую дверь. HTML — шаг к тому, чтобы распахнуть ее.
Выводы для разработчиков: просите LLM оформлять ответы как HTML. Экспериментируйте с интерактивными дашбордами. Следующий рубеж — генеративный видео-вывод в реальном времени.