نقشه راه کارپاتی: چطور خروجی هوش مصنوعی از متن به ویدئوی عصبی تکامل مییابد
Andrej Karpathy، مدیر سابق هوش مصنوعی در تسلا و عضو بنیانگذار OpenAI، این هفته یک تاپلت ۱۳ هزار لایکی منتشر کرد که نقشه راه به طور شگفتآوری ملموسی برای تکامل تعامل انسان-هوش مصنوعی ترسیم میکند. این درباره مدلهای بزرگتر یا زمینههای طولانیتر نیست—درباره چگونگی ارتباط هوش مصنوعی با ماست.
تز او: صدا ورودی ترجیحی انسان به هوش مصنوعی است، اما vision خروجی ترجیحی است. حدود یک سوم کورتکس مغز ما به پردازش بصری اختصاص دارد—یک «بزرگراه ۱۰ بانده اطلاعات به مغز.» سمت خروجی جایی است که تحول واقعی در حال رخ دادن است.
پنج (یا شش، یا N) مرحله خروجی هوش مصنوعی
مرحله ۱: متن خام
«خواندنش سخت و پرزحمت است.» این خروجی عصر GPT-2 است—دیوارهایی از متن بدون قالببندی.
مرحله ۲: Markdown ← پیشفرض فعلی
پررنگ، مورب، سرصفحه، جدول. این جایی است که بیشتر رابطهای LLM امروز نشستهاند.
مرحله ۳: HTML ← در حال شکلگیری
کارپاتی توصیه میکند از LLM خود بخواهید «پاسخ را به عنوان HTML ساختاردهی کند.» او با درخواست اسلایدشو و داشبورد تعاملی موفق بوده.
مرحله ۴: ویدئوهای عصبی تعاملی
کارپاتی «ویدئوهای تعاملی تولیدشده مستقیم توسط یک شبکه عصبی diffusion» را تصور میکند—تجربه بصری رندر شده real-time که به تعامل کاربر پاسخ میدهد.
مرحله N: ادغام کامل ذهن
رابط مغز-کامپیوتر به سبک Neuralink.