needhelp
← Back to blog

غواصی عمیق در تحقیقات مرزی هوش مصنوعی ۲۰۲۶: از شبیه‌سازی هزاران کارت تا مدل‌های جهان

by needhelp
AI Research
PrismLLM
PhysBrain
Elastic DiT
IVGT

تاریخ: ۲۰۲۶-۰۵-۱۹ | منبع: AI News Daily | زمان مطالعه: ~۱۵ دقیقه

AI Research Banner


۱. PrismLLM: شبیه‌سازی یک کلاستر ۱۰K-GPU با چند کارت

۱.۱ زمینه تحقیق و مسئله

آموزش مدل‌های زبانی بزرگ (LLM) به ده‌ها هزار GPU/TPU نیاز دارد که هماهنگ کار کنند—یک زیرساخت عظیم با هزینه‌های ساخت و عملیاتی گزاف. برای بیشتر مؤسسات تحقیقاتی و شرکت‌های کوچک-متوسط، «کمبود کارت» بزرگترین تنگنا در تحقیقات آموزش مدل‌های بزرگ است.

چارچوب PrismLLM یک فناوری شبیه‌سازی با وفاداری بالا ارائه می‌دهد که هدف اصلی آن را می‌توان با مسئله بهینه‌سازی زیر توصیف کرد:

[ \min_{\theta} \mathcal{L}\left( f_{\text{sim}}(x; \theta), f_{\text{real}}(x) \right) + \lambda \cdot \Omega(\theta) ]

که (f_{\text{sim}}) مدل شبیه‌سازی، (f_{\text{real}}) رفتار یک کلاستر واقعی ۱۰K-GPU و (\Omega(\theta)) عبارت منظم‌سازی است.

۱.۲ اصول فنی اصلی

نوآوری اصلی PrismLLM توانایی شبیه‌سازی رفتار آموزشی یک کلاستر عظیم با تنها چند GPU است، با خطای بسیار کم (زیر ۱٪).

graph TD
    A["کلاستر واقعی ۱۰K-GPU"] --> B["ماژول جمع‌آوری رفتار"]
    B --> C["تحلیل الگوی ارتباط"]
    B --> D["مدل‌سازی ویژگی محاسبات"]
    B --> E["ردیابی دسترسی حافظه"]
    C --> F["موتور شبیه‌سازی با وفاداری بالا"]
    D --> F
    E --> F
    F --> G["سخت‌افزار مقیاس کوچک"]
    G --> H["پیش‌بینی رفتار آموزشی"]
    H --> I["بهینه‌سازی فراپارامتر"]
    H --> J["پیش‌بینی خطا"]
    H --> K["تخمین هزینه"]

۱.۳ ویژگی‌های فنی کلیدی

ویژگی توضیحات مزیت
خطای شبیه‌سازی < ۱٪ انحراف از نتایج آموزش کلاستر واقعی ۱۰K-GPU در ۱٪ نگه داشته می‌شود دقت پیش‌بینی بسیار بالا
شبیه‌سازی توپولوژی ارتباط الگوهای ارتباط جمعی مثل all-reduce، all-gather را دقیقاً شبیه‌سازی می‌کند بدون نیاز به محیط شبکه واقعی
استراتژی موازی ترکیبی شبیه‌سازی ترکیبی از داده‌موازی، مدل‌موازی و خط‌لوله‌موازی را پشتیبانی می‌کند پوشش طرح‌های آموزشی主流
مدل‌سازی بار پویا عوامل پویا مثل نوسان استفاده GPU، فشار حافظه را در نظر می‌گیرد نزدیک‌تر به سناریوهای واقعی

۱.۴ سناریوهای کاربرد

[ \text{کاهش هزینه تحقیقاتی} = \frac{C_{\text{real}} - C_{\text{sim}}}{C_{\text{real}}} \times 100% \approx 95% ]

  • جستجوی فراپارامتر: پیش‌غربال‌گری پیکربندی‌های بهینه روی سخت‌افزار مقیاس کوچک
  • پیش‌بینی خطا: شناسایی زودهنگام مشکلات بالقوه در آموزش توزیع‌شده
  • تخمین هزینه: برآورد دقیق نیازمندی‌های منابع برای مقیاس‌های مختلف آموزش

۲. PhysBrain: یادگیری فیزیک از ویدئو

۲.۱ مفهوم اصلی

PhysBrain یک مدل پایه عقل سلیم فیزیکی است که قوانین جهان فیزیکی (مثل گرانش، برخورد، اصطکاک و…) را با تماشای ویدئو یاد می‌گیرد و به این ترتیب قابلیت‌های کنترل ربات را به طور قابل توجهی بهبود می‌بخشد.

[ \hat{a}t = \arg\max_a P(a | s_t, \mathcal{K}{\text{physics}}) ]

که (\mathcal{K}_{\text{physics}}) پایگاه دانش عقل سلیم فیزیکی است که مدل از ویدئو یاد گرفته.

۲.۲ معماری مدل

graph LR
    subgraph ورودی ویدئو
        V1["دنباله فریم‌های ویدئو"]
    end
    subgraph هسته PhysBrain
        V1 --> E["رمزگذار بصری"]
        E --> P["ماژول استدلال فیزیکی"]
        P --> D["پیش‌بین دینامیک"]
    end
    subgraph خروجی
        D --> O1["قوانین فیزیکی"]
        D --> O2["ویژگی‌های اشیاء"]
        D --> O3["استراتژی کنترل"]
    end
    O3 --> R["اجرای ربات"]

۲.۳ ماتریس قابلیت‌های کلیدی

[ \mathbf{قابلیت} = \begin{bmatrix} \text{ادراک گرانش} & \text{پیش‌بینی برخورد} & \text{مدل‌سازی اصطکاک} \ \text{دینامیک سیالات} & \text{حرکت جسم صلب} & \text{ویژگی مواد} \ \text{روابط علّی} & \text{انتقال وضعیت} & \text{تعامل با محیط} \end{bmatrix} ]

۲.۴ عملکرد در معیارهای هوش تجسم‌یافته

pie title حوزه‌های قهرمانی PhysBrain در تست هوش تجسم‌یافته
    "گرفتن اشیاء" : 25
    "عملیات کشیدن و هل دادن" : 20
    "پیش‌بینی پرتاب" : 18
    "پایداری روی هم چیدن" : 15
    "استفاده از ابزار" : 12
    "ناوبری و مانع‌یابی" : 10

محیط‌های تست:

پلتفرم نوع وظیفه رتبه PhysBrain
SAPIEN دستکاری اشیاء مفصلی
MuJoCo کنترل پیوسته
Habitat ناوبری بصری
Isaac Sim مونتاژ صنعتی

Robotics Vision


۳. Elastic DiT: پیشرفت جدید در تولید تصویر real-time روی موبایل

۳.۱ تعریف مسئله

مدل‌های Diffusion سنتی (مثل Flux، Stable Diffusion) با یک trade-off شدید کیفیت در مقابل تأخیر روی دستگاه‌های موبایل مواجه‌اند:

[ \text{کیفیت} \propto \frac{1}{\text{تأخیر} \times \text{محاسبات}} ]

Elastic DiT (Elastic Diffusion Transformer) این محدودیت را از طریق تنظیم پویای پارامتر می‌شکند.

۳.۲ مکانیزم زمان‌بندی پویای پارامتر

graph TD
    subgraph لایه ورودی
        U["درخواست کاربر"]
        D["اطلاعات دستگاه"]
        Q["ترجیح کیفیت"]
    end
    subgraph زمان‌بند الاستیک
        U --> S["زمان‌بند الاستیک"]
        D --> S
        Q --> S
        S --> C1["پیکربندی A: حالت فوق‌سریع
تأخیر < 50ms"] S --> C2["پیکربندی B: حالت متعادل
تأخیر 200-500ms"] S --> C3["پیکربندی C: حالت کیفیت
تأخیر 1-2s"] end subgraph هسته DiT C1 --> M["عمق پویا"] C2 --> M C3 --> M M --> N["عرض پویا"] N --> A["توجه تنک"] end A --> O["تصویر تولیدشده"]

۳.۳ فرمول‌بندی ریاضی

عبور رو به جلوی Elastic DiT به صورت زیر بیان می‌شود:

[ \mathbf{x}_{t-1} = \alpha_t \mathbf{x}_t + \sigma_t \cdot \mathcal{E}(\mathbf{x}_t, t, c; \theta(d, w)) ]

که پارامترهای زمان‌بندی ((d, w)) به صورت پویا توسط شرایط دستگاه و نیازمندی‌های کیفیت تعیین می‌شوند:

[ (d^, w^) = \arg\min_{d,w} \mathcal{L}(\theta(d,w)) + \mu \cdot T(d,w, \text{device}) ]

۳.۴ مقایسه عملکرد

مدل دستگاه تأخیر FID وضوح
Flux-dev RTX 4090 ۲.۱s ۵.۲ ۱۰۲۴x۱۰۲۴
SDXL RTX 4090 ۳.۵s ۶.۱ ۱۰۲۴x۱۰۲۴
Elastic DiT (سرعت) iPhone 16 < ۵۰ms ۶.۸ ۵۱۲x۵۱۲
Elastic DiT (متعادل) iPhone 16 ۳۰۰ms ۵.۰ ۱۰۲۴x۱۰۲۴
Elastic DiT (کیفیت) iPhone 16 ۱.۲s ۴.۳ ۱۰۲۴x۱۰۲۴

حالت سرعت به کیفیت تصویر فراتر از مدل‌های Flux روی موبایل می‌رسد!

Mobile AI


۴. IVGT: چارچوب بازسازی سه‌بعدی ضمنی

۴.۱ نمای کلی فنی

IVGT (Implicit Volume Geometry Transformer) یک چارچوب نوآورانه بازسازی سه‌بعدی ضمنی است که می‌تواند به طور خودکار هندسه سه‌بعدی پیوسته را از تصاویر معمولی ۲D بسازد و به رندرینگ با دقت بالا دست یابد.

۴.۲ خط لوله فنی

sequenceDiagram
    participant U as ورودی کاربر
    participant E as رمزگذار تصویر
    participant F as استخراج ویژگی
    participant I as ساخت میدان ضمنی
    participant M as تولید مش
    participant R as خروجی رندر

    U->>E: تصویر چندنمایی/تک‌تصویری
    E->>F: نقشه ویژگی عمیق
    F->>I: NeRF/میدان SDF ضمنی
    I->>I: بهینه‌سازی رندر حجمی
    I->>M: استخراج Marching Cubes
    M->>R: مش مثلثی + متریال PBR
    R->>U: مدل سه‌بعدی تعاملی

۴.۳ نمایش ضمنی

IVGT از یک تابع فاصله علامت‌دار ضمنی (SDF) برای نمایش هندسه سه‌بعدی استفاده می‌کند:

[ f(\mathbf{x}; \theta): \mathbb{R}^3 \rightarrow \mathbb{R} ]

که:

  • (f(\mathbf{x}) = 0) سطح جسم را نشان می‌دهد
  • (f(\mathbf{x}) > 0) خارج از جسم را نشان می‌دهد
  • (f(\mathbf{x}) < 0) داخل جسم را نشان می‌دهد

میدان ضمنی از طریق معادله رندر حجمی به تصویر تبدیل می‌شود:

[ \hat{C}(\mathbf{r}) = \int_{t_n}^{t_f} T(t) \cdot \sigma(\mathbf{r}(t)) \cdot \mathbf{c}(\mathbf{r}(t), \mathbf{d}) , dt ]

که transmittance:

[ T(t) = \exp\left( -\int_{t_n}^{t} \sigma(\mathbf{r}(s)) , ds \right) ]

۴.۴ عملکرد در وظایف بازسازی مش

روش Chamfer-L1 ↓ F-Score ↑ زمان آموزش نیازمندی ورودی
NeRF ۰.۰۸۵ ۰.۷۲ ۱۲h چندنمایی
NeuS ۰.۰۶۲ ۰.۸۱ ۸h چندنمایی
VolSDF ۰.۰۵۸ ۰.۸۴ ۱۰h چندنمایی
IVGT ۰.۰۳۱ ۰.۹۳ ۲h تک/چندنمایی

۵. مقایسه جامع و چشم‌انداز آینده

۵.۱ نمای کلی مقایسه چهار فناوری

graph LR
    subgraph لایه تحقیقاتی
        P["PrismLLM
شبیه‌سازی آموزش"] Ph["PhysBrain
درک فیزیک"] end subgraph لایه کاربردی D["Elastic DiT
تولید تصویر موبایل"] I["IVGT
بازسازی سه‌بعدی"] end subgraph هدف مشترک P --> G["کاهش门槛 هوش مصنوعی"] Ph --> G D --> G I --> G end G --> F["فناوری هوش مصنوعی همگانی"]

۵.۲ تحلیل کمی روندها

xychart-beta
    title "روند热度 تحقیقات فناوری هوش مصنوعی (۲۰۲۴-۲۰۲۶)"
    x-axis ["۲۰۲۴ Q1", "۲۰۲۴ Q3", "۲۰۲۵ Q1", "۲۰۲۵ Q3", "۲۰۲۶ Q1", "۲۰۲۶ Q2"]
    y-axis "تعداد مقالات (تخمینی)" 0 --> 500
    line "شبیه‌سازی آموزش توزیع‌شده" [20, 45, 80, 120, 180, 250]
    line "یادگیری عقل سلیم فیزیکی" [10, 25, 60, 100, 160, 220]
    line "استنتاج کارآمد روی دستگاه" [50, 100, 180, 280, 380, 480]
    line "بازسازی سه‌بعدی ضمنی" [30, 60, 90, 140, 200, 280]

۵.۳ خلاصه فرمول‌های کلیدی

تکنیک فرمول اصلی هدف
PrismLLM (\min \mathcal{L}(f_{\text{sim}}, f_{\text{real}}) + \lambda\Omega) شبیه‌سازی رفتار آموزش
PhysBrain (\hat{a}_t = \arg\max P(a | s_t, \mathcal{K})) تصمیم‌گیری آگاه از فیزیک
Elastic DiT (\mathbf{x}_{t-1} = \alpha_t \mathbf{x}_t + \sigma_t \mathcal{E}(\cdot; \theta(d,w))) استنتاج پویا
IVGT (\hat{C}(\mathbf{r}) = \int T(t)\sigma(\mathbf{r}(t))\mathbf{c}(\cdot),dt) رندر حجمی

۵.۴ چشم‌انداز آینده

PrismLLM هزینه تحقیق آموزش مدل‌های بزرگ را ۹۵٪ یا بیشتر کاهش می‌دهد و academia را قادر به مشارکت در تحقیقات مدل‌های پیشرفته می‌کند.

PhysBrain راه را برای ربات‌های همه‌منظوره هموار می‌کند—ربات‌های خانگی واقعاً «بامعرفت» ظرف ۳-۵ سال انتظار می‌روند.

Elastic DiT نشان‌دهنده رسیدن تولید تصویر هوش مصنوعی عملی روی موبایل است—ایجاد real-time با هوش مصنوعی روی گوشی به استاندارد تبدیل می‌شود.

قابلیت بازسازی سه‌بعدی تک‌تصویری IVGT workflowهای توسعه بازی و AR/VR را متحول خواهد کرد.


References

مقالات

منابع ویدئویی

پروژه‌های متن‌باز


این سند توسط AI News Daily در ۲۰۲۶/۵/۱۹ گردآوری شده و به طور مداوم تحولات تحقیقات مرزی هوش مصنوعی را دنبال می‌کند.

Share this page