نگاهی به تحقیقات هوش مصنوعی: OpenSeeker-v2 جستجو را مختل کرد، CropVLM به مزارع نگاه میکند و عاملها معیار شدند
OpenSeeker-v2: اختلال با ۱۰,۰۰۰ نمونه
یک تازهوارد جستجو ثابت کرد برای رقابت نیازی به بودجه میلیارد دلاری آموزش نیست. OpenSeeker-v2 صدر جدول جستجو را با استفاده از آموزش SFT روی ۱۰,۰۰۰ نمونه داده فتح کرد—عددی که اجراهای آموزشی تریلیون token شرکتهای بزرگ فناوری را در مقایسه هدرده نشان میدهد. مقاله کامل جزئیات چگونگی دستیابی تیم دانشگاهی به این را شرح میدهد و مدل حالا کاملاً متنباز شده برای استفاده هرکس.
پیامد برای بازماندگان ناراحتکننده است: اگر یک تیم کوچک با ۱۰ هزار نمونه منتخب میتواند از مدلهای آموزشدیده روی دادههای مقیاس وب بهتر عمل کند، میلیاردها دلار compute دقیقاً چه چیزی میخرد؟
CropVLM: هوش مصنوعی به مزرعه میرود
در حالی که بیشتر تحقیقات هوش مصنوعی چتباتها و تولید کد را هدف قرار میدهند، CropVLM به چیزی زمینتر میپردازد: تحلیل محصول. این مدل بر ۳۰+ نوع محصول از طریق همترازی معنایی تسلط یافت و به بیش از ۷۰٪ دقت طبقهبندی دست یافت—عددی که وقتی میخواهی بیماری را در یک مزرعه گندم از تصاویر پهپاد تشخیص دهی مهم است.
چارچوب همراه HOS-Net روی GitHub تشخیص zero-shot انواع محصولی را که مدل به طور صریح روی آنها آموزش ندیده ممکن میکند. تحلیل فنوتیپی خودکار—اندازهگیری ویژگیهای گیاه در مقیاس—به روشی عملی تبدیل شده که با دید کامپیوتری سنتی هرگز نبود.
ClawMark: عاملها بدتر از آن چیزیاند که فکر میکنی
اگر از دموهای عامل تحت تأثیر قرار گرفتهای، ClawMark تو را هوشیار میکند. این معیار که به طور خاص برای مدلهای همکار هوش مصنوعی در سناریوهای دینامیک اداری طراحی شده، ۱۰۰+ وظیفه حرفهای را با امتیازدهی عینی مبتنی بر اسکریپت پوشش میدهد. نتیجه: مدلهای جریان اصلی فقط ۲۰٪ نرخ موفقیت در workflowهای طولانی دارند.
شکاف بین دمو و واقعیت آشکار است. عاملهایی که در یک وظیفه سهمرحلهای شایسته به نظر میرسند وقتی workflow به بیست مرحله با تصمیمات انشعابی کشیده میشود از هم میپاشند. تطبیقپذیری—نه توانایی—تنگناست.
AniMatrix: هنر بر فیزیک
AniMatrix رویکرد عمداً متفاوتی به تولید ویدئو دارد. به جای اعمال شبیهسازی فیزیک صلب، مدل اولویت را به بیان هنری میدهد—نوع حرکت پویا و اغراقآمیزی که انیمیشن را زنده میکند. سیستم AniCaption آن متغیرهای تولید مثل حرکت دوربین، بیان شخصیت و节奏 صحنه را به طور خودکار استخراج میکند. تیم ادعا میکند نمرات حرکت هنری بسیار فراتر از مدلهای قابل مقایسه است و قول داده به زودی وزنها را متنباز کند.
عاملهای خودتوضیح مایکروسافت
تحقیقات مایکروسافت یک چارچوب تفسیرپذیری جدید پیشنهاد کرد که در آن مدلهای عامل به طور خودمختار برای تولید رگرسورهای دقیق قابل خواندن توسط انسان تکرار میشوند. مدلهای کوچک با خواندن نمایشهای رشتهای به جای خرد کردن تنسورها پیشبینیهای دقیق به دست میآورند—رویکردی که به طور چشمگیری از مدلهای آماری سنتی در دهها دیتاست بهتر عمل میکند و صدر جدول BLADE را فتح میکند.

روی هم رفته، این پنج مقاله یک داستان منسجم روایت میکنند: مرز از «مدلهای بزرگتر» به آموزش هوشمندتر، حوزههای تخصصی، ارزیابی صادقانه و خروجیهای قابل تفسیر در حال تغییر است.