needhelp
← Back to blog

نگاهی به تحقیقات هوش مصنوعی: OpenSeeker-v2 جستجو را مختل کرد، CropVLM به مزارع نگاه می‌کند و عامل‌ها معیار شدند

by needhelp
ai-research
openseeker
cropvlm
clawmark
animatrix
microsoft
agent

OpenSeeker-v2: اختلال با ۱۰,۰۰۰ نمونه

یک تازه‌وارد جستجو ثابت کرد برای رقابت نیازی به بودجه میلیارد دلاری آموزش نیست. OpenSeeker-v2 صدر جدول جستجو را با استفاده از آموزش SFT روی ۱۰,۰۰۰ نمونه داده فتح کرد—عددی که اجراهای آموزشی تریلیون token شرکت‌های بزرگ فناوری را در مقایسه هدر‌ده نشان می‌دهد. مقاله کامل جزئیات چگونگی دستیابی تیم دانشگاهی به این را شرح می‌دهد و مدل حالا کاملاً متن‌باز شده برای استفاده هرکس.

پیامد برای بازماندگان ناراحت‌کننده است: اگر یک تیم کوچک با ۱۰ هزار نمونه منتخب می‌تواند از مدل‌های آموزش‌دیده روی داده‌های مقیاس وب بهتر عمل کند، میلیاردها دلار compute دقیقاً چه چیزی می‌خرد؟

CropVLM: هوش مصنوعی به مزرعه می‌رود

در حالی که بیشتر تحقیقات هوش مصنوعی چت‌بات‌ها و تولید کد را هدف قرار می‌دهند، CropVLM به چیزی زمین‌تر می‌پردازد: تحلیل محصول. این مدل بر ۳۰+ نوع محصول از طریق هم‌ترازی معنایی تسلط یافت و به بیش از ۷۰٪ دقت طبقه‌بندی دست یافت—عددی که وقتی می‌خواهی بیماری را در یک مزرعه گندم از تصاویر پهپاد تشخیص دهی مهم است.

چارچوب همراه HOS-Net روی GitHub تشخیص zero-shot انواع محصولی را که مدل به طور صریح روی آنها آموزش ندیده ممکن می‌کند. تحلیل فنوتیپی خودکار—اندازه‌گیری ویژگی‌های گیاه در مقیاس—به روشی عملی تبدیل شده که با دید کامپیوتری سنتی هرگز نبود.

ClawMark: عامل‌ها بدتر از آن چیزی‌اند که فکر می‌کنی

اگر از دموهای عامل تحت تأثیر قرار گرفته‌ای، ClawMark تو را هوشیار می‌کند. این معیار که به طور خاص برای مدل‌های همکار هوش مصنوعی در سناریوهای دینامیک اداری طراحی شده، ۱۰۰+ وظیفه حرفه‌ای را با امتیازدهی عینی مبتنی بر اسکریپت پوشش می‌دهد. نتیجه: مدل‌های جریان اصلی فقط ۲۰٪ نرخ موفقیت در workflowهای طولانی دارند.

شکاف بین دمو و واقعیت آشکار است. عامل‌هایی که در یک وظیفه سه‌مرحله‌ای شایسته به نظر می‌رسند وقتی workflow به بیست مرحله با تصمیمات انشعابی کشیده می‌شود از هم می‌پاشند. تطبیق‌پذیری—نه توانایی—تنگناست.

AniMatrix: هنر بر فیزیک

AniMatrix رویکرد عمداً متفاوتی به تولید ویدئو دارد. به جای اعمال شبیه‌سازی فیزیک صلب، مدل اولویت را به بیان هنری می‌دهد—نوع حرکت پویا و اغراق‌آمیزی که انیمیشن را زنده می‌کند. سیستم AniCaption آن متغیرهای تولید مثل حرکت دوربین، بیان شخصیت و节奏 صحنه را به طور خودکار استخراج می‌کند. تیم ادعا می‌کند نمرات حرکت هنری بسیار فراتر از مدل‌های قابل مقایسه است و قول داده به زودی وزن‌ها را متن‌باز کند.

عامل‌های خودتوضیح مایکروسافت

تحقیقات مایکروسافت یک چارچوب تفسیرپذیری جدید پیشنهاد کرد که در آن مدل‌های عامل به طور خودمختار برای تولید رگرسورهای دقیق قابل خواندن توسط انسان تکرار می‌شوند. مدل‌های کوچک با خواندن نمایش‌های رشته‌ای به جای خرد کردن تنسورها پیش‌بینی‌های دقیق به دست می‌آورند—رویکردی که به طور چشمگیری از مدل‌های آماری سنتی در ده‌ها دیتاست بهتر عمل می‌کند و صدر جدول BLADE را فتح می‌کند.

Microsoft Agentic-imodels Automated Research Architecture


روی هم رفته، این پنج مقاله یک داستان منسجم روایت می‌کنند: مرز از «مدل‌های بزرگ‌تر» به آموزش هوشمندتر، حوزه‌های تخصصی، ارزیابی صادقانه و خروجی‌های قابل تفسیر در حال تغییر است.

Share this page