needhelp
← Back to blog

تراشه‌های هوش مصنوعی لبه تا ۲۰۲۸ جریان اصلی می‌شوند: چه معنایی برای توسعه‌دهندگان وب دارد

by needhelp
edge-ai
webgpu
webnn
on-device-ai
frontend

در آوریل ۲۰۲۶، OpenAI یک مشارکت استراتژیک با Qualcomm برای بهینه‌سازی مدل‌های نسل بعدی برای استنتاج روی دستگاه اعلام کرد. این همراه با استانداردهای به سرعت در حال بلوغ WebGPU و WebNN، تصویر واضحی را ترسیم می‌کند: تا ۲۰۲۸، اجرای هوش مصنوعی frontier روی گوشی تو هنجار خواهد بود، نه استثنا.

برای توسعه‌دهندگان وب، این همه چیز را تغییر می‌دهد.

تکامل استک هوش مصنوعی مرورگر

نقطه عطف کلیدی NPU (واحد پردازش عصبی) است. در حالی که GPUها برای آموزش عالی‌اند، NPUها به طور خاص برای استنتاج ساخته شده‌اند—از نظر سرعت و مصرف انرژی به طور چشمگیری کارآمدتر.

WebGPU و WebNN امروز

WebGPU در Chrome، Edge، Firefox و Safari منتشر شده. به برنامه‌های وب دسترسی مستقیم به compute GPU می‌دهد:

const adapter = await navigator.gpu.requestAdapter();
const device = await adapter.requestDevice();
import { CreateMLCEngine } from "@mlc-ai/web-llm";
const engine = await CreateMLCEngine("Llama-3.2-3B-q4f16");
const reply = await engine.chat.completions.create({
messages: [{ role: "user", content: "سلام!" }]
});

چه چیزی تغییر می‌کند وقتی گوشی‌ها مدل‌های ۱۰۰B+ اجرا می‌کنند

جنبه هوش مصنوعی ابری (۲۰۲۴) هوش مصنوعی روی دستگاه (۲۰۲۸)
تأخیر ۵۰۰ms-۲s ۱۰-۵۰ms
حریم خصوصی داده دستگاه را ترک می‌کند همه چیز روی دستگاه می‌ماند
قابلیت آفلاین هیچ پشتیبانی کامل آفلاین
هزینه هر پرسش ~$۰.۰۱-۰.۱۰ ~$۰ (قبلاً پرداخت شده)

توسعه‌دهندگان فرانت‌اند چه چیزی باید آماده کنند

۱. مفاهیم WebGPU را یاد بگیر

نیازی به برنامه‌نویس گرافیک نیستی، اما درک compute shaderها و مدیریت حافظه GPU ارزشمند خواهد بود.

۲. کوانتیزاسیون را بفهم

مدل‌های روی دستگاه از کوانتیزاسیون (INT4/INT8) برای جا شدن در حافظه استفاده می‌کنند. درک trade-off دقت/اندازه به تو کمک می‌کند مدل مناسب را برای مورد استفاده‌ات انتخاب کنی.

۳. با WebLLM و Transformers.js آزمایش کن

Terminal window
npm install @mlc-ai/web-llm @xenova/transformers

۴. برای هوش مصنوعی آفلاین-اول طراحی کن

ویژگی قاتل هوش مصنوعی روی دستگاه قابلیت آفلاین است. به اینها فکر کن:

  • معماری همگام‌سازی — مدل‌ها وقتی متصل می‌شوند به‌روز می‌شوند، استنتاج آفلاین کار می‌کند
  • بهبود تدریجی — از دستگاه برای وظایف حساس به تأخیر استفاده کن، ابر برای سنگین‌ها
  • حریم خصوصی-در-طراحی — داده‌های حساس را به طور پیش‌فرض محلی پردازش کن

۵. چشم‌انداز API NPU را دنبال کن


References

Share this page