needhelp
← Back to blog

DeepSeek V4 روی Huawei Ascend: راهنمای عملی اجرای هوش مصنوعی frontier روی سخت‌افزار داخلی

by needhelp
deepseek
huawei-ascend
ai-deployment
domestic-ai

انتشار پیش‌نمایش DeepSeek V4 یک تغییر قابل توجه در چشم‌انداز سخت‌افزار هوش مصنوعی را نشان می‌دهد. برای اولین بار، یک مدل سطح frontier از NPUهای Huawei Ascend پشتیبانی درجه یک دارد—یعنی می‌توانی استنتاج رقابتی هوش مصنوعی را بدون حتی یک GPU NVIDIA اجرا کنی.

این برای توسعه‌دهندگان چینی، مؤسسات تحقیقاتی و شرکت‌هایی که توسط در دسترس بودن GPU محدود شده‌اند یک معامله بزرگ است.

چشم‌انداز سخت‌افزار

مشخصه Ascend 910B NVIDIA A100
Compute (FP16) ۳۲۰ TFLOPS ۳۱۲ TFLOPS
حافظه ۶۴GB HBM2e ۸۰GB HBM2e
پهنای باند حافظه ۱.۵ TB/s ۲.۰ TB/s
اتصال HCCS 56GB/s NVLink 600GB/s
TDP ۳۱۰W ۴۰۰W
در دسترس بودن بالا (داخلی) محدود*

*محدودیت‌های صادرات NVIDIA به برخی بازارها

بررسی اجمالی معماری

DeepSeek V4 روی Ascend — استک استقرار

  • لایه مشتری (Chat UI / API Client / curl) → HTTP/WebSocket
  • لایه سرویس‌دهی (vLLM-Ascend / TGI-Ascend)
  • استک CANN (ACL + GE + Runtime Driver)
  • سخت‌افزار (Ascend 910B / 910 Pro)

راهنمای استقرار

پیش‌نیازها

Terminal window
- OS: Ubuntu 22.04 / EulerOS
- Kernel: 5.10+
- NPU: Ascend 910B (حداقل ۱ کارت)
- حافظه: ۶۴GB+ RAM سیستم
- دیسک: ۲۰۰GB+ فضای خالی

گام ۱: نصب CANN Toolkit

Terminal window
chmod +x Ascend-cann-toolkit_*.run
./Ascend-cann-toolkit_*.run --install --quiet
npu-smi info

گام ۲: راه‌اندازی محیط Docker

Terminal window
docker pull deepseek-ai/deepseek-v4-ascend:latest
docker run --rm -it \
--device=/dev/davinci0 \
--device=/dev/davinci_manager \
--device=/dev/hisi_hdc \
-v /usr/local/Ascend:/usr/local/Ascend \
-p 8000:8000 \
deepseek-ai/deepseek-v4-ascend:latest

گام ۳: شروع سرور استنتاج

Terminal window
python -m vllm.entrypoints.openai.api_server \
--model /models/deepseek-v4-preview \
--trust-remote-code \
--dtype bfloat16 \
--max-model-len 4096 \
--gpu-memory-utilization 0.9

گام ۴: تست

Terminal window
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-preview",
"messages": [{"role": "user", "content": "سلام، چه کاری می‌توانی انجام دهی؟"}]
}'

مشاهدات عملکرد

مدل سخت‌افزار Token/s حافظه نکات
V4 Preview (۷B) ۱× Ascend 910B ~۴۵ t/s ۱۴GB سریع، در یک کارت جا می‌شود
V4 Preview (۱۴B) ۱× Ascend 910B ~۲۲ t/s ۲۸GB قابل استفاده برای تولید
V4 Preview (۷۰B) ۴× Ascend 910B ~۱۵ t/s ۶۳GB نیاز به کوانتیزاسیون دارد

شش نکته برای توسعه‌دهندگان

۱. از vLLM-Ascend استفاده کن، نه CANN خام ۲. Flash Attention را فعال کن (--enable-flash-attn) برای ۱.۵-۲ برابر افزایش سرعت ۳. مراقب اندازه batch باش—پهنای باند حافظه تنگناست ۴. از BF16 استفاده کن، نه INT8 ۵. CANN را مرتباً به‌روزرسانی کن—هر انتشار پیشرفت‌های قابل توجهی دارد ۶. به جامعه بپیوند—جامعه Ascend AI روی GitHub فعال است


References

Share this page