DeepSeek V4 на Huawei Ascend: практическое руководство по запуску frontier AI на отечественном железе
by needhelp
deepseek
huawei-ascend
ai-deployment
domestic-ai
Релиз DeepSeek V4 preview знаменует сдвиг: frontier-модель с первоклассной поддержкой Ascend NPU от Huawei. Впервые конкурентный AI-инференс без единого NVIDIA GPU.
Спецификации
| Спецификация | Ascend 910B | NVIDIA A100 |
|---|---|---|
| Compute FP16 | 320 TFLOPS | 312 TFLOPS |
| Память | 64GB HBM2e | 80GB HBM2e |
| Bandwidth | 1.5 TB/s | 2.0 TB/s |
| Доступность | Высокая | Ограничена* |
Сырая производительность сравнима. Разрыв в памяти и интерконнектах сокращается.
Развертывание
# 1. Установка CANNchmod +x Ascend-cann-toolkit_*.run./Ascend-cann-toolkit_*.run --install --quiet
# 2. Dockerdocker pull deepseek-ai/deepseek-v4-ascend:latestdocker run --rm -it \ --device=/dev/davinci0 \ -v /usr/local/Ascend:/usr/local/Ascend \ -p 8000:8000 \ deepseek-ai/deepseek-v4-ascend:latest
# 3. Запускpython -m vllm.entrypoints.openai.api_server \ --model /models/deepseek-v4-preview \ --dtype bfloat16 --max-model-len 4096Производительность
| Модель | Железо | Tokens/s |
|---|---|---|
| V4 (7B) | 1× 910B | ~45 |
| V4 (14B) | 1× 910B | ~22 |
| V4 (70B) | 4× 910B | ~15 |
| V4 (70B) | 1× A100 | ~35 |
Для 7B и 14B — полностью продакшен-готово.
Шесть советов
- Используйте vLLM-Ascend, не raw CANN
- Включите Flash Attention (1.5-2x на длинных последовательностях)
- Batch 1-4 для лучшего latency/throughput
- BF16, не INT8 (деградация заметнее)
- Обновляйте CANN регулярно
- Присоединяйтесь к сообществу