needhelp
← Back to blog

DeepSeek V4 на Huawei Ascend: практическое руководство по запуску frontier AI на отечественном железе

by needhelp
deepseek
huawei-ascend
ai-deployment
domestic-ai

Релиз DeepSeek V4 preview знаменует сдвиг: frontier-модель с первоклассной поддержкой Ascend NPU от Huawei. Впервые конкурентный AI-инференс без единого NVIDIA GPU.

Спецификации

Спецификация Ascend 910B NVIDIA A100
Compute FP16 320 TFLOPS 312 TFLOPS
Память 64GB HBM2e 80GB HBM2e
Bandwidth 1.5 TB/s 2.0 TB/s
Доступность Высокая Ограничена*

Сырая производительность сравнима. Разрыв в памяти и интерконнектах сокращается.

Развертывание

Terminal window
# 1. Установка CANN
chmod +x Ascend-cann-toolkit_*.run
./Ascend-cann-toolkit_*.run --install --quiet
# 2. Docker
docker pull deepseek-ai/deepseek-v4-ascend:latest
docker run --rm -it \
--device=/dev/davinci0 \
-v /usr/local/Ascend:/usr/local/Ascend \
-p 8000:8000 \
deepseek-ai/deepseek-v4-ascend:latest
# 3. Запуск
python -m vllm.entrypoints.openai.api_server \
--model /models/deepseek-v4-preview \
--dtype bfloat16 --max-model-len 4096

Производительность

Модель Железо Tokens/s
V4 (7B) 1× 910B ~45
V4 (14B) 1× 910B ~22
V4 (70B) 4× 910B ~15
V4 (70B) 1× A100 ~35

Для 7B и 14B — полностью продакшен-готово.

Шесть советов

  1. Используйте vLLM-Ascend, не raw CANN
  2. Включите Flash Attention (1.5-2x на длинных последовательностях)
  3. Batch 1-4 для лучшего latency/throughput
  4. BF16, не INT8 (деградация заметнее)
  5. Обновляйте CANN регулярно
  6. Присоединяйтесь к сообществу

References

Share this page