needhelp
← Back to blog

DeepSeek V4 no Huawei Ascend: um guia prático para executar Frontier AI em hardware doméstico

by needhelp
deepseek
huawei-ascend
implantação de IA
doméstico-ai

O lançamento da prévia do DeepSeek V4 marca uma mudança significativa no cenário de hardware de IA. Pela primeira vez, um modelo de ponta tem suporte de primeira classe para NPUs Huawei Ascend — o que significa que você pode executar inferência de IA competitiva sem uma única GPU NVIDIA.

Este é um grande problema para desenvolvedores, instituições de pesquisa e empresas chinesas que foram limitadas pela disponibilidade de GPU. Deixe-me explicar o que isso significa e como começar.

Cenário de Hardware

Ascend 910B vs. NVIDIA A100 (Key Specs)
┌────────────────────┬────────────────────┬────────────────────┐
│ Spec │ Ascend 910B │ NVIDIA A100 │
├────────────────────┼────────────────────┼────────────────────┤
│ Compute (FP16) │ 320 TFLOPS │ 312 TFLOPS │
│ Memory │ 64GB HBM2e │ 80GB HBM2e │
│ Memory Bandwidth │ 1.5 TB/s │ 2.0 TB/s │
│ Interconnect │ HCCS 56GB/s │ NVLink 600GB/s │
│ TDP │ 310W │ 400W │
│ Availability │ High (domestic) │ Constrained* │
└────────────────────┴────────────────────┴────────────────────┘
* NVIDIA export restrictions to certain markets

Os números contam uma história interessante. A computação bruta é comparável – o 910B na verdade está à frente no FP16 TFLOPS. A lacuna está na largura de banda da memória e nas interconexões, o que afeta a inferência de lotes grandes e o dimensionamento de múltiplas placas. Mas para inferência de cartão único e veiculação de pequenos lotes, a diferença está diminuindo rapidamente.

Visão geral da arquitetura

┌─────────────────────────────────────────────────────────────┐
│ DeepSeek V4 on Ascend — Deployment Stack │
├─────────────────────────────────────────────────────────────┤
│ │
│ ┌───────────────────────────────────────────────────────┐ │
│ │ Client Layer │ │
│ │ (Chat UI / API Client / curl) │ │
│ └────────────────────┬──────────────────────────────────┘ │
│ │ HTTP/WebSocket │
│ ┌────────────────────▼──────────────────────────────────┐ │
│ │ Serving Layer │ │
│ │ vLLM-Ascend / TGI-Ascend │ │
│ └────────────────────┬──────────────────────────────────┘ │
│ │ CANN (Compute Architecture) │
│ ┌────────────────────▼──────────────────────────────────┐ │
│ │ CANN Stack │ │
│ │ ├── ACL (Ascend Compute Language) │ │
│ │ ├── GE (Graph Engine) │ │
│ │ └── Runtime Driver │ │
│ └────────────────────┬──────────────────────────────────┘ │
│ │ │
│ ┌────────────────────▼──────────────────────────────────┐ │
│ │ Hardware │ │
│ │ Ascend 910B / 910 Pro │ │
│ └───────────────────────────────────────────────────────┘ │
│ │
└─────────────────────────────────────────────────────────────┘

Guia de implantação

Pré-requisitos

Terminal window
# System requirements
- OS: Ubuntu 22.04 / EulerOS
- Kernel: 5.10+
- NPU: Ascend 910B (at least 1 card)
- Memory: 64GB+ system RAM
- Disk: 200GB+ free space

Etapa 1: Instale o kit de ferramentas CANN

Terminal window
# Download CANN from Huawei's support site
chmod +x Ascend-cann-toolkit_*.run
./Ascend-cann-toolkit_*.run --install --quiet
# Verify installation
npu-smi info
# Should show available Ascend NPUs

Etapa 2: configurar o ambiente Docker

Terminal window
docker pull deepseek-ai/deepseek-v4-ascend:latest
docker run --rm -it \
--device=/dev/davinci0 \
--device=/dev/davinci_manager \
--device=/dev/hisi_hdc \
-v /usr/local/Ascend:/usr/local/Ascend \
-p 8000:8000 \
deepseek-ai/deepseek-v4-ascend:latest

Etapa 3: iniciar o servidor de inferência

Terminal window
# Inside the container
python -m vllm.entrypoints.openai.api_server \
--model /models/deepseek-v4-preview \
--trust-remote-code \
--dtype bfloat16 \
--max-model-len 4096 \
--gpu-memory-utilization 0.9

Etapa 4: teste

Terminal window
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-preview",
"messages": [{"role": "user", "content": "Hello, what can you do?"}]
}'

Observações de desempenho

Os primeiros benchmarks da comunidade mostram resultados promissores:

Modelo Ferragens Tokens Memória Notas
Visualização V4 (7B) 1× Ascender 910B ~45 t/s 14 GB Rápido, cabe em um único cartão
Visualização V4 (14B) 1× Ascender 910B ~22 t/s 28 GB Utilizável para produção
Visualização V4 (70B) 4× Ascender 910B ~15 t/s 63 GB Requer quantização
Visualização V4 (70B) 1 × A100 80 GB ~35 t/s 70 GB Linha de base de referência

A lacuna diminui com kernels CANN otimizados. Para os modelos 7B e 14B, a experiência está genuinamente pronta para produção.

Seis dicas para desenvolvedores

  1. Use vLLM-Ascend, não CANN bruto — A bifurcação comunitária do vLLM com back-end Ascend cuida da maior parte do trabalho de otimização para você
  2. Ativar Flash Attention — A implementação Ascend (--enable-flash-attn) oferece aceleração de 1,5-2x em sequências mais longas
  3. Observe o tamanho do lote — A largura de banda da memória é o gargalo; lotes pequenos (1-4) oferecem a melhor compensação entre latência/taxa de transferência
  4. Use BF16, não INT8 — Embora INT8 seja mais rápido, a degradação da qualidade no Ascend é mais perceptível do que no CUDA devido a diferentes calibrações de quantização
  5. Atualize o CANN regularmente — Cada versão traz melhorias significativas de desempenho. 7.0.0 foi bom; 8.0.0+ é visivelmente melhor
  6. Junte-se à comunidade — A comunidade Ascend AI no GitHub e nos fóruns de desenvolvedores chineses é ativa e útil

O panorama geral

DeepSeek V4 no Ascend é mais do que apenas mais uma opção de implantação. Representa um momento de dissociação — quando o desenvolvimento do modelo de IA e o desenvolvimento do ecossistema de hardware de IA podem prosseguir de forma independente. Para os desenvolvedores chineses, isso significa acesso à IA de fronteira sem restrições geopolíticas. Para a comunidade global, significa um ecossistema de hardware mais diversificado e resiliente.

A lacuna com CUDA ainda não foi eliminada. Mas está diminuindo e a taxa de melhoria está acelerando.

Referências

Share this page