DeepSeek V4 no Huawei Ascend: um guia prático para executar Frontier AI em hardware doméstico
O lançamento da prévia do DeepSeek V4 marca uma mudança significativa no cenário de hardware de IA. Pela primeira vez, um modelo de ponta tem suporte de primeira classe para NPUs Huawei Ascend — o que significa que você pode executar inferência de IA competitiva sem uma única GPU NVIDIA.
Este é um grande problema para desenvolvedores, instituições de pesquisa e empresas chinesas que foram limitadas pela disponibilidade de GPU. Deixe-me explicar o que isso significa e como começar.
Cenário de Hardware
Ascend 910B vs. NVIDIA A100 (Key Specs)┌────────────────────┬────────────────────┬────────────────────┐│ Spec │ Ascend 910B │ NVIDIA A100 │├────────────────────┼────────────────────┼────────────────────┤│ Compute (FP16) │ 320 TFLOPS │ 312 TFLOPS ││ Memory │ 64GB HBM2e │ 80GB HBM2e ││ Memory Bandwidth │ 1.5 TB/s │ 2.0 TB/s ││ Interconnect │ HCCS 56GB/s │ NVLink 600GB/s ││ TDP │ 310W │ 400W ││ Availability │ High (domestic) │ Constrained* │└────────────────────┴────────────────────┴────────────────────┘* NVIDIA export restrictions to certain marketsOs números contam uma história interessante. A computação bruta é comparável – o 910B na verdade está à frente no FP16 TFLOPS. A lacuna está na largura de banda da memória e nas interconexões, o que afeta a inferência de lotes grandes e o dimensionamento de múltiplas placas. Mas para inferência de cartão único e veiculação de pequenos lotes, a diferença está diminuindo rapidamente.
Visão geral da arquitetura
┌─────────────────────────────────────────────────────────────┐│ DeepSeek V4 on Ascend — Deployment Stack │├─────────────────────────────────────────────────────────────┤│ ││ ┌───────────────────────────────────────────────────────┐ ││ │ Client Layer │ ││ │ (Chat UI / API Client / curl) │ ││ └────────────────────┬──────────────────────────────────┘ ││ │ HTTP/WebSocket ││ ┌────────────────────▼──────────────────────────────────┐ ││ │ Serving Layer │ ││ │ vLLM-Ascend / TGI-Ascend │ ││ └────────────────────┬──────────────────────────────────┘ ││ │ CANN (Compute Architecture) ││ ┌────────────────────▼──────────────────────────────────┐ ││ │ CANN Stack │ ││ │ ├── ACL (Ascend Compute Language) │ ││ │ ├── GE (Graph Engine) │ ││ │ └── Runtime Driver │ ││ └────────────────────┬──────────────────────────────────┘ ││ │ ││ ┌────────────────────▼──────────────────────────────────┐ ││ │ Hardware │ ││ │ Ascend 910B / 910 Pro │ ││ └───────────────────────────────────────────────────────┘ ││ │└─────────────────────────────────────────────────────────────┘Guia de implantação
Pré-requisitos
# System requirements- OS: Ubuntu 22.04 / EulerOS- Kernel: 5.10+- NPU: Ascend 910B (at least 1 card)- Memory: 64GB+ system RAM- Disk: 200GB+ free spaceEtapa 1: Instale o kit de ferramentas CANN
# Download CANN from Huawei's support sitechmod +x Ascend-cann-toolkit_*.run./Ascend-cann-toolkit_*.run --install --quiet
# Verify installationnpu-smi info# Should show available Ascend NPUsEtapa 2: configurar o ambiente Docker
docker pull deepseek-ai/deepseek-v4-ascend:latest
docker run --rm -it \ --device=/dev/davinci0 \ --device=/dev/davinci_manager \ --device=/dev/hisi_hdc \ -v /usr/local/Ascend:/usr/local/Ascend \ -p 8000:8000 \ deepseek-ai/deepseek-v4-ascend:latestEtapa 3: iniciar o servidor de inferência
# Inside the containerpython -m vllm.entrypoints.openai.api_server \ --model /models/deepseek-v4-preview \ --trust-remote-code \ --dtype bfloat16 \ --max-model-len 4096 \ --gpu-memory-utilization 0.9Etapa 4: teste
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "deepseek-v4-preview", "messages": [{"role": "user", "content": "Hello, what can you do?"}] }'Observações de desempenho
Os primeiros benchmarks da comunidade mostram resultados promissores:
| Modelo | Ferragens | Tokens | Memória | Notas |
|---|---|---|---|---|
| Visualização V4 (7B) | 1× Ascender 910B | ~45 t/s | 14 GB | Rápido, cabe em um único cartão |
| Visualização V4 (14B) | 1× Ascender 910B | ~22 t/s | 28 GB | Utilizável para produção |
| Visualização V4 (70B) | 4× Ascender 910B | ~15 t/s | 63 GB | Requer quantização |
| Visualização V4 (70B) | 1 × A100 80 GB | ~35 t/s | 70 GB | Linha de base de referência |
A lacuna diminui com kernels CANN otimizados. Para os modelos 7B e 14B, a experiência está genuinamente pronta para produção.
Seis dicas para desenvolvedores
- Use vLLM-Ascend, não CANN bruto — A bifurcação comunitária do vLLM com back-end Ascend cuida da maior parte do trabalho de otimização para você
- Ativar Flash Attention — A implementação Ascend (
--enable-flash-attn) oferece aceleração de 1,5-2x em sequências mais longas - Observe o tamanho do lote — A largura de banda da memória é o gargalo; lotes pequenos (1-4) oferecem a melhor compensação entre latência/taxa de transferência
- Use BF16, não INT8 — Embora INT8 seja mais rápido, a degradação da qualidade no Ascend é mais perceptível do que no CUDA devido a diferentes calibrações de quantização
- Atualize o CANN regularmente — Cada versão traz melhorias significativas de desempenho. 7.0.0 foi bom; 8.0.0+ é visivelmente melhor
- Junte-se à comunidade — A comunidade Ascend AI no GitHub e nos fóruns de desenvolvedores chineses é ativa e útil
O panorama geral
DeepSeek V4 no Ascend é mais do que apenas mais uma opção de implantação. Representa um momento de dissociação — quando o desenvolvimento do modelo de IA e o desenvolvimento do ecossistema de hardware de IA podem prosseguir de forma independente. Para os desenvolvedores chineses, isso significa acesso à IA de fronteira sem restrições geopolíticas. Para a comunidade global, significa um ecossistema de hardware mais diversificado e resiliente.
A lacuna com CUDA ainda não foi eliminada. Mas está diminuindo e a taxa de melhoria está acelerando.