4×GPU Cluster Active
DeepSeek-V2/V3 MoE

GPU LLM Performance Tuning

从用户请求一路下钻到 CUDA Kernel:Latency → Engine → Cache → GPU → Multi-GPU → Kernel → Observability

PCIe Gen4
01 全景系统拓扑 点击任意节点查看下钻深度剖析
建议学习路线
① Prefill vs Decode
② TTFT / TPOT / tok/s
③ KV Cache (MLA & Paged)
④ HBM / Tensor Core
⑤ TP / EP / DP 并行
⑥ NCCL / PCIe 瓶颈
⑦ Attention / MoE kernels
⑧ vLLM / SGLang 生产参数
⑨ Prometheus / Grafana 监控
⑩ Nsight Systems 抓包
🧮 交互式 KV Cache 内存与最大并发测算器

直观对比 DeepSeek MLA(低秩压缩 576 元素)与传统 GQA/MHA 在受限 4×GPU 显存下的并发承载极限。

平均序列长度 (Seq Length) 4096 tokens
并发请求流数 (Concurrency) 16 流
GPU 卡数 4 张
单卡显存 24 GB
单 Token 显存消耗 -- KB MLA 压缩增益显著
单条完整序列显存 -- MB Paged 虚拟块化管理
集群可用 KV 缓存池 -- GB 扣除权重底噪后
理论最大并发流数 -- Streams 不触发 Preemption 上限
📐 Roofline 模型与硬件平衡比 (Machine Balance)

Machine Balance 拐点公式: \(I^* = \frac{\text{Peak TFLOPS}}{\text{Peak Memory Bandwidth (TB/s)}}\)

  • RTX 4090: 165 TFLOPS / 1.0 TB/s = 165 FLOPs/Byte
  • H100 SXM: 989 TFLOPS / 3.35 TB/s = 295 FLOPs/Byte

结论: Decode 阶段的算力密度(Arithmetic Intensity)仅为约 2~8 FLOPs/Byte,远远低于 165!因此在自回归生成阶段,提升单 Token 生成速度的唯一物理杠杆是显存带宽(HBM/GDDR)或通过量化/投机解码减少每次读取权重的字节数,盲目堆砌 TFLOPS 算力毫无意义!

🌲 生产级瓶颈定位决策树

遇到“推理慢”时,按顺序执行以下 4 步排查,快速归因根因:

Step 1: 排查排队与调度 (Queue & Preemption)

检查 Prometheus vllm:num_requests_waiting 是否积压。若积压 > 20,说明并发超限;检查日志是否有 Preempting request,若频繁驱逐,调低 max-model-len 并开启 Prefix Caching。

Step 2: 排查首字抖动 (TTFT & Chunked Prefill)

若 TPOT 流畅(<35ms/tok)但 TTFT 奇高,说明长短请求互博。新请求的 Prefill 独占打断了正在 Decode 的请求。立即开启 --enable-chunked-prefill true 消除毛刺。

Step 3: 排查多卡通信阻塞 (4×GPU PCIe All-to-All)

在 4 卡无 NVLink 机器上,查看 DCGM_FI_DEV_PCIE_TX_THROUGHPUT。若常年接近 30GB/s 且 SM% 极低,说明 TP=4 的 120+ 次 All-Reduce 阻塞在 PCIe。改用 EP=4(专家并行)仅传输激活值。

Step 4: 排查底层算子与访存墙 (Kernel Profiling)

使用 nsys 抓包。如果每个 Step 之间存在大量空白(CPU Launch 延迟),开启 CUDA Graph;若 FlashAttention 执行耗时过长,确认驱动与 PyTorch 版本是否支持 FlashAttention-2/3。

🛠️ 4×GPU 生产启动参数生成器
生成的优化启动指令:

      
🔭 Nsight Systems 抓包时序实操指令
# 使用 nsys 抓取 30 秒高并发时序流(跳过前 15s 预热)
nsys profile \
  --trace=cuda,nvtx,osrt \
  --cuda-memory-usage=true \
  --delay=15 --duration=30 \
  -o ./profiles/deepseek_4xgpu_trace \
  vllm serve /models/deepseek-v2-lite --tensor-parallel-size 4

🧪 工业级实战诊断实验室

以下 5 个案例源于真实的 4×GPU 生产部署故障。点击选项提交诊断,检验调优内功!