A800 80GB 八卡 GPU Burn 压测操作文档
1. 环境信息
| 项目 | 详情 |
|---|---|
| 操作系统 | Ubuntu 22.04 LTS |
| GPU | NVIDIA A800 80GB × 8 |
| 压测工具 | gpu-burn |
| 压测时长 | 30 分钟(1800 秒) |
| 输出目录 | /root/gpu-burn/ |
| Compute Capability | 8.0 (GA100) |
2. 前置检查
nvidia-smi# 检查驱动、8 卡全部可见nvidia-smi-L|grepA800# 确认 8 条 A800 记录nvcc--version# 确认 CUDA 已安装3. 安装 gpu-burn
sudoaptupdate&&sudoaptinstall-ybuild-essentialgitcd/tmpgitclone https://gitee.com/mirrors_wilicc/gpu-burn.git# 国内用 Gitee 镜像cdgpu-burnmakeCOMPUTE=80# A800 compute capability 8.0./gpu_burn-l# 验证:确认 8 张 A800GitHub 连不上时备选:
git clone https://ghproxy.com/https://github.com/wilicc/gpu-burn.git编译报错找不到 nvcc:
export PATH=/usr/local/cuda/bin:$PATH
4. 执行压测
mkdir-p/root/gpu-burncd/tmp/gpu-burn ./gpu_burn-d-tc-m95%18002>&1|tee/root/gpu-burn/gpu_burn_output.log| 参数 | 含义 |
|---|---|
-d | 双精度 FP64 |
-tc | Tensor Core |
-m 95% | 95% 显存(约 76GB) |
1800 | 30 分钟 |
快速验证:先跑
./gpu_burn -d -tc -m 95% 120(2 分钟),无异常再跑 30 分钟。
单卡测试:./gpu_burn -d -tc -i 0 1800
5. 压测期间监控(另开终端)
| 终端 | 命令 | 用途 |
|---|---|---|
| 终端 2 | nvidia-smi --query-gpu=timestamp,name,temperature.gpu,power.draw,utilization.gpu,utilization.memory,memory.used,memory.total --format=csv -l 5 -f /root/gpu-burn/gpu_monitor.csv | CSV 监控数据 |
| 终端 3 | dmesg -wT | grep -iE "nvidia|error|xid|nvrm" | tee /root/gpu-burn/dmesg_error.log | 系统错误日志 |
| 终端 4 | watch -n 2 nvidia-smi | 实时观察 |
6. 结果判定
正常:无报错退出,温度 70-85°C,功耗 ~300W,利用率 99-100%,dmesg 无 Xid 错误。
异常:
| 现象 | 可能原因 |
|---|---|
| 中途报错退出 | 某卡不稳定、显存故障 |
| 温度 > 85°C | 散热不足 |
| 某卡功耗明显偏低 | 该卡故障或降频 |
| 利用率 < 99% | throttle 降频 |
| Xid 错误(13/31/43/48/79 等) | GPU 硬件故障 |
7. 注意事项
- A800 八卡满载功耗 2400W+,确保电源和散热充足
- 压测期间勿操作其他 GPU 任务
-m 95%约使用 76GB 显存,A800 单卡 80GB- 编译必须指定
COMPUTE=80(GA100 架构) - 压测后保留
/root/gpu-burn/日志归档
8. 完整流程总结
# ===== 1. 前置检查 =====nvidia-smi&&nvidia-smi-L|grepA800&&nvcc--version# ===== 2. 安装 gpu-burn =====cd/tmpgitclone https://gitee.com/mirrors_wilicc/gpu-burn.gitcdgpu-burn&&makeCOMPUTE=80# ===== 3. 创建输出目录 =====mkdir-p/root/gpu-burn# ===== 4. 启动监控(另开终端) =====# 终端 2:nvidia-smi --query-gpu=timestamp,name,temperature.gpu,power.draw,utilization.gpu,utilization.memory,memory.used,memory.total --format=csv -l 5 -f /root/gpu-burn/gpu_monitor.csv# 终端 3:dmesg -wT | grep -iE "nvidia|error|xid|nvrm" | tee /root/gpu-burn/dmesg_error.log# 终端 4:watch -n 2 nvidia-smi# ===== 5. 启动压测 =====cd/tmp/gpu-burn ./gpu_burn-d-tc-m95%18002>&1|tee/root/gpu-burn/gpu_burn_output.log# ===== 6. 收集数据 =====nvidia-smi-q>/root/gpu-burn/gpu_info_after.txtdmesg-T|grep-invidia>/root/gpu-burn/dmesg_nvidia.logdmesg-T|grep-i"xid\|error\|fail">/root/gpu-burn/dmesg_all_error.log# ===== 7. 生成报告 =====cd/tmp/gpu-burn&&./generate_report.shls-la/root/gpu-burn/