gpu burn压测A800 80g
2026/8/6 21:23:33 网站建设 项目流程

A800 80GB 八卡 GPU Burn 压测操作文档

1. 环境信息

项目详情
操作系统Ubuntu 22.04 LTS
GPUNVIDIA A800 80GB × 8
压测工具gpu-burn
压测时长30 分钟(1800 秒)
输出目录/root/gpu-burn/
Compute Capability8.0 (GA100)

2. 前置检查

nvidia-smi# 检查驱动、8 卡全部可见nvidia-smi-L|grepA800# 确认 8 条 A800 记录nvcc--version# 确认 CUDA 已安装

3. 安装 gpu-burn

sudoaptupdate&&sudoaptinstall-ybuild-essentialgitcd/tmpgitclone https://gitee.com/mirrors_wilicc/gpu-burn.git# 国内用 Gitee 镜像cdgpu-burnmakeCOMPUTE=80# A800 compute capability 8.0./gpu_burn-l# 验证:确认 8 张 A800

GitHub 连不上时备选:git clone https://ghproxy.com/https://github.com/wilicc/gpu-burn.git

编译报错找不到 nvcc:export PATH=/usr/local/cuda/bin:$PATH

4. 执行压测

mkdir-p/root/gpu-burncd/tmp/gpu-burn ./gpu_burn-d-tc-m95%18002>&1|tee/root/gpu-burn/gpu_burn_output.log
参数含义
-d双精度 FP64
-tcTensor Core
-m 95%95% 显存(约 76GB)
180030 分钟

快速验证:先跑./gpu_burn -d -tc -m 95% 120(2 分钟),无异常再跑 30 分钟。
单卡测试:./gpu_burn -d -tc -i 0 1800

5. 压测期间监控(另开终端)

终端命令用途
终端 2nvidia-smi --query-gpu=timestamp,name,temperature.gpu,power.draw,utilization.gpu,utilization.memory,memory.used,memory.total --format=csv -l 5 -f /root/gpu-burn/gpu_monitor.csvCSV 监控数据
终端 3dmesg -wT | grep -iE "nvidia|error|xid|nvrm" | tee /root/gpu-burn/dmesg_error.log系统错误日志
终端 4watch -n 2 nvidia-smi实时观察

6. 结果判定

正常:无报错退出,温度 70-85°C,功耗 ~300W,利用率 99-100%,dmesg 无 Xid 错误。

异常:

现象可能原因
中途报错退出某卡不稳定、显存故障
温度 > 85°C散热不足
某卡功耗明显偏低该卡故障或降频
利用率 < 99%throttle 降频
Xid 错误(13/31/43/48/79 等)GPU 硬件故障

7. 注意事项

  • A800 八卡满载功耗 2400W+,确保电源和散热充足
  • 压测期间勿操作其他 GPU 任务
  • -m 95%约使用 76GB 显存,A800 单卡 80GB
  • 编译必须指定COMPUTE=80(GA100 架构)
  • 压测后保留/root/gpu-burn/日志归档

8. 完整流程总结

# ===== 1. 前置检查 =====nvidia-smi&&nvidia-smi-L|grepA800&&nvcc--version# ===== 2. 安装 gpu-burn =====cd/tmpgitclone https://gitee.com/mirrors_wilicc/gpu-burn.gitcdgpu-burn&&makeCOMPUTE=80# ===== 3. 创建输出目录 =====mkdir-p/root/gpu-burn# ===== 4. 启动监控(另开终端) =====# 终端 2:nvidia-smi --query-gpu=timestamp,name,temperature.gpu,power.draw,utilization.gpu,utilization.memory,memory.used,memory.total --format=csv -l 5 -f /root/gpu-burn/gpu_monitor.csv# 终端 3:dmesg -wT | grep -iE "nvidia|error|xid|nvrm" | tee /root/gpu-burn/dmesg_error.log# 终端 4:watch -n 2 nvidia-smi# ===== 5. 启动压测 =====cd/tmp/gpu-burn ./gpu_burn-d-tc-m95%18002>&1|tee/root/gpu-burn/gpu_burn_output.log# ===== 6. 收集数据 =====nvidia-smi-q>/root/gpu-burn/gpu_info_after.txtdmesg-T|grep-invidia>/root/gpu-burn/dmesg_nvidia.logdmesg-T|grep-i"xid\|error\|fail">/root/gpu-burn/dmesg_all_error.log# ===== 7. 生成报告 =====cd/tmp/gpu-burn&&./generate_report.shls-la/root/gpu-burn/

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询