新上8卡RTX 5090 限时特惠 Read more

达拉斯 GPU 物理机到手必做:nvidia-smi 验收 + NVLink 拓扑 + 驱动版本锁定 - 云数方舟

达拉斯 GPU 物理机到手必做:nvidia-smi 验收 + NVLink 拓扑 + 驱动版本锁定

花了大价钱租了 达拉斯 8×4090 或 8×H100 物理机,开机第一件事不是跑训练,而是验收 GPU 状态。云数方舟 达拉斯 GPU 节点到手后,花 10 分钟跑完下面 3 项,避免后续训练到一半发现 GPU 有问题。

1. nvidia-smi 看 GPU 基本状态。执行:
nvidia-smi
关注:
GPU 数量:应显示 8 张(8×4090 或 8×H100)。
Driver Version:如 535.104.05(与 CUDA 版本匹配)。
Temperature:待机应 < 50°C。如果 > 60°C,可能散热有问题。
Power Draw:待机功耗应很低(4090 约 20-30W)。如果某张卡待机功耗异常高,可能有人在跑任务或卡有故障。
ECC Errors:执行 nvidia-smi -q | grep -i ecc,看是否有已纠正/未纠正的错误。H100 的 ECC 尤其重要。

2. nvidia-smi topo 看 NVLink/NVSwitch 拓扑。执行:
nvidia-smi topo -m
输出一个矩阵,显示 GPU 之间的连接方式:
NV#:NVLink 直连(最快,如 NV4 = 4 条 NVLink 通道)。
PIX:通过 PCIe Switch 连接。
PHB:通过 PCIe Host Bridge。
SYS:跨 CPU Socket(最慢)。
8×4090 通常是 4 卡一组通过 NVLink Bridge 连接(如 GPU0-GPU1-GPU2-GPU3 互相 NV#,GPU4-GPU5-GPU6-GPU7 另一组),两组之间通过 CPU 间通信(SYS)。8×H100 通常全互联(NVSwitch)。
这里说的”NVLink 是 GPU 间的高速公路”,这个是指 NVLink 4.0 带宽可达 900GB/s(H100),远超 PCIe 5.0 的 128GB/s。

3. 驱动版本锁定(防自动更新搞崩环境)。执行:
apt-mark hold nvidia-driver-535 nvidia-utils-535(Debian/Ubuntu,版本号按实际)。
dnf versionlock add nvidia-driver(CentOS/RHEL)。
CUDA 版本对驱动版本有严格要求(如 CUDA 12.2 需要 Driver ≥ 535.54.03)。自动更新可能把驱动升到不兼容版本,导致训练框架(PyTorch/TensorFlow)无法调用 GPU。
同时锁定内核更新:apt-mark hold linux-image-$(uname -r),避免内核升级后 NVIDIA 内核模块需要重新编译。

验收项命令合格标准异常信号
GPU 数量nvidia-smi显示 8 张少于 8 张
温度nvidia-smi待机 < 50°C> 60°C
NVLink 拓扑nvidia-smi topo -m同组 GPU 间 NV#全 PIX(无 NVLink)
ECC 错误nvidia-smi -q | grep ECC无未纠正错误有 UCE
驱动锁定apt-mark hold驱动不再自动更新未锁定

行动建议。验收完毕后,跑一个简短的 GPU 压力测试确认稳定性:nvidia-smi dmon -s p -d 1 监控功耗,同时另开窗口跑 cuda-samples/1_Utilities/deviceQuery。如果一切正常,再部署训练框架。对于 达拉斯 GPU 物理机,建议额外配置 GPU 监控(如 Prometheus + dcgm-exporter),长期跟踪 GPU 健康度。记住:GPU 物理机是生产工具,验收 10 分钟能省掉后面 10 小时的故障排查。


📌 查看云数方舟达拉斯 GPU 方案:
云数方舟官网达拉斯显卡服务器(8×4090/8×H100)

本文由 云数方舟 技术团队原创发布,转载请注明出处。

云数方舟
  • 3216651636
  • support@yunark.cn