达拉斯 GPU 物理机到手必做:nvidia-smi 验收 + NVLink 拓扑 + 驱动版本锁定
花了大价钱租了 达拉斯 8×4090 或 8×H100 物理机,开机第一件事不是跑训练,而是验收 GPU 状态。云数方舟 达拉斯 GPU 节点到手后,花 10 分钟跑完下面 3 项,避免后续训练到一半发现 GPU 有问题。
1. nvidia-smi 看 GPU 基本状态。执行:nvidia-smi
关注:
– GPU 数量:应显示 8 张(8×4090 或 8×H100)。
– Driver Version:如 535.104.05(与 CUDA 版本匹配)。
– Temperature:待机应 < 50°C。如果 > 60°C,可能散热有问题。
– Power Draw:待机功耗应很低(4090 约 20-30W)。如果某张卡待机功耗异常高,可能有人在跑任务或卡有故障。
– ECC Errors:执行 nvidia-smi -q | grep -i ecc,看是否有已纠正/未纠正的错误。H100 的 ECC 尤其重要。
2. nvidia-smi topo 看 NVLink/NVSwitch 拓扑。执行:nvidia-smi topo -m
输出一个矩阵,显示 GPU 之间的连接方式:
– NV#:NVLink 直连(最快,如 NV4 = 4 条 NVLink 通道)。
– PIX:通过 PCIe Switch 连接。
– PHB:通过 PCIe Host Bridge。
– SYS:跨 CPU Socket(最慢)。
8×4090 通常是 4 卡一组通过 NVLink Bridge 连接(如 GPU0-GPU1-GPU2-GPU3 互相 NV#,GPU4-GPU5-GPU6-GPU7 另一组),两组之间通过 CPU 间通信(SYS)。8×H100 通常全互联(NVSwitch)。
这里说的”NVLink 是 GPU 间的高速公路”,这个是指 NVLink 4.0 带宽可达 900GB/s(H100),远超 PCIe 5.0 的 128GB/s。
3. 驱动版本锁定(防自动更新搞崩环境)。执行:apt-mark hold nvidia-driver-535 nvidia-utils-535(Debian/Ubuntu,版本号按实际)。
或 dnf versionlock add nvidia-driver(CentOS/RHEL)。
CUDA 版本对驱动版本有严格要求(如 CUDA 12.2 需要 Driver ≥ 535.54.03)。自动更新可能把驱动升到不兼容版本,导致训练框架(PyTorch/TensorFlow)无法调用 GPU。
同时锁定内核更新:apt-mark hold linux-image-$(uname -r),避免内核升级后 NVIDIA 内核模块需要重新编译。
| 验收项 | 命令 | 合格标准 | 异常信号 |
|---|---|---|---|
| GPU 数量 | nvidia-smi | 显示 8 张 | 少于 8 张 |
| 温度 | nvidia-smi | 待机 < 50°C | > 60°C |
| NVLink 拓扑 | nvidia-smi topo -m | 同组 GPU 间 NV# | 全 PIX(无 NVLink) |
| ECC 错误 | nvidia-smi -q | grep ECC | 无未纠正错误 | 有 UCE |
| 驱动锁定 | apt-mark hold | 驱动不再自动更新 | 未锁定 |
行动建议。验收完毕后,跑一个简短的 GPU 压力测试确认稳定性:nvidia-smi dmon -s p -d 1 监控功耗,同时另开窗口跑 cuda-samples/1_Utilities/deviceQuery。如果一切正常,再部署训练框架。对于 达拉斯 GPU 物理机,建议额外配置 GPU 监控(如 Prometheus + dcgm-exporter),长期跟踪 GPU 健康度。记住:GPU 物理机是生产工具,验收 10 分钟能省掉后面 10 小时的故障排查。
📌 查看云数方舟达拉斯 GPU 方案:
云数方舟官网 | 达拉斯显卡服务器(8×4090/8×H100)
本文由 云数方舟 技术团队原创发布,转载请注明出处。