全节点通用:用 Prometheus + Node Exporter 做基础监控,5 分钟部署
不管你用的是 香港云主机、圣何塞独立服务器 还是 达拉斯 GPU 物理机,基础监控(CPU、内存、磁盘、网络)都是必须的。云数方舟 教你用 Prometheus + Node Exporter 快速搭建,5 分钟搞定。
第一步:安装 Node Exporter。在所有需要监控的服务器上:curl -s https://api.github.com/repos/prometheus/node_exporter/releases/latest | grep browser_download_url | grep linux-amd64 | cut -d '"' -f 4 | wget -qi -tar xvf node_exporter-*.linux-amd64.tar.gz && sudo cp node_exporter-*.linux-amd64/node_exporter /usr/local/bin/
创建 systemd 服务:
[Unit] Description=Node Exporter After=network.target [Service] User=node_exporter Group=node_exporter ExecStart=/usr/local/bin/node_exporter [Install] WantedBy=multi-user.target
systemctl daemon-reload && systemctl enable --now node_exporter。
Node Exporter 默认在 :9100/metrics 暴露指标。
第二步:部署 Prometheus(在一台中心服务器上)。用 docker-compose:
version: '3'
services:
prometheus:
image: prom/prometheus
volumes:
- ./prometheus.yml:/etc/prometheus/prometheus.yml
- prom_data:/prometheus
ports:
- "9090:9090"
volumes:
prom_data:
prometheus.yml 配置:
global:
scrape_interval: 15s
scrape_configs:
- job_name: 'node'
static_configs:
- targets: ['服务器1IP:9100', '服务器2IP:9100']
docker-compose up -d。访问 http://中心服务器IP:9090 即可看到 Prometheus UI。
第三步:导入 Grafana 看板(可选)。部署 Grafana:docker run -d -p 3000:3000 grafana/grafana
访问 http://IP:3000,添加 Prometheus 数据源,导入 Node Exporter 看板(ID:1860)。即可看到 CPU、内存、磁盘、网络的精美图表。
| 组件 | 端口 | 资源占用 | 用途 |
|---|---|---|---|
| Node Exporter | 9100 | < 20MB RAM | 采集指标 |
| Prometheus | 9090 | ~200MB RAM(小实例) | 存储+查询 |
| Grafana | 3000 | ~100MB RAM | 可视化 |
行动建议。对于 达拉斯 GPU 物理机,额外建议部署 dcgm-exporter(NVIDIA DCGM)监控 GPU 指标(温度、功耗、显存、GPU 利用率)。Node Exporter + dcgm-exporter + Prometheus + Grafana 是 GPU 服务器的标准监控栈。记住:监控不是”有了问题才看”,而是”没问题时建立基线,出问题时对比基线”——没有基线的告警都是噪音。
📌 查看云数方舟全节点方案:
云数方舟官网 | 圣何塞独立服务器 | 达拉斯 GPU 物理机
本文由 云数方舟 技术团队原创发布,转载请注明出处。