新上8卡RTX 5090 限时特惠 Read more

全节点通用:用 Prometheus + Node Exporter 做基础监控,5 分钟部署 - 云数方舟

全节点通用:用 Prometheus + Node Exporter 做基础监控,5 分钟部署

不管你用的是 香港云主机圣何塞独立服务器 还是 达拉斯 GPU 物理机,基础监控(CPU、内存、磁盘、网络)都是必须的。云数方舟 教你用 Prometheus + Node Exporter 快速搭建,5 分钟搞定。

第一步:安装 Node Exporter。在所有需要监控的服务器上:
curl -s https://api.github.com/repos/prometheus/node_exporter/releases/latest | grep browser_download_url | grep linux-amd64 | cut -d '"' -f 4 | wget -qi -
tar xvf node_exporter-*.linux-amd64.tar.gz && sudo cp node_exporter-*.linux-amd64/node_exporter /usr/local/bin/
创建 systemd 服务:

[Unit]
Description=Node Exporter
After=network.target

[Service]
User=node_exporter
Group=node_exporter
ExecStart=/usr/local/bin/node_exporter

[Install]
WantedBy=multi-user.target

systemctl daemon-reload && systemctl enable --now node_exporter
Node Exporter 默认在 :9100/metrics 暴露指标。

第二步:部署 Prometheus(在一台中心服务器上)。用 docker-compose:

version: '3'
services:
  prometheus:
    image: prom/prometheus
    volumes:
      - ./prometheus.yml:/etc/prometheus/prometheus.yml
      - prom_data:/prometheus
    ports:
      - "9090:9090"

volumes:
  prom_data:

prometheus.yml 配置:

global:
  scrape_interval: 15s

scrape_configs:
  - job_name: 'node'
    static_configs:
      - targets: ['服务器1IP:9100', '服务器2IP:9100']

docker-compose up -d。访问 http://中心服务器IP:9090 即可看到 Prometheus UI。

第三步:导入 Grafana 看板(可选)。部署 Grafana:
docker run -d -p 3000:3000 grafana/grafana
访问 http://IP:3000,添加 Prometheus 数据源,导入 Node Exporter 看板(ID:1860)。即可看到 CPU、内存、磁盘、网络的精美图表。

组件端口资源占用用途
Node Exporter9100< 20MB RAM采集指标
Prometheus9090~200MB RAM(小实例)存储+查询
Grafana3000~100MB RAM可视化

行动建议。对于 达拉斯 GPU 物理机,额外建议部署 dcgm-exporter(NVIDIA DCGM)监控 GPU 指标(温度、功耗、显存、GPU 利用率)。Node Exporter + dcgm-exporter + Prometheus + Grafana 是 GPU 服务器的标准监控栈。记住:监控不是”有了问题才看”,而是”没问题时建立基线,出问题时对比基线”——没有基线的告警都是噪音。


📌 查看云数方舟全节点方案:
云数方舟官网圣何塞独立服务器达拉斯 GPU 物理机

本文由 云数方舟 技术团队原创发布,转载请注明出处。

云数方舟
  • 3216651636
  • support@yunark.cn