1212 input_series :
1313 - series : obmondo_monitoring{certname="test.abc", alert_id="monitor::system::slurm::job_failed"}
1414 values : 1x200
15- - series : slurm_job_failed {certname="test.abc"}
15+ - series : slurm_jobs_failed {certname="test.abc"}
1616 values : 1x200
1717
1818 alert_rule_test :
2424 certname : test.abc
2525 alert_id : monitor::system::slurm::job_failed
2626 exp_annotations :
27- summary : " Slurm job failure detected on host **test.abc** "
28- description : " One or more Slurm jobs have failed on **test.abc** ."
27+ summary : " Slurm job failure detected"
28+ description : " One or more Slurm jobs have failed."
2929
3030 #
3131 # 2. Slurm nodes_down alert
@@ -34,8 +34,10 @@ tests:
3434 input_series :
3535 - series : obmondo_monitoring{certname="test.abc", alert_id="monitor::system::slurm::nodes_down"}
3636 values : 1x200
37- - series : slurm_nodes_down{certname="test.abc"}
38- values : 2x200
37+ - series : slurm_node_status{certname="test.abc", node="node11", partition="batch*", status="down*"}
38+ values : 1x200
39+ - series : slurm_node_status{certname="test.abc", node="node11", partition="compute", status="down*"}
40+ values : 1x200
3941
4042 alert_rule_test :
4143 - alertname : monitor::system::slurm::nodes_down
@@ -45,9 +47,10 @@ tests:
4547 severity : critical
4648 certname : test.abc
4749 alert_id : monitor::system::slurm::nodes_down
50+ node : node11
4851 exp_annotations :
49- summary : " Slurm nodes are down for **test.abc** "
50- description : " One or more Slurm nodes are reported as down on **test.abc** ."
52+ summary : " Slurm node **node11** is DOWN "
53+ description : " Slurm node **node11** is reported as DOWN for more than 15 minutes ."
5154
5255 #
5356 # 3. Slurm jobs_pending alert (pending > 1 hour)
@@ -68,20 +71,22 @@ tests:
6871 certname : test.abc
6972 alert_id : monitor::system::slurm::jobs_pending
7073 exp_annotations :
71- summary : " Slurm jobs pending for more than 1 hour on host **test.abc** "
72- description : " One or more Slurm jobs have been in the PENDING state for more than **1 hour** on **test.abc** ."
74+ summary : " Slurm jobs pending for more than 1 hour"
75+ description : " One or more Slurm jobs have been in the PENDING state for more than **1 hour**."
7376
7477 #
75- # 4. Slurm node drain / draining alert
78+ # 4. Slurm node drain alert (names node + reason)
7679 #
7780 - interval : 1m
7881 input_series :
7982 - series : obmondo_monitoring{certname="test.abc", alert_id="monitor::system::slurm::node_drain"}
8083 values : 1x200
81- - series : slurm_node_drain{certname="test.abc"}
84+ - series : slurm_node_drain_reason_info{certname="test.abc", node="node05", reason="Kill task failed", since="2026-06-12T19:06:20"}
85+ values : 1x200
86+ - series : slurm_node_status{certname="test.abc", node="node05", partition="batch*", status="drained"}
87+ values : 1x200
88+ - series : slurm_node_status{certname="test.abc", node="node05", partition="compute", status="drained"}
8289 values : 1x200
83- - series : slurm_node_draining{certname="test.abc"}
84- values : 0x200
8590
8691 alert_rule_test :
8792 - alertname : monitor::system::slurm::node_drain
@@ -91,6 +96,35 @@ tests:
9196 severity : warning
9297 certname : test.abc
9398 alert_id : monitor::system::slurm::node_drain
99+ node : node05
100+ reason : " Kill task failed"
101+ since : " 2026-06-12T19:06:20"
102+ exp_annotations :
103+ summary : " Slurm node **node05** in DRAIN state"
104+ description : " Slurm node **node05** is in DRAIN state for more than 10 minutes. Reason: Kill task failed (since 2026-06-12T19:06:20)."
105+
106+ #
107+ # 5. Slurm node error/fail alert
108+ #
109+ - interval : 1m
110+ input_series :
111+ - series : obmondo_monitoring{certname="test.abc", alert_id="monitor::system::slurm::node_error"}
112+ values : 1x200
113+ - series : slurm_node_status{certname="test.abc", node="node11", partition="batch*", status="error"}
114+ values : 1x200
115+ - series : slurm_node_status{certname="test.abc", node="node11", partition="compute", status="error"}
116+ values : 1x200
117+
118+ alert_rule_test :
119+ - alertname : monitor::system::slurm::node_error
120+ eval_time : 10m
121+ exp_alerts :
122+ - exp_labels :
123+ severity : critical
124+ certname : test.abc
125+ alert_id : monitor::system::slurm::node_error
126+ node : node11
127+ status : error
94128 exp_annotations :
95- summary : " Slurm node in DRAIN/DRAINING state on host **test.abc** "
96- description : " One or more Slurm nodes are in **DRAIN ** or **DRAINING ** state on **test.abc** for more than 10 minutes."
129+ summary : " Slurm node **node11** in ERROR/FAIL state"
130+ description : " Slurm node **node11 ** is in **error ** state for more than 10 minutes."
0 commit comments