Skip to content

Commit bb4c01f

Browse files
committed
Merge pull request 'Added and updated the slurm alerts' (#1660) from slurm_test into master
Reviewed-on: https://gitea.obmondo.com/EnableIT/KubeAid/pulls/1660
2 parents d31c1cf + 7104cac commit bb4c01f

2 files changed

Lines changed: 73 additions & 26 deletions

File tree

argocd-helm-charts/prometheus-linuxaid/rules/slurm.yaml

Lines changed: 24 additions & 11 deletions
Original file line numberDiff line numberDiff line change
@@ -3,27 +3,27 @@ groups:
33
rules:
44
- alert: monitor::system::slurm::job_failed
55
expr: |
6-
slurm_job_failed > 0
6+
slurm_jobs_failed > 0
77
and on(certname) obmondo_monitoring{alert_id="monitor::system::slurm::job_failed"} > 0
88
for: 10m
99
labels:
1010
severity: warning
1111
alert_id: monitor::system::slurm::job_failed
1212
annotations:
13-
summary: "Slurm job failure detected on host **{{ .Labels.certname }}**"
14-
description: "One or more Slurm jobs have failed on **{{ .Labels.certname }}**."
13+
summary: "Slurm job failure detected"
14+
description: "One or more Slurm jobs have failed."
1515

1616
- alert: monitor::system::slurm::nodes_down
1717
expr: |
18-
slurm_nodes_down > 0
18+
max by (certname, node) (slurm_node_status{status=~"down.*"}) == 1
1919
and on(certname) obmondo_monitoring{alert_id="monitor::system::slurm::nodes_down"} > 0
2020
for: 15m
2121
labels:
2222
severity: critical
2323
alert_id: monitor::system::slurm::nodes_down
2424
annotations:
25-
summary: "Slurm nodes are down for **{{ .Labels.certname }}**"
26-
description: "One or more Slurm nodes are reported as down on **{{ .Labels.certname }}**."
25+
summary: "Slurm node **{{ .Labels.node }}** is DOWN"
26+
description: "Slurm node **{{ .Labels.node }}** is reported as DOWN for more than 15 minutes."
2727

2828
- alert: monitor::system::slurm::jobs_pending
2929
expr: |
@@ -34,17 +34,30 @@ groups:
3434
severity: warning
3535
alert_id: monitor::system::slurm::jobs_pending
3636
annotations:
37-
summary: "Slurm jobs pending for more than 1 hour on host **{{ .Labels.certname }}**"
38-
description: "One or more Slurm jobs have been in the PENDING state for more than **1 hour** on **{{ .Labels.certname }}**."
37+
summary: "Slurm jobs pending for more than 1 hour"
38+
description: "One or more Slurm jobs have been in the PENDING state for more than **1 hour**."
3939

4040
- alert: monitor::system::slurm::node_drain
4141
expr: |
42-
(slurm_node_drain > 0 or slurm_node_draining > 0)
42+
slurm_node_drain_reason_info == 1
43+
and on(certname, node) max by (certname, node) (slurm_node_status{status=~"drain.*"}) == 1
4344
and on(certname) obmondo_monitoring{alert_id="monitor::system::slurm::node_drain"} > 0
4445
for: 10m
4546
labels:
4647
severity: warning
4748
alert_id: monitor::system::slurm::node_drain
4849
annotations:
49-
summary: "Slurm node in DRAIN/DRAINING state on host **{{ .Labels.certname }}**"
50-
description: "One or more Slurm nodes are in **DRAIN** or **DRAINING** state on **{{ .Labels.certname }}** for more than 10 minutes."
50+
summary: "Slurm node **{{ .Labels.node }}** in DRAIN state"
51+
description: "Slurm node **{{ .Labels.node }}** is in DRAIN state for more than 10 minutes. Reason: {{ .Labels.reason }} (since {{ .Labels.since }})."
52+
53+
- alert: monitor::system::slurm::node_error
54+
expr: |
55+
max by (certname, node, status) (slurm_node_status{status=~"(err|fail|inval).*"}) == 1
56+
and on(certname) obmondo_monitoring{alert_id="monitor::system::slurm::node_error"} > 0
57+
for: 10m
58+
labels:
59+
severity: critical
60+
alert_id: monitor::system::slurm::node_error
61+
annotations:
62+
summary: "Slurm node **{{ .Labels.node }}** in ERROR/FAIL state"
63+
description: "Slurm node **{{ .Labels.node }}** is in **{{ .Labels.status }}** state for more than 10 minutes."

argocd-helm-charts/prometheus-linuxaid/tests/slurm.yaml

Lines changed: 49 additions & 15 deletions
Original file line numberDiff line numberDiff line change
@@ -12,7 +12,7 @@ tests:
1212
input_series:
1313
- series: obmondo_monitoring{certname="test.abc", alert_id="monitor::system::slurm::job_failed"}
1414
values: 1x200
15-
- series: slurm_job_failed{certname="test.abc"}
15+
- series: slurm_jobs_failed{certname="test.abc"}
1616
values: 1x200
1717

1818
alert_rule_test:
@@ -24,8 +24,8 @@ tests:
2424
certname: test.abc
2525
alert_id: monitor::system::slurm::job_failed
2626
exp_annotations:
27-
summary: "Slurm job failure detected on host **test.abc**"
28-
description: "One or more Slurm jobs have failed on **test.abc**."
27+
summary: "Slurm job failure detected"
28+
description: "One or more Slurm jobs have failed."
2929

3030
#
3131
# 2. Slurm nodes_down alert
@@ -34,8 +34,10 @@ tests:
3434
input_series:
3535
- series: obmondo_monitoring{certname="test.abc", alert_id="monitor::system::slurm::nodes_down"}
3636
values: 1x200
37-
- series: slurm_nodes_down{certname="test.abc"}
38-
values: 2x200
37+
- series: slurm_node_status{certname="test.abc", node="node11", partition="batch*", status="down*"}
38+
values: 1x200
39+
- series: slurm_node_status{certname="test.abc", node="node11", partition="compute", status="down*"}
40+
values: 1x200
3941

4042
alert_rule_test:
4143
- alertname: monitor::system::slurm::nodes_down
@@ -45,9 +47,10 @@ tests:
4547
severity: critical
4648
certname: test.abc
4749
alert_id: monitor::system::slurm::nodes_down
50+
node: node11
4851
exp_annotations:
49-
summary: "Slurm nodes are down for **test.abc**"
50-
description: "One or more Slurm nodes are reported as down on **test.abc**."
52+
summary: "Slurm node **node11** is DOWN"
53+
description: "Slurm node **node11** is reported as DOWN for more than 15 minutes."
5154

5255
#
5356
# 3. Slurm jobs_pending alert (pending > 1 hour)
@@ -68,20 +71,22 @@ tests:
6871
certname: test.abc
6972
alert_id: monitor::system::slurm::jobs_pending
7073
exp_annotations:
71-
summary: "Slurm jobs pending for more than 1 hour on host **test.abc**"
72-
description: "One or more Slurm jobs have been in the PENDING state for more than **1 hour** on **test.abc**."
74+
summary: "Slurm jobs pending for more than 1 hour"
75+
description: "One or more Slurm jobs have been in the PENDING state for more than **1 hour**."
7376

7477
#
75-
# 4. Slurm node drain / draining alert
78+
# 4. Slurm node drain alert (names node + reason)
7679
#
7780
- interval: 1m
7881
input_series:
7982
- series: obmondo_monitoring{certname="test.abc", alert_id="monitor::system::slurm::node_drain"}
8083
values: 1x200
81-
- series: slurm_node_drain{certname="test.abc"}
84+
- series: slurm_node_drain_reason_info{certname="test.abc", node="node05", reason="Kill task failed", since="2026-06-12T19:06:20"}
85+
values: 1x200
86+
- series: slurm_node_status{certname="test.abc", node="node05", partition="batch*", status="drained"}
87+
values: 1x200
88+
- series: slurm_node_status{certname="test.abc", node="node05", partition="compute", status="drained"}
8289
values: 1x200
83-
- series: slurm_node_draining{certname="test.abc"}
84-
values: 0x200
8590

8691
alert_rule_test:
8792
- alertname: monitor::system::slurm::node_drain
@@ -91,6 +96,35 @@ tests:
9196
severity: warning
9297
certname: test.abc
9398
alert_id: monitor::system::slurm::node_drain
99+
node: node05
100+
reason: "Kill task failed"
101+
since: "2026-06-12T19:06:20"
102+
exp_annotations:
103+
summary: "Slurm node **node05** in DRAIN state"
104+
description: "Slurm node **node05** is in DRAIN state for more than 10 minutes. Reason: Kill task failed (since 2026-06-12T19:06:20)."
105+
106+
#
107+
# 5. Slurm node error/fail alert
108+
#
109+
- interval: 1m
110+
input_series:
111+
- series: obmondo_monitoring{certname="test.abc", alert_id="monitor::system::slurm::node_error"}
112+
values: 1x200
113+
- series: slurm_node_status{certname="test.abc", node="node11", partition="batch*", status="error"}
114+
values: 1x200
115+
- series: slurm_node_status{certname="test.abc", node="node11", partition="compute", status="error"}
116+
values: 1x200
117+
118+
alert_rule_test:
119+
- alertname: monitor::system::slurm::node_error
120+
eval_time: 10m
121+
exp_alerts:
122+
- exp_labels:
123+
severity: critical
124+
certname: test.abc
125+
alert_id: monitor::system::slurm::node_error
126+
node: node11
127+
status: error
94128
exp_annotations:
95-
summary: "Slurm node in DRAIN/DRAINING state on host **test.abc**"
96-
description: "One or more Slurm nodes are in **DRAIN** or **DRAINING** state on **test.abc** for more than 10 minutes."
129+
summary: "Slurm node **node11** in ERROR/FAIL state"
130+
description: "Slurm node **node11** is in **error** state for more than 10 minutes."

0 commit comments

Comments
 (0)