首批通过分布式安全可靠测评,为关键业务系统打造
agentd_process_stop ocp_agentd 进程停止
更新时间:2026-04-14 11:55:54
告警描述
监测 ocp_agentd 进程是否停止。
OCP-Agent 进程监控 OceanBase 相关组件进程的启动时间戳,如果时间戳发生变动就可以认为进程发生停止或重启。这个告警只代表进程停止过,并不能说明进程长时间停止运行。如果进程长时间停止,会有其他状态类告警。
相关进程包括:
- observer:告警项为 observer_process_stop
- obproxy:告警项为 obproxy_process_stop
- obproxyd.sh:告警项为 obproxyd_process_stop
- ocp_agentd:告警项为 agentd_process_stop
- ocp_mgragent:告警项为 mgragent_process_stop
- ocp_monagent:告警项为 monagent_process_stop
告警原理
| 参数 | 值 |
|---|---|
| 监控指标 | agentd_boot_time_delta_seconds |
| 指标来源 | 系统的 boot time + 进程距离系统重启的时间差值就是进程的启动时间。其中,系统的 boot time 等于命令 cat /proc/stat 返回结果的 btime 值;进程距离系统重启的时间差值等于命令 cat /proc/pid/stat 返回结果的第 22 列数字除以 100 后的值 |
| 采集指标 | process_boot_time_seconds |
| 监控表达式 | max(delta(process_boot_time_seconds{name="ocp_agentd",@LABELS}[@INTERVAL])) by (@GBLABELS) |
| 采集周期 | 5 秒 |
规则信息
| 监控表达式 | 监控指标含义 | 默认阈值 | 检测周期 | 消除周期 |
|---|---|---|---|---|
| agentd_boot_time_delta_seconds > 0 | 当监控指标大于 0,表示进程停止。 | 0 秒 | 10 秒 | 5 分钟 |
告警信息
| 告警触发方式 | 告警等级 | 范围 |
|---|---|---|
| 基于监控指标的表达式 | 警告 | 主机 |
告警模板
告警概述
- 模板:
${alarm_target} ${alarm_name} - 样例:
alarm_template_id=0:ob_cluster=AdminMETA-12:host=xxx.xxx.xxx.xxx ocp_agentd 进程停止
- 模板:
告警详情
- 模板:
集群:${ob_cluster_name},主机:${host},告警:${alarm_name}。进程已运行时长:${value_shown}。 - 样例:
集群:AdminMETA,主机:xxx.xxx.xxx.xxx,告警:ocp_agentd 进程停止。进程已运行时长:34 分 8 秒。
- 模板:
对系统的影响
ocp_agentd 是 OCP-Agent 运维进程(ocp_mgragent)、监控进程(ocp_monagent)的守护进程,该进程停止后如果未启动,此时其守护的进程意外退出后将无法被拉起。影响范围可参考 agent 服务不可用。
可能原因
- 进程 BUG,导致执行错误,意外退出。
- 预期内的主动运维,白屏重启 agent。
处理方法
进程 BUG 导致,会在 ocp_agentd.error.log 中记录日志,可以搜多 panic 关键字确认。此时可以尝试启动进程(守护进程会尝试拉起,若失败请人工拉起)。
/home/admin/ocp_agentctl restart