首批通过分布式安全可靠测评,为关键业务系统打造
obproxyd_process_stop OBProxy 守护进程停止
更新时间:2026-04-14 15:15:57
告警描述
监测 OBProxy 守护进程是否停止。
OCP-Agent 进程监控 OceanBase 相关组件进程的 uptime(进程运行时长),当 uptime 归 0 后,可以认为进程停止了。这个告警只代表进程停止过,并不能说明进程长时间停止运行。如果进程长时间停止,会有其他状态类告警。
相关进程包括:
- observer:告警项为 observer_process_stop
- obproxy:告警项为 obproxy_process_stop
- obproxyd.sh:告警项为 obproxyd_process_stop
- ocp_agentd:告警项为 agentd_process_stop
- ocp_mgragent:告警项为 mgragent_process_stop
- ocp_monagent:告警项为 monagent_process_stop
告警原理
| 参数 | 值 |
|---|---|
| 监控指标 | obproxyd_uptime_delta_seconds |
| 指标来源 | 读取进程的 proc 文件(/proc/[pid]/stat),获取进程创建时间(第14列为创建时间)。当前时间与进程创建时间之差即为进程 uptime。 |
| 采集指标 | process_uptime_seconds |
| 监控表达式 | 0 - min(delta(process_uptime_seconds{name="obproxyd.sh",@LABELS}[@INTERVAL])) by (@GBLABELS) |
| 采集周期 | 5 秒 |
规则信息
| 监控表达式 | 监控指标含义 | 默认阈值 | 检测周期 | 消除周期 |
|---|---|---|---|---|
| obproxyd_uptime_delta_seconds > 0 | 取 uptime 的负值,当监控指标大于 0,表示进程停止。 | 0 秒 | 10 秒 | 5 分钟 |
告警信息
| 告警触发方式 | 告警等级 | 范围 |
|---|---|---|
| 基于监控指标的表达式 | 警告 | OBProxy |
告警模板
告警概述
- 模板:
${alarm_target} ${alarm_name} - 样例:
alarm_template_id=0:obproxy_cluster=ODPT2-2000005:host=xxx.xxx.xxx.xxx OBProxy 守护进程停止
- 模板:
告警详情
- 模板:
OBProxy集群:${obproxy_cluster},主机:${host},告警:${alarm_name}。进程已运行时长:${value_shown}。 - 样例:
OBProxy集群:ODPT2,主机:xxx.xxx.xxx.xxx,告警:OBProxy 守护进程停止。进程已运行时长:1 天 15 小时 12 分 51 秒。
- 模板:
对系统的影响
OBProxy 进程停止之后会被守护进程(obproxyd.sh)拉起,如果守护进程不能启动,将无法保证 OBProxy 意外退出后被拉起,业务受损时间会被延长。
应尽量保证 OBProxy 在线并提供服务,减少业务受损时长。
可能原因
无常见原因
处理方法
手动拉起 OBProxy 守护进程。因重启 OBProxy 对业务有损,尽量避免在 OCP 白屏重启 OBProxy。
cd /opt/taobao/install/obproxy-3.4.0 && bin/obproxyd.sh -c start -r /home/admin/logs/obproxy -n ODPT2 -p 2883