首批通过分布式安全可靠测评,为关键业务系统打造
obproxy_process_stop OBProxy 进程停止
更新时间:2026-04-14 11:55:54
告警描述
监测 OBProxy 进程是否停止。
OCP-Agent 进程监控 OceanBase 相关组件进程的启动时间戳,如果时间戳发生变动就可以认为进程发生停止或重启。这个告警只代表进程停止过,并不能说明进程长时间停止运行。如果进程长时间停止,会有其他状态类告警。
相关进程包括:
- observer:告警项为 observer_process_stop
- obproxy:告警项为 obproxy_process_stop
- obproxyd.sh:告警项为 obproxyd_process_stop
- ocp_agentd:告警项为 agentd_process_stop
- ocp_mgragent:告警项为 mgragent_process_stop
- ocp_monagent:告警项为 monagent_process_stop
告警原理
| 参数 | 值 |
|---|---|
| 监控指标 | obproxy_boot_time_delta_seconds |
| 指标来源 | 系统的 boot time + 进程距离系统重启的时间差值就是进程的启动时间。其中,系统的 boot time 等于命令 cat /proc/stat 返回结果的 btime 值;进程距离系统重启的时间差值等于命令 cat /proc/pid/stat 返回结果的第 22 列数字除以 100 后的值 |
| 采集指标 | process_boot_time_seconds |
| 监控表达式 | max(delta(process_boot_time_seconds{name="obproxy",@LABELS}[@INTERVAL])) by (@GBLABELS) |
| 采集周期 | 5 秒 |
规则信息
| 监控表达式 | 监控指标含义 | 默认阈值 | 检测周期 | 消除周期 |
|---|---|---|---|---|
| obproxy_boot_time_delta_seconds > 0 | 当监控指标大于 0,表示进程停止。 | 0 秒 | 30 秒 | 5 分钟 |
告警信息
| 告警触发方式 | 告警等级 | 范围 |
|---|---|---|
| 基于监控指标的表达式 | 停服 | OBProxy |
告警模板
告警概述
- 模板:
${alarm_target} ${alarm_name} - 样例:
alarm_template_id=0:obproxy_cluster=ODPT2-2000005:host=xxx.xxx.xxx.xxx OBProxy 进程停止
- 模板:
告警详情
- 模板:
集群:BProxy集群:${obproxy_cluster},主机:${host},告警:${alarm_name}。进程已运行时长:${value_shown}。 - 样例:
OBProxy集群:ODPT2,主机:xxx.xxx.xxx.xxx,告警:OBProxy 进程停止。进程已运行时长:1 天 15 小时 12 分 51 秒。
- 模板:
对系统的影响
OBProxy 进程停止之后会被守护进程(obproxyd.sh)拉起,但是对业务会有影响。业务连接被断开,业务受损,如 qps下跌。
可能原因
- OBProxy 进程内存超过限制
- 其他意外情况
处理方法
OBProxy 进程停止后,应急方法为尝试拉起进程。一般情况下会被守护进程拉起,如果守护进程意外停止,需要手动拉起守护进程:
cd /opt/taobao/install/obproxy-3.4.0 && bin/obproxyd.sh -c start -r /home/admin/logs/obproxy -n ODPT2 -p 2883如果守护进程存在,OBProxy 进程不存在,则手动也可能无法启动 OBProxy 进程,需要排查:
configurl-server(OCP 可提供该服务,也可能是其他服务)是否正常;如果OBProxy 启动模式为 configurl,应确保 configurl-server 正常。
捞取 OBProxy 进程的错误日志,捞取 coredump 文件,联系 OceanBase 技术支持人员。