基于湖库一体架构,统一管理结构化、半结构化与非结构化等多模态数据,一个系统承载事务处理、实时分析与 AI 工作负载。
obproxyd_process_dead OBProxy 守护进程不存在
更新时间:2026-04-14 11:55:54
告警描述
由 Agent 判断 OBProxy 守护进程(obproxyd.sh)是否存在,OCP 每秒获取一次进程存在的状态。返回 1 表示 obproxyd.sh 进程存在;返回 0 表示 obproxyd.sh 进程不存在,则触发该告警。
告警原理
下表列出了该告警监控逻辑中涉及的关键参数。
| 参数 | 值 |
|---|---|
| 监控指标 | obproxyd_process_exists 指标值表示 obproxyd.sh(obproxy 的守护进程) 进程是否存在,1 表示存在,0 表示不存在,为 0 时触发告警。 |
| 指标来源 | ps -ef|grep -w obproxyd.sh|grep -v grep|wc -l 该告警的指标来源相对特殊,是 OCP-Agent 执行上述 Linux 指令判断 OBProxy 守护进程是否存在。 |
| 采集指标 | obproxyd_process_exists |
| 监控表达式 | obproxyd_process_exists{app="ODP",@LABELS} |
| 采集周期 | 1 秒 |
规则信息
| 监控指标 | 默认阈值 | 持续时间 | 检测周期 | 消除周期 |
|---|---|---|---|---|
| obproxyd_process_exists | 0 (表示无法连接) | 0 秒 | 10 秒 | 5 分钟 |
告警信息
| 告警触发方式 | 告警等级 | 范围 |
|---|---|---|
| 基于监控指标的表达式 | 停服 | 服务器 |
告警模板
告警概述模板:${alarm_target} ${alarm_name}
告警详情模板:OBProxy 集群:${obproxy_cluster},主机:${host},告警:${alarm_name}
告警概述样例:obproxy_cluster_id=3:obproxy_cluster=obproxy_02:svr_ip=xxx.xxx.xxx.xxx OBProxy 守护进程不存在
告警详情样例:OBProxy 集群:obproxy_02,主机:xxx.xxx.xxx.xxx,告警:OBProxy 守护进程不存在
其中,${alarm_target} 表示产生告警的对象。格式为obproxy_cluster_id=xx:obproxy_cluster=xx:svr_ip=xx。obproxy_cluster_id 为产生告警的 OBProxy 集群 id,obproxy_cluster 为产生告警的 OBProxy 集群的名称,svr_ip 为产生告警的OBProxy 机器 IP。
对系统的影响
obproxyd.sh 进程监控 OBProxy 进程状态,当 OBProxy 异常退出,obproxyd.sh 进程会尝试重新启动 OBProxy 进程。若 obproxyd.sh 进程出现异常,此时若 OBProxy 进程也出现异常,无法保障 OBProxy 进程退出后被重新启动。
可能原因
常见于以下三种场景:
网络通信故障。
obproxyd.sh进程异常停止。obproxyd.sh进程存活但无响应,心跳不上报。
处理方法
检查 OBProxy 机器是否故障。
OBProxy 机器是否可启动。
是,执行步骤 2。
否,则是 OBProxy 机器故障导致进程不存在,建议替换该 OBProxy。
方法为:在该 OBProxy 集群中添加新的 OBProxy,然后再删除当前故障的 OBProxy。
使用 ssh 命令登录 OBProxy 机器看是否能正常登录。
是,可能是其他未知问题,请执行步骤 3。
否,则 OBProxy 机器繁忙,建议重启 OBProxy。
选择 OCP > OBProxy ,在集群列表中找到故障 OBProxy 所属集群,并单击集群名。
在 OBProxy 列表中找到故障 OBProxy 主机,并单击其对应 操作 列的 重启 。
若重启后仍无法连接,请执行步骤 3。
检查是否该 OBProxy 负载过高或网络不通等原因心跳不上报
参考如下命令检查进程状态和资源使用情况。
# 查看进程是否存活,若未存活请重新启动。 ps aux | grep obproxyd # 如果 CPU 内存等资源使用过高,OBProxy 可能无法正常工作。 # 查看 OBServer 节点的 CPU、内存使用率。 top -n 1 -p $(pgrep obproxyd) # 查看磁盘(数据盘、日志盘)剩余空间。 df | grep /data # 查看 OBServer 节点的网络连接数,若连接数为 0,可能网络故障。 netstat -anp | grep 2883 | wc -l若以上问题都没有则继续执行下一步。
可能是其他未知问题,请参考如下方法收集日志信息并联系技术支持。
收集 OBProxy 日志
一般而言,OBProxy 产生的 ERROR 日志会在 OCP 产生告警信息,可先到 OCP 告警事件页面查看是否存在 OBProxy 日志告警。
收集 OS 日志,在
/var/log/messages日志文件中搜索error关键字,观察系统返回的信息。