基于湖库一体架构,统一管理结构化、半结构化与非结构化等多模态数据,一个系统承载事务处理、实时分析与 AI 工作负载。
host_unavailable 主机心跳检测失败
更新时间:2026-04-14 11:55:54
告警描述
OCP 每 30 秒对服务器上的 ocp_mgragent 进行心跳探活,超时时间为 5 秒(通过系统参数 ocp.check.host.http.read.timeout 配置)。如果心跳探测没有响应则触发该告警;可能存在网络不通问题,影响该主机的运维和监控信息收集,需要重点关注。
告警原理
OCP-Server 每 30 秒执行一次心跳探测任务,该任务请求 ocp_mgragent 的状态接口(http://ip:62888/api/v1/agent/status),接口返回 OCP-Agent 各个进程的状态信息。当接口没有响应或执行出现错误,故障持续时长超过 1 分钟触发告警。
说明
告警检测时长在 V3.3.2 之前版本由系统参数控制: ocp.host.check.unavailable-time-threshold,该参数表示 OCP Agent 的最大离线时长,单位为毫秒,离线超过此时长则发送主机心跳检测失败告警。
规则信息
| 监控指标 | 默认阈值(单位:毫秒) | 持续时间 | 检测周期 | 消除周期 |
|---|---|---|---|---|
| NA | 60000 | 0 秒 | 15 秒 | 5 分钟 |
告警信息
| 告警触发方式 | 告警等级 | 范围 |
|---|---|---|
| OCP 定时任务 | 停服 | 主机 |
告警模板
告警概述模板:${alarm_target} ${alarm_name}
告警详情模板:集群:${ob_cluster_name},主机:${host},告警:${alarm_name}。失败原因:${failed_reason},请检查 ocp_mgragent 进程是否正常,或者主机 ${host} 是否可以访问。
告警概述样例:service=OCP:svr_ip=xxx.xxx.xxx.xxx 主机心跳检测失败
告警详情样例:集群:xxx,主机:xxx.xxx.xxx.xxx,告警:主机心跳检测失败。失败原因:connect to agent failed, SocketTimeoutException: Read timed out,请检查 ocp_mgragent 进程是否正常,或者主机 xxx.xxx.xxx.xxx 是否可以访问。
其中,${alarm_target} 的格式为 ob_cluster=xxxxxxx:svr_ip=xxxxxx。svr_ip 为产生告警的集群中对应 OBServer 节点的 IP。
对系统的影响
OCP 无法向目标机器发送远程命令,对应机器的运维功能则不可用。
可能原因
常见于以下原因:
目标机器异常宕机。
OCP 与主机之间的网络通讯故障。
OCP-Agent 异常退出。
处理方法
确认目标机器是否宕机。
尝试登录目标主机,或在同网段的主机上执行
ping xxx.xxx.xxx.xxx命令, xxx.xxx.xxx.xxx 为目标主机 IP。若无法登录或
ping命令执行后无数据发送成功的回显信息,则目标主机大概率是宕机了。请联系机房运维工程师解决。
若能登录也能 ping 通,则主机正常,可能是其他原因触发的告警。
确认是否 OCP 与主机之间的网络通讯故障。联系网络工程师解决。
在 OCP 主机上 ping 故障主机,然后再到故障主机上 ping OCP 主机。
若能相互 ping 通,则网络无故障,可能是其他原因触发告警。
若不能相互 ping 通,则网络故障,建议联系网络工程师解决。若无网络工程师可参考 网络故障排查 排查故障原因。
确认是否 ocp_mgragent 进程不存在。
在 OCP 上通过 主机 界面的 主机列表 进入故障主机,在 OCP Agent 页签查看是否有进程异常。
若有异常可通过进程列表中的 重启 按钮重启该进程。也可参照附录中 OCP-Agent 运维脚本 重启 OCP-Agent ,恢复 OCP-Agent 服务。
若无异常,且告警依然未恢复。请执行下一步。
联系技术支持人员帮忙定位。