---
title: "host_unavailable 主机心跳检测失败 - 云平台 OCP V4.3.0 | OceanBase 文档中心"
description: host_unavailable 主机心跳检测失败 告警描述 OCP 每 30 秒对服务器上的 ocp_mgragent 进行心跳探活，超时时间为 5 秒（通过系统参数 ocp.check.host.http.read.timeout 配置）。如果心跳探测没有响应则触发该告警；可能存在网络不通问题，影响该主机的运维和…
image: https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*OSPzQ6GUQF4AAAAAQHAAAAgAeiGDAQ/original
---
切换语言

- 中文站 - 简体中文
- International - English
- 日本站 - 日本語

文档反馈![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*lJTmRZ61jSUAAAAAAAAAAAAADiGDAQ/original) 云平台 OCPV 4.3.0

# host_unavailable 主机心跳检测失败

更新时间：2026-04-14 11:55:54

[编辑](https://github.com/oceanbase/ocp-doc/edit/V4.3.0/zh-CN/1900.reference-guide/100.alarm-reference/300.application-alert/1900.host_unavailable.md)  

## 告警描述

OCP 每 30 秒对服务器上的 ocp_mgragent 进行心跳探活，超时时间为 5 秒（通过系统参数 `ocp.check.host.http.read.timeout` 配置）。如果心跳探测没有响应则触发该告警；可能存在网络不通问题，影响该主机的运维和监控信息收集，需要重点关注。

## 告警原理

OCP-Server 每 30 秒执行一次心跳探测任务，该任务请求 ocp_mgragent 的状态接口（`http://ip:62888/api/v1/agent/status`），接口返回 OCP-Agent 各个进程的状态信息。当接口没有响应或执行出现错误，故障持续时长超过 1 分钟触发告警。

#### 说明

告警检测时长在 V3.3.2 之前版本由系统参数控制： `ocp.host.check.unavailable-time-threshold`，该参数表示 OCP Agent 的最大离线时长，单位为毫秒，离线超过此时长则发送主机心跳检测失败告警。

## 规则信息

| 监控指标 | 默认阈值（单位：毫秒） | 持续时间 | 检测周期 | 消除周期 |
| --- | --- | --- | --- | --- |
| NA | 60000 | 0 秒 | 15 秒 | 5 分钟 |

## 告警信息

| 告警触发方式 | 告警等级 | 范围 |
| --- | --- | --- |
| OCP 定时任务 | 停服 | 主机 |

## 告警模板

- 告警概述模板：${alarm_target} ${alarm_name}
 - 告警详情模板：集群：${ob_cluster_name}，主机：${host}，告警：${alarm_name}。失败原因：${failed_reason}，请检查 ocp_mgragent 进程是否正常，或者主机 ${host} 是否可以访问。
 - 告警概述样例：service=OCP:svr_ip=xxx.xxx.xxx.xxx 主机心跳检测失败
 - 告警详情样例：集群：xxx，主机：xxx.xxx.xxx.xxx，告警：主机心跳检测失败。失败原因：connect to agent failed, SocketTimeoutException: Read timed out，请检查 ocp_mgragent 进程是否正常，或者主机 xxx.xxx.xxx.xxx 是否可以访问。

其中，${alarm_target} 的格式为 ob_cluster=xxxxxxx:svr_ip=xxxxxx。svr_ip 为产生告警的集群中对应 OBServer 节点的 IP。

## 对系统的影响

OCP 无法向目标机器发送远程命令，对应机器的运维功能则不可用。

## 可能原因

常见于以下原因：

- 目标机器异常宕机。
 - OCP 与主机之间的网络通讯故障。
 - OCP-Agent 异常退出。

## 处理方法

1. 确认目标机器是否宕机。

   尝试登录目标主机，或在同网段的主机上执行 `ping xxx.xxx.xxx.xxx` 命令， xxx.xxx.xxx.xxx 为目标主机 IP。

      - 若无法登录或 `ping` 命令执行后无数据发送成功的回显信息，则目标主机大概率是宕机了。

       请联系机房运维工程师解决。
      - 若能登录也能 ping 通，则主机正常，可能是其他原因触发的告警。
 2. 确认是否 OCP 与主机之间的网络通讯故障。联系网络工程师解决。

   在 OCP 主机上 ping 故障主机，然后再到故障主机上 ping OCP 主机。

      - 若能相互 ping 通，则网络无故障，可能是其他原因触发告警。
      - 若不能相互 ping 通，则网络故障，建议联系网络工程师解决。若无网络工程师可参考 [网络故障排查](https://www.oceanbase.com/docs/common-ocp-1000000000827201) 排查故障原因。
 3. 确认是否 ocp_mgragent 进程不存在。

   在 OCP 上通过 **主机** 界面的 **主机列表** 进入故障主机，在 **OCP Agent** 页签查看是否有进程异常。

      - 若有异常可通过进程列表中的 重启 按钮重启该进程。也可参照附录中 [OCP-Agent 运维脚本](https://www.oceanbase.com/docs/common-ocp-1000000000826484) 重启 OCP-Agent ，恢复 OCP-Agent 服务。
      - 若无异常，且告警依然未恢复。请执行下一步。
 4. 联系技术支持人员帮忙定位。

 上一篇 下一篇 ![有帮助](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*y6ocSqN8cqsAAAAAAAAAAAAAARQnAQ)![无帮助](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*BG9IQJyLHF8AAAAAAAAAAAAAARQnAQ)![反馈](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*eTWdQKCRKHwAAAAAAAAAAAAAARQnAQ)[AI](https://www.oceanbase.com/obi) 咨询热线
