基于湖库一体架构,统一管理结构化、半结构化与非结构化等多模态数据,一个系统承载事务处理、实时分析与 AI 工作负载。
host_ntp_service_not_exist 服务器时钟同步服务不存在
更新时间:2026-05-05 09:06:54
告警描述
当 OCP 管理的服务器上无时钟同步服务(Chrony 或 NTP)时触发该告警。
告警原理
下表列出了该告警监控逻辑中涉及的关键参数。
| 参数 | 值 |
|---|---|
| 监控指标 | ntp_service_exist、ntp_service_available,其中:1 时表示存在,指标值为 0 时表示不存在。1 时表示可用,指标值为 0 时表示不可用。0 时触发告警。 |
| 监控表达式 | max(process_exists{name="ntpd",@LABELS}) by (@GBLABELS) + max(process_exists{name="chronyd",@LABELS}) by (@GBLABELS)min(ntp_service_available{@LABELS}) by (@GBLABELS) |
| 采集指标 | ntp_service_exist、ntp_service_available |
| 指标来源 | 该告警的指标来源相对特殊,由 OCP-Agent 通过 pgrep chronyd 命令检查本机时钟同步服务,包括检查 Chrony 服务是否存在 pgrep ntpd 和 检查 NTP 服务是否存在,默认本机使用的 Chrony 服务同步时钟,所以 OCP-Agent 按照先 Chrony 后 NTP 的顺序检查时钟同步服务是否存在。 |
| 采集周期 | 5 秒 |
规则信息
| 监控指标 | 默认阈值 | 持续时间 | 检测周期 | 消除周期 |
|---|---|---|---|---|
| ntp_service_exist == 0 or ntp_service_available == 0 | 0 秒 | 10 秒 | 5 分钟 |
告警信息
| 告警触发方式 | 告警等级 | 范围 |
|---|---|---|
| 基于监控指标的表达式 | 严重 | 主机 |
告警模板
告警概述
- 模板:${alarm_target} ${alarm_name}
- 样例:alarm_template_id=0:host=xxx.xxx.xxx.xxx 服务器时钟同步服务不存在
告警详情
- 模板:集群:${ob_cluster_name},主机:${host},告警:${alarm_name}。服务器时钟同步服务(ntp 或 chrony)不存在。
- 样例:集群:obcluster-1,主机:xxx.xxx.xxx.xxx,告警:服务器时钟同步服务不存在。服务器时钟同步服务(ntp 或 chrony)不存在。
告警恢复
- 模板:告警:${alarm_name},服务器时钟同步服务不存在:${recover_value}
- 样例:告警:服务器时钟同步服务不存在,服务器时钟同步服务不存在:1
其中,${alarm_target} 表示产生告警的对象,格式为 svr_ip=xx.xx.xx.xx。
对系统的影响
运行一段时间后服务器之间可能会出现时钟不同步,进而导致 OceanBase 集群不可用。
可能原因
服务器未安装时钟同步服务(Chrony 或 NTP)。
服务器时钟同步的进程(chronyd 或 ntpd)异常退出。
处理方法
执行如下命令确认服务器是否未安装时钟同步服务(Chrony 或 NTP)。
rpm -qa|grep chrony #检查是否安装了 Chrony 服务 rpm -qa|grep ntp #检查是否安装了 NTP 服务若返回相关版本信息,则已安装该服务。请继续执行步骤 2。
若无返回信息,则未安装该服务。若 Chrony 和 NTP 服务均未安装,请先安装时钟同步服务。
Chrony 和 NTP 服务的安装与配置可参考互联网上分享的案例。此处只做简要说明。
执行如下命令安装时钟同步服务,Chrony 或 NTP 中任选一个安装即可。
yum install -y chrony #安装 Chrony 服务 yum install -y ntp #安装 NTP 服务执行如下命令启动时钟同步服务。
systemctl start chronyd #启动 Chrony 服务 systemctl start ntpd #启动 NTP 服务手动清除告警后,观察告警是否还会上报。若仍上报,请执行步骤 3。
执行如下命令检查时钟同步进程(chronyd 或 ntpd)是否异常退出。
systemctl status chronyd #检查 Chrony 服务状态 systemctl status ntpd #检查 NTP 服务状态若返回值信息中 Active 信息为 active(running),则继续执行步骤 3。
若返回值信息中 Active 信息为 inactive(dead),则时钟同步服务异常。尝试如下方法重启服务。
systemctl restart chronyd #重启 Chrony 服务 systemctl restart ntpd #重启 NTP 服务重启服务后,手动清除告警并观察告警是否还会上报。若仍上报,请执行步骤 3。
其他原因,请联系技术支持人员定位。