基于湖库一体架构,统一管理结构化、半结构化与非结构化等多模态数据,一个系统承载事务处理、实时分析与 AI 工作负载。
ob_cluster_merge_error OceanBase 集群合并出错
更新时间:2025-05-21 11:30:53
告警描述
该告警监测 OCP 管理每个 OceanBase 集群合并是否正常,若有合并出错则上报告警。
告警原理
下表列出了该告警监控逻辑中涉及的关键参数。
| 参数 | 值 |
|---|---|
| 监控指标 | merge_error_flag |
| 指标来源 | SQL:select /*+ MONITOR_AGENT READ_CONSISTENCY(WEAK) */ zone, name, value, time_to_usec(now()) as current from __all_zone |
| 采集指标 | zone_value |
| 监控表达式 | max(ob_zone_stat{name="is_merge_error",@LABELS}) by (@GBLABELS) |
| 采集周期 | 1 秒 |
无论是自动发起还是人工发起的合并,失败后会设置标志位并将合并状态更新到 __all_zone 表中。其中采集指标值取自 __all_zone 表的 value 字段值,其他字段值作为 LABELS。
监控指标 的值表示集群合并是否出错。当值为 0 时,表示该集群合并正常。当值为 1 时,表示集群合并出错。
当监控指标值为 1 时触发告警。
规则信息
| 监控指标 | 默认阈值 | 持续时间 | 检测周期 | 消除周期 |
|---|---|---|---|---|
| merge_error_flag | 1 | 0 秒 | 10 秒 | 5 分钟 |
告警信息
| 告警触发方式 | 告警等级 | 范围 |
|---|---|---|
| 基于监控指标的表达式 | 严重 | 集群 |
告警模板
告警概述模板:${alarm_target} ${alarm_name}
告警详情模板:集群:${ob_cluster_name},告警:${alarm_name}
告警概述样例:ob_cluster=obcluster-1 OceanBase 集群合并出错
告警详情样例:集群:obcluster-1,告警:OceanBase 集群合并出错
对系统的影响
该 OceanBase 集群部分副本数据不一致,如副本之间不一致或主表与索引表之间不一致。
主备 OceanBase 集群不允许进行主备切换,否则故障将传递给关系集群。
可能原因
理论上存在的极端场景,无常见原因。
处理方法
请 OceanBase 集群合并异常处理 排查具体问题。
处理不当可能会导致数据不一致,如非专业人员,请联系技术支持解决。