首批通过分布式安全可靠测评,为关键业务系统打造
OceanBase 数据库集群重启后有可能分区状态丢失、集群不可用风险
更新时间:2026-07-31 09:11
问题现象
在 OceanBase 数据库 V2.2.77 BP10,V2.2.77 BP11 版本上,当进行 OBServer 重启或者整个集群重启时,如果 slog 文件大于 1 个,会造成遗漏回放,造成节点上的分区状态落后。直接现象是在多次尝试启动 OBSserver 启动不起来报错 observer start fail(ret=-4000) : the log sequence is not continuous。也有可能 OBServer 虽然可以启动起来但是由于分区状态和 clog 状态不一致引起的其他报错。
当集群是多副本部署时,如果只是重启一台 OBServer,遇到重启不起来的,可以通过永久下线补机器来规避。OceanBase 数据库内部也有可能会通过 rebuild 或补副本的方式自动修补了问题。所以用户并不感知问题。
但是如果进行了运维操作,进行集群机器轮流重启的场景,最差的情况会有可能集群不可用,没有规避方式,会比较危险。需要尽快升级到 OceanBase 数据库 V2.2.77 BP11 Hotfix 版本。
关键诊断信息
触发条件
当进行 OBServer 重启或者整个集群重启时,如果 slog 文件大于 1 个。
问题原因
OceanBase 数据库在 V2.2.77 BP10 版本上支持 SLOG 的 IO 4K 对齐功能后,引入了一个重启场景下会遇到的 BUG。
问题的风险及影响
OceanBase 数据库 V2.2.77 BP10 版本上支持 SLOG 的 IO 4K 对齐功能后,引入了一个重启场景下会遇到的 BUG。
OceanBase 数据库 V2.2.77 BP10 版本的集群如果在短时间内进行了集群重启,会可能会有分区状态丢失的风险。
当集群是多副本部署时,如果只是重启一台 OBServer 遇到重启不起来的,可以通过永久下线补机器来规避。但是如果进行了运维操作,进行集群机器轮流重启的场景,最差的情况会有可能集群不可用,没有规避方式,会比较危险。需要尽快升级到 OceanBase 数据库 V2.2.77 BP11 Hotfix 版本。
影响租户
影响 OceanBase 数据库中的 SYS 租户和 Oracle 租户以及 MySQL 租户。
影响的版本
OceanBase 数据库企业版 V2.2.77 BP10(oceanbase-2.2.77-20220116224111)及之后版本。
解决方法及规避方式
升级至问题已修复版本。目前已修复的版本包括 OceanBase 数据库企业版 V2.2.77 BP11(oceanbase-2.2.77-20220502140811)及之后版本。