基于湖库一体架构,统一管理结构化、半结构化与非结构化等多模态数据,一个系统承载事务处理、实时分析与 AI 工作负载。
NFS hang 以后对应的机器系统负载变高的原因和解决方法
更新时间:2026-06-16 09:21
问题现象
NFS hang,业务压力没有增长,OBServer 所在的机器的负载变高,但是 CPU 使用比较低;访问 NFS 的后台备份、清理、恢复的线程会被 NFS 的请求 hung 住,导致这些后台线程无法释放。
问题原因
NFS server 的问题,会造成系统 load 变高,但是 CPU 使用低,影响 OBServer。
关键信息
NFS hang 现象判断,满足下面的条件之一就是 hang。
dmesg 出现 NFS 相关的错误日志。通过
dmesg |grep -i nfs命令进行判断。/var/log/messages出现 NFS 相关的错误日志。 通过grep -i nfs /var/log/messages命令进行判断。在 NFS 的目录下面执行
strace ls卡住。使用
nfsiostat 2 2命令统计 NFS 协议的网络文件系统的 I/O 状态数据,发现 IOPS 不为 0,但是流量为 0。使用
du命令导致的 NFS hang,top 里面看到节点的 load 达到 200+。
问题的风险及影响
NFS hung 以后会导致 Linux 的 load(全称
Linux system load averages,即 Linux 系统负载平均值)变大,影响 OBServer 的性能。访问 NFS 的后台备份、清理、恢复的线程会被NFS的请求 hung 住,导致这些后台线程无法释放。
如果用执行
alter system backup/restore/delete等操作,会导致该命令对应的系统租户的前台任务线程卡住。如果重复执行该命令,会导致系统租户的前台任务线程耗尽,影响集群的正常运行。
影响租户
影响 OceanBase 数据库中的 SYS 租户和 Oracle 租户以及 MySQL 租户。
适用版本
OceanBase 数据库 V2.x、V3.x、V4.x 版本。
解决方法
重启 NFS 服务器,重启以后观察一下备份是否已经恢复;如果没有恢复则进行步骤 2。
重启 OBServer 所在的节点。