---
title: "os_tsar_sda_ioawait OB server 服务器磁盘 ioawait 过高 - 云平台 OCP V4.3.3 | OceanBase 文档中心"
description: os_tsar_sda_ioawait OB server 服务器磁盘 ioawait 过高 告警描述 磁盘 IO 的几个重要指标中： svctm 反映磁盘的性能，一般小于 20ms。 ioawait 反映 IO 的处理效率，ioawait 越低，越说明 IO 队列不拥塞；ioawait 接近于 svctm 时，说明…
---
切换语言

- 中文站 - 简体中文
- International - English
- 日本站 - 日本語

文档反馈![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*lJTmRZ61jSUAAAAAAAAAAAAADiGDAQ/original) 云平台 OCPV 4.3.3

# os_tsar_sda_ioawait OB server 服务器磁盘 ioawait 过高

更新时间：2026-04-14 15:16:08

[编辑](https://github.com/oceanbase/ocp-doc/edit/V4.3.3/zh-CN/1900.reference-guide/100.alarm-reference/400.oas-alert/700.os_tsar_sda_ioawait.md)  

## 告警描述

磁盘 IO 的几个重要指标中：

- svctm 反映磁盘的性能，一般小于 20ms。
 - ioawait 反映 IO 的处理效率，ioawait 越低，越说明 IO 队列不拥塞；ioawait 接近于 svctm 时，说明 IO 几乎不等待（ioawait 略大于 svctm 是可接受的）。
 - io_util 为单位时间内设备 IO 占比，反应 IO 忙线程度。

连续 30 秒 io_await ≥ 200ms 并且 io_util ≥ 99% 则触发该告警。

## 告警原理

| 参数 | 值 |
| --- | --- |
| 监控指标 | io_util, io_qusize, io_read_write_time |
| 指标来源 | 主机基础监控，采集自 node_exporter   类比命令 `iostat -dx` 结果中的指标：util（io_util），avgqu-sz（io_qusize）， rkB/s 和 wkB/s（io_read_write_time） |
| 采集指标 | io_util, node_disk_io_time_weighted_seconds_total, node_disk_read_time_seconds_total, node_disk_write_time_seconds_total |
| 监控表达式 | - io_util: avg(io_util{@LABELS}) by (@GBLABELS) - io_qusize: sum(delta(node_disk_io_time_weighted_seconds_total{@LABELS}[@INTERVAL])) by (@GBLABELS) - io_read_write_time: avg(rate(node_disk_read_time_seconds_total{@LABELS}[@INTERVAL])) by (@GBLABELS) + avg(rate(node_disk_write_time_seconds_total{@LABELS}[@INTERVAL])) by (@GBLABELS) |
| 采集周期 | 1 秒 |

## 规则信息

| 监控表达式 | 监控指标含义 | 默认阈值 | 检测周期 | 消除周期 |
| --- | --- | --- | --- | --- |
| io_await >= 200 and io_util >= 99 | - io_util：单位时间内磁盘处理 IO 的时间占比，计算公式：(r/s + w/s) * svctm/1000，即每秒读写次数乘以处理耗时占比。 - svctm：设备IO响应耗时（毫秒）。 - io_await：设备IO等待耗时（毫秒）。 | - io_util: 99% - io_await: 200ms | 10 秒 | 5 分钟 |

## 告警信息

| 告警触发方式 | 告警等级 | 范围 |
| --- | --- | --- |
| 基于监控指标的表达式 | 严重 | 服务器 |

## 告警模板

- 告警概述
     - 模板：${alarm_target} ${alarm_name}
     - 样例：ob_cluster=obcluster-1631964370:svr_ip=xxx.xxx.xxx.xxx:device=dm-0 OB server 服务器磁盘 ioawait 过高
 - 告警详情
     - 模板：集群：${ob_cluster_name}，主机：${host}，告警：${alarm_name}，OB 磁盘：${ob_device}，device ${device}，io await ${io_await_value_zh_cn} 超过 ${io_await_alarm_threshold} ms，io util ${io_util_value_zh_cn} 超过 ${io_util_alarm_threshold} %。
     - 样例：集群：obcluster-1，主机：xxx.xxx.xxx.xxx，告警：OB server 服务器磁盘 ioawait 过高，OB 磁盘：ob_log，device dm-0，io await 300 毫秒 超过 200 毫秒，io util 99.1% 超过 99%。

## 对系统的影响

IO util 大于 99% 时说明 IO 设备满负荷运行；若 ioawait 大于 200 ms，可能是磁盘设备处理效率低或有大量 IO 请求，可能会影响转储、合并操作的进度。

OB 磁盘分为数据盘（/data/1），日志盘（/data/log1），安装盘（/home），该告警针对数据盘和日志盘生效。当数据盘和日志盘出现 IO 异常时，将影响 OBServer 节点提供服务。

## 可能原因

- 磁盘性能较差。
 - CPU 性能较差，无法处理大量的 IO 请求。
 - 存在高并发 IO 请求。

## 处理方法

1. 排查是否为磁盘、CPU 性能差引起的，此问题可通过升级硬件资源来规避。
 2. 确认请求流量是否符合预期，并排查 IO 异常的原因：

   ```yaml
   # 查看IO统计信息
   iostat -dx

   # 查看IO高的进程
   iotop

   # 查看进程有哪些文件被写入，写入量是否符合预期等
   lsof -p <pid>

   ```

 上一篇 下一篇 ![有帮助](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*y6ocSqN8cqsAAAAAAAAAAAAAARQnAQ)![无帮助](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*BG9IQJyLHF8AAAAAAAAAAAAAARQnAQ)![反馈](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*eTWdQKCRKHwAAAAAAAAAAAAAARQnAQ)[AI](https://www.oceanbase.com/obi) 咨询热线
