---
title: "使用监控观察 OceanBase 业务负载情况 - 云平台 OCP V4.3.0 | OceanBase 文档中心"
description: 使用监控观察 OceanBase 业务负载情况 本节为您介绍如何通过 OCP 监控图标观察 OceanBase 的业务负载情况。 应用场景 监控服务提供集群、租户、主机、OBProxy 等多维度性能监控的可视化展示，在生产中用户可以通过监控观察业务的负载和资源使用情况，从而预判可能出现的异常或者找寻异常发生的原因。 …
image: https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*OSPzQ6GUQF4AAAAAQHAAAAgAeiGDAQ/original
---
切换语言

- 中文站 - 简体中文
- International - English
- 日本站 - 日本語

文档反馈![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*lJTmRZ61jSUAAAAAAAAAAAAADiGDAQ/original) 云平台 OCPV 4.3.0

# 使用监控观察 OceanBase 业务负载情况

更新时间：2026-04-14 11:55:54

[编辑](https://github.com/oceanbase/ocp-doc/edit/V4.3.0/zh-CN/1850.ocp-om-best-practices/1500.monitoring-to-observe-ob-business-load-conditions.md)  

本节为您介绍如何通过 OCP 监控图标观察 OceanBase 的业务负载情况。

## 应用场景

监控服务提供集群、租户、主机、OBProxy 等多维度性能监控的可视化展示，在生产中用户可以通过监控观察业务的负载和资源使用情况，从而预判可能出现的异常或者找寻异常发生的原因。

## 前提条件

OceanBase 主机上的 ocp_monagent 进程为可用状态。

## 注意事项

极端情况如主机 CPU 或内存资源耗尽时，可能会造成监控采集超时失败，从而丢失监控数据。此时需要优先解决资源问题，如通过临时扩容等方式来保证系统可用。关于扩容，可参考 [扩容 OceanBase 集群及租户](https://www.oceanbase.com/docs/common-ocp-1000000000826580)。

## 操作步骤

### 观察主机资源使用情况

通过 **主机** > **监控** > **主机性能** > **CPU 使用率** 和 **主机** > **监控** > **主机资源** > **内存** 可以分别观察对应主机的 CPU 和内存使用情况。

![1](https://obbusiness-private.oss-cn-shanghai.aliyuncs.com/doc/img/ocp/%E6%9C%80%E4%BD%B3%E5%AE%9E%E8%B7%B5/%E4%B8%BB%E6%9C%BA%E6%80%A7%E8%83%BD.png) ![2](https://obbusiness-private.oss-cn-shanghai.aliyuncs.com/doc/img/ocp/%E6%9C%80%E4%BD%B3%E5%AE%9E%E8%B7%B5/%E4%B8%BB%E6%9C%BA%E8%B5%84%E6%BA%90.png)

当出现类似 **CPU 使用率超限** 或者 **服务器内存使用率超限** 等告警时，优先通过上述路径确认系统资源使用情况，从监控图表曲线中可以观察到。

- 目前系统是否仍处于资源紧缺的状态中（如 CPU 使用率超过 80%）。

  观察是否需要通过紧急扩容来临时止血。
 - 资源是持续缓慢的增长还是在某个时间节点发生骤增。

     - 如果缓慢增长，观察 **OceanBase 集群** > **数据库性能** 监控中 QPS 是否升高，是否与业务的增长有关。
     - 如果发生突增，观察 TopSQL，是否是某个 SQL 流量导致。
 - 异常发生的时间点。

     - 比对日志，该时间点附近是否出现错误日志。
     - 比对业务，该时间点是否发生业务变更。

**解决思路：**

1. 如果是由于业务缓慢增长导致，需要对系统资源进行扩容。
 2. 如果是某个 SQL 导致，可以通过 OCP 进行限流，然后进一步分析是否能通过建索引优化等方式优化 SQL，或者从业务上减少 SQL 使用。
 3. 其余解决方案可能通过参数配置/数据库层面去规避解决。

### 观察租户性能

通过 **租户** > **性能与 SQL 监控** 可以观察对应租户的性能和资源使用情况，排查常见的流量和慢 SQL 问题。

![1](https://obbusiness-private.oss-cn-shanghai.aliyuncs.com/doc/img/ocp/%E6%9C%80%E4%BD%B3%E5%AE%9E%E8%B7%B5/%E6%80%A7%E8%83%BD%E4%B8%8Esql.png)

当租户出现异常告警时，可以通过以下流程进行排查：

1. 查看 **请求等待队列耗时**、**租户 CPU 消耗** 等监控图表，如果 **请求等待队列耗时** 持续维持在毫秒级别，且 **租户线程使用率** 较高，基本可以判断判断租户线程资源紧缺，需明确会不会有大的影响。

      - 异常情况如下图所示。

       ![1](https://obbusiness-private.oss-cn-shanghai.aliyuncs.com/doc/img/ocp/%E6%9C%80%E4%BD%B3%E5%AE%9E%E8%B7%B5/%E8%AF%B7%E6%B1%82%E9%98%9F%E5%88%97%E8%80%97%E6%97%B6.png) ![2](https://obbusiness-private.oss-cn-shanghai.aliyuncs.com/doc/img/ocp/%E6%9C%80%E4%BD%B3%E5%AE%9E%E8%B7%B5/%E7%A7%9F%E6%88%B7%E7%BA%BF%E7%A8%8B%E4%BD%BF%E7%94%A8%E7%8E%87.png)
      - 正常情况如下图所示。

       ![1](https://obbusiness-private.oss-cn-shanghai.aliyuncs.com/doc/img/ocp/%E6%9C%80%E4%BD%B3%E5%AE%9E%E8%B7%B5/%E8%AF%B7%E6%B1%82%E9%98%9F%E5%88%97%E8%80%97%E6%97%B61.png) ![2](https://obbusiness-private.oss-cn-shanghai.aliyuncs.com/doc/img/ocp/%E6%9C%80%E4%BD%B3%E5%AE%9E%E8%B7%B5/%E7%A7%9F%E6%88%B7%E7%BA%BF%E7%A8%8B%E4%BD%BF%E7%94%A8%E7%8E%871.png)
 2. 查看 **SQL 执行计划类别** 监控图表，是否有异常的执行计划执行。
 3. 查看 **QPS** 监控图表，观察请求量变化及出现变化的时间点，判断是否为流量突增导致问题。
 4. 查看 **SQL 响应时间** 监控图表，如有升高可能有慢 SQL。
 5. 查看 **RPC 包耗时** 监控图表是否升高，判断是否有网络延迟或者服务器负载过高的情况。

**解决思路：**

1. 如果是流量突增，可以通过紧急扩容的方式临时止血，并分析是业务导致还是异常SQL。
 2. 如有慢 SQL，转而使用 SQL 诊断工具进行排查。
 3. 如果 RPC 包耗时较久，可以使用 tsar 等性能监控工具来进行分析。

## 常见问题

Q：对 CPU 指标进行下钻分析时偶尔出现集群整体的 CPU 使用率大于每台单独 OBServer 节点使用率之和。

![1](https://obbusiness-private.oss-cn-shanghai.aliyuncs.com/doc/img/ocp/%E6%9C%80%E4%BD%B3%E5%AE%9E%E8%B7%B5/CPU%E3%80%81.png)

A：在突刺的时间段有其中一台或数台 OBServer 节点有数据丢点，CPU 使用率计算方式是 `1 - free 百分比`，在集群维度聚合时统计的 free 百分比会低于预期，最终出现结果高于预期的情况。

 上一篇 下一篇 ![有帮助](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*y6ocSqN8cqsAAAAAAAAAAAAAARQnAQ)![无帮助](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*BG9IQJyLHF8AAAAAAAAAAAAAARQnAQ)![反馈](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*eTWdQKCRKHwAAAAAAAAAAAAAARQnAQ)[AI](https://www.oceanbase.com/obi) 咨询热线
