基于湖库一体架构,统一管理结构化、半结构化与非结构化等多模态数据,一个系统承载事务处理、实时分析与 AI 工作负载。
使用监控观察 OceanBase 业务负载情况
更新时间:2026-04-14 11:55:54
本节为您介绍如何通过 OCP 监控图标观察 OceanBase 的业务负载情况。
应用场景
监控服务提供集群、租户、主机、OBProxy 等多维度性能监控的可视化展示,在生产中用户可以通过监控观察业务的负载和资源使用情况,从而预判可能出现的异常或者找寻异常发生的原因。
前提条件
OceanBase 主机上的 ocp_monagent 进程为可用状态。
注意事项
极端情况如主机 CPU 或内存资源耗尽时,可能会造成监控采集超时失败,从而丢失监控数据。此时需要优先解决资源问题,如通过临时扩容等方式来保证系统可用。关于扩容,可参考 扩容 OceanBase 集群及租户。
操作步骤
观察主机资源使用情况
通过 主机 > 监控 > 主机性能 > CPU 使用率 和 主机 > 监控 > 主机资源 > 内存 可以分别观察对应主机的 CPU 和内存使用情况。

当出现类似 CPU 使用率超限 或者 服务器内存使用率超限 等告警时,优先通过上述路径确认系统资源使用情况,从监控图表曲线中可以观察到。
目前系统是否仍处于资源紧缺的状态中(如 CPU 使用率超过 80%)。
观察是否需要通过紧急扩容来临时止血。
资源是持续缓慢的增长还是在某个时间节点发生骤增。
如果缓慢增长,观察 OceanBase 集群 > 数据库性能 监控中 QPS 是否升高,是否与业务的增长有关。
如果发生突增,观察 TopSQL,是否是某个 SQL 流量导致。
异常发生的时间点。
比对日志,该时间点附近是否出现错误日志。
比对业务,该时间点是否发生业务变更。
解决思路:
如果是由于业务缓慢增长导致,需要对系统资源进行扩容。
如果是某个 SQL 导致,可以通过 OCP 进行限流,然后进一步分析是否能通过建索引优化等方式优化 SQL,或者从业务上减少 SQL 使用。
其余解决方案可能通过参数配置/数据库层面去规避解决。
观察租户性能
通过 租户 > 性能与 SQL 监控 可以观察对应租户的性能和资源使用情况,排查常见的流量和慢 SQL 问题。

当租户出现异常告警时,可以通过以下流程进行排查:
查看 请求等待队列耗时、租户 CPU 消耗 等监控图表,如果 请求等待队列耗时 持续维持在毫秒级别,且 租户线程使用率 较高,基本可以判断判断租户线程资源紧缺,需明确会不会有大的影响。
异常情况如下图所示。

正常情况如下图所示。

查看 SQL 执行计划类别 监控图表,是否有异常的执行计划执行。
查看 QPS 监控图表,观察请求量变化及出现变化的时间点,判断是否为流量突增导致问题。
查看 SQL 响应时间 监控图表,如有升高可能有慢 SQL。
查看 RPC 包耗时 监控图表是否升高,判断是否有网络延迟或者服务器负载过高的情况。
解决思路:
如果是流量突增,可以通过紧急扩容的方式临时止血,并分析是业务导致还是异常SQL。
如有慢 SQL,转而使用 SQL 诊断工具进行排查。
如果 RPC 包耗时较久,可以使用 tsar 等性能监控工具来进行分析。
常见问题
Q:对 CPU 指标进行下钻分析时偶尔出现集群整体的 CPU 使用率大于每台单独 OBServer 节点使用率之和。

A:在突刺的时间段有其中一台或数台 OBServer 节点有数据丢点,CPU 使用率计算方式是 1 - free 百分比,在集群维度聚合时统计的 free 百分比会低于预期,最终出现结果高于预期的情况。