首批通过分布式安全可靠测评,为关键业务系统打造
ob_tenant_request_queue_over_threshold OceanBase 租户请求队列超限
更新时间:2026-02-05 18:50:37
告警描述
租户普通请求队列积压,超过阈值并且处理请求耗时增加会产生告警。
租户请求优先级队列包括:
- queue0:
high prio rpc,事务相关 rpc。 - queue1:
lock retry,锁冲突重试。 - queue2:
normal prio rpc,普通 rpc,inner sql,sql 触发的 rpc。 - queue3:
lock retry SQL req;OB_TASK;OB_GTS_TASK。 - queue4:
normal SQL req;OB_SQL_TASK。 - queue5:
warmup req。
序号越小优先级越高,可以通过搜索 dump tenant info 关键字查看租户队列情况,也可以查询 __all_virtual_dump_tenant_info 获取。
告警原理
| 参数 | 值 |
|---|---|
| 监控指标 | ob_tenant_request_queue_size、request_queue_time,其中: |
| 监控表达式 | sum(ob_tenant_request_queue_total_size{@LABELS}) by (@GBLABELS)sum(rate(ob_sysstat{stat_id="20002",@LABELS}[@INTERVAL])) by (@GBLABELS) / sum(rate(ob_sysstat{stat_id="20001",@LABELS}[@INTERVAL])) by (@GBLABELS) |
| 采集指标 | ob_tenant_request_queue_total_size、ob_sysstat |
| 指标来源 | 采集自内部视图,采集 SQL:select /*+ MONITOR_AGENT READ_CONSISTENCY(WEAK) */ tenant_id, req_queue_total_size as total_size, large_queued as large_size from __all_virtual_dump_tenant_info where (tenant_id > 1000 or tenant_id = 1) and svr_ip = ? and svr_port = ?
|
| 采集周期 | 5 秒 |
规则信息
| 监控指标 | 默认阈值 | 持续时间 | 检测周期 | 消除周期 |
|---|---|---|---|---|
| ob_tenant_request_queue_size、request_queue_time | 300 秒 | 10 秒 | 5 分钟 |
告警信息
| 告警触发方式 | 告警等级 | 范围 |
|---|---|---|
| 基于监控指标的表达式 | 租户 |
告警模板
告警概述
- 模板:${alarm_target} ${alarm_name}
- 样例:alarm_template_id=0:ob_cluster=TEST-1:tenant_name=test:host=xxx.xxx.xxx.xxx OceanBase 租户请求队列超限
告警详情
- 模板:集群:${ob_cluster_name},租户:${tenant_name},告警:${alarm_name}。租户请求等待耗时:${request_queue_time_value_zh_cn},请求队列长度 ${ob_tenant_request_queue_size_value} 超过 ${ob_tenant_request_queue_size_alarm_threshold}。
- 样例:集群:TEST,租户:test,告警:OceanBase 租户请求队列超限。租户请求等待耗时:1300 微秒,租户请求队列长度 100 超过 10。
告警恢复
- 模板:告警:${alarm_name},OceanBase 租户 SQL 请求在等待队列中等待耗时:${request_queue_time_value_zh_cn},OceanBase 租户请求队列长度:${ob_tenant_request_queue_size_value},
- 样例:告警:OceanBase 租户请求队列超限,OceanBase 租户 SQL 请求在等待队列中等待耗时:0 微秒,OceanBase 租户请求队列长度:5
对系统的影响
租户请求队列积压对系统的影响较大:
- 内存超出使用限制。
- 业务响应变慢。
可能原因
- 事务处理耗时大,导致处理请求积压。
- OBServer 资源不足 ,处理不过来过量请求。
处理方法
- 执行预案,快速恢复告警问题。详细操作,请参见 告警预案。
- 预案重试。应尽量保证预案能继续执行下去,确保原有问题能得到解决。
- 预案回退,可以联系 OceanBase 技术支持人员协助回退预案。