---
title: OceanBase AI 数据库｜为 AI 设计的数据库
description: OceanBase AI 数据库，从内核为 AI 应用重新设计的数据库引擎。
image: https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*OSPzQ6GUQF4AAAAAQHAAAAgAeiGDAQ/original
---
切换语言

- 中文站 - 简体中文
- International - English
- 日本站 - 日本語

[AI](https://www.oceanbase.com/obi) 咨询热线

# OceanBase **AI 数据库** 面向 AI 应用与 Agent 的多模数据库

OceanBase AI 数据库在一个引擎中提供标量、JSON、全文、向量与多模态数据的存储与检索，支持库内 AI 推理、Agent 记忆管理与数据分支，替代 MySQL、搜索引擎、向量库与数据湖的多系统组合。

[业务方案咨询](#ai-database-demo) [产品文档](https://www.oceanbase.com/docs/oceanbase-database-ai)

[  Why AI Database ]

## 告别多系统拼凑，  
一库跑通 AI 全链路

OceanBase AI 数据库以“一份数据、一套事务、一条 SQL”为核心，在单一引擎内集成混合搜索、库内推理、Agent 原生及多模态数据管理。

架构的变化 ![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*sqDDRaYlgK4AAAAALMAAAAgAeiGDAQ/original)

### 多系统拼接 → 单原生引擎

告别 MySQL、Elasticsearch、向量库等多系统组合，单引擎原生集成搜索、推理、Agent 与 LOB。

数据的变化 ![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*0We8Q7MMTyIAAAAAQCAAAAgAeiGDAQ/original)

### 多份割裂数据 → 一份数据

消除数据冗余与权限隔离，以一份数据、一套事务、一条 SQL 实现强一致管理。

成本的变化 ![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*fv6vQ4qL_e8AAAAAQCAAAAgAeiGDAQ/original)

### 胶水代码 → 架构极简

免除应用层胶水代码与高昂运维，简化架构以提升开发效率、降低维护成本。

核心能力

## AI 能力内生，不靠外挂拼装

混合搜索、AI 算子、Agent 数据管理由内核直接提供，共享同一份数据、同一套事务和同一套权限。

混合搜索 多模态数据处理 Agent 原生

### 一条 SQL，多类检索组合

标量、JSON、全文、向量、空间检索在同一条 SQL 中执行，优化器统一选择计划，融合排序在库内完成——无需在应用层归并多套系统的返回结果。

- **多类检索在同一条 SQL 中组合**

  Btree、多值索引、倒排 BM25、HNSW / IVF、GIS 索引
- **库内融合排序**

  内置 RRF、WEIGHT_SUM、MINMAX，多路召回返回 Top-K
- **写入即可见**

  事务提交后各类索引立即生效，无需等 CDC 同步

hybrid_search.sql

```
SELECT
  id,
  title,
  __score
FROM
  HYBRID_SEARCH(
    TABLE articles,
    '{
      "knn": {
        "field": "embedding",
        "query_vector": "[0.1, 0.2, 0.3, 0.4]",
        "k": 10,
        "filter": {
          "bool": {
            "must": [
              {"range": {"id": {"gte": 1, "lte": 10}}},
              {"term": {"status": "published"}}
            ],
            "filter": [
              {"json_contains": {"metadata": {"candidate": "{\"category\":\"tech\"}", "path": "$.category"}}},
              {"json_member_of": {"tags": {"candidate": "database", "path": "$.tech_stack"}}}
            ]
          }
        }
      },
      "query": {
        "bool": {
          "must": [
            {"match": {"title": "数据库优化"}}
          ],
          "filter": [
            {"range": {"publish_date": {"gte": "2024-01-01", "lte": "2026-12-31"}}},
            {"json_overlaps": {"labels": {"candidate": "[\"AI\", \"DB\"]", "path": "$.topics"}}},
            {"term": {"lang": "zh"}}
          ]
        }
      },
      "rank": {
        "rrf": {"rank_constant": 60}
      },
      "size": 10
    }'
  );
```

### 从只存不算，到即存即算

模型注册为数据库对象，SQL 中直接调用切分、向量化算子，推理结果写回原表并自动建立索引——不必在应用层维护模型调用、结果回写和索引同步。

- **Model in DB**

  嵌入式、生成式、多模态、重排序模型均作为数据库对象，可版本化管理与审计
- **AI 算子**

  摘要 → 切分 → 向量化在 SQL 内完成，结果入表自动建索引
- **多模表（敬请期待）**

  文档、图片、音视频作为 LOB 入表，自动分层存储

rag_pipeline.sql

```
CALL DBMS_AI_SERVICE.REGISTER_PROVIDER('aliyun', '{
  "access_key": "sk-xxxx"
}');

CREATE TABLE knowledge_base (
  id INT AUTO_INCREMENT PRIMARY KEY,
  title VARCHAR(255),
  content TEXT,
  embedding TEXT
);

INSERT INTO knowledge_base (title, content) VALUES
  ('向量搜索', '向量搜索可以用于语义搜索，找到相似的内容。');

UPDATE knowledge_base
SET embedding = AI_EMBED('aliyun/text-embedding-v3', content);

SET @query = "什么是向量搜索？";
SET @query_vector = AI_EMBED('aliyun/text-embedding-v3', @query);

-- 构建字符串数组格式的文档列表
SET @candidate_docs = '["OceanBase 是一个强大的数据库系统，支持向量搜索和 AI 函数。", "向量搜索可以用于语义搜索，找到相似的内容。"]';

SELECT AI_RERANK('aliyun/gte-rerank-v2', @query, @candidate_docs) AS ranked_results;
SELECT AI_COMPLETE('aliyun/qwen-plus',
  AI_PROMPT('基于以下文档内容，回答用户的问题。
用户问题：{0}
相关文档：{1}
请基于以上文档内容，简洁准确地回答用户的问题。', @query, CAST(JSON_EXTRACT(@candidate_docs, '$[1]') AS CHAR))) AS answer;
```

### 能隔离、有记忆、会试错

千万级 Agent 实例共享一套物理表，记忆用一条 SQL 召回，对比实验在 Fork 出的数据分支上运行——不必为每个 Agent 建表，复制整库来做实验。

- **五层隔离**

  租户级、Database 级、Namespace 级逻辑表、表级、行 / 列级
- **记忆召回**

  长期、短期记忆、工具调用、多模态统一存储，混合搜索一条 SQL 内完成
- **Fork Database**

  Copy-on-Write 只存增量，毫秒级建分支，支持 MERGE 与 DROP
- **冷热分层**

  沉睡实例数据自动沉降到对象存储，被唤醒时从共享存储加载，RPO=0

agent_namespace.py

```
-- 导入 pyseekdb 模块
from pyseekdb import Schema, VectorIndexConfig, IVFConfiguration, FulltextIndexConfig

-- 创建带 IVF 向量索引与全文索引的 Collection
collection = client.create_collection(
    name="tech_docs",
    schema=Schema(
        vector_index=VectorIndexConfig(
            ivf=IVFConfiguration(dimension=384, distance="cosine", centroids_fresh_mode="spfresh"),
        ),
        fulltext_index=FulltextIndexConfig(analyzer="ik"),
    ),
    use_namespace=True,
)

-- 创建 Namespace，系统自动分配 namespace_id
ns = collection.create_namespace("my_knowledge")
print(f"namespace_id: {ns.namespace_id}")

-- 批量写入文档（本示例只传文本，由 SDK 自动生成向量）
ns.add(
    ids=["doc1", "doc2", "doc3"],
    documents=[
        "OceanBase AI 数据库是蚂蚁集团自研的分布式数据库，支持 HTAP 混合负载",
        "Agent 混合搜索场景是 OceanBase AI 数据库面向 AI Agent 的多租户向量搜索方案",
        "pyseekdb 是 OceanBase AI 数据库的 Python SDK，提供向量存储与混合搜索能力"
    ],
    metadatas=[
        {"category": "database", "version": "4.0"},
        {"category": "ai", "version": "4.6"},
        {"category": "sdk", "version": "1.2"},
    ],
)

-- 用自然语言做向量搜索，返回最相似的 2 条并打印结果
results = ns.query(
    query_texts=["分布式数据库"],
    n_results=2,
    include=["documents", "metadatas", "distances"],
)

for i, id_ in enumerate(results["ids"][0]):
    print(f"id: {id_}")
    print(f"  document: {results['documents'][0][i]}")
    print(f"  distance: {results['distances'][0][i]:.4f}")
```

[ 产品架构 ]

## 单副本的成本，多副本的可靠

存算分离 + 日志与计算解耦 + 冷热分层，面向 AI 数据场景的低成本高可靠架构。性能、成本和可靠性各自独立扩展。

统一应用接口UNIFIED INTERFACE 多模计算层MIXED WORKLOAD 多模数据类型MULTIMODAL DATA 多模索引层MULTIMODAL INDEX 存算分离架构COMPUTE · LOG · STORAGE **统一 SQL 查询语言** **原生 Python SDK** **向量化**执行引擎 **并行**执行引擎 **混合负载**自适应执行 **查询**优化器 **语义**搜索 **混合**搜索 **AI**函数 关系表 宽表 向量 JSON 文档 文本 空间 / 数组 / 映射 二级索引 向量索引 JSON 索引 多值索引 全文索引 GIS 索引 搜索索引 **计算节点 · OBServer** 弹性扩缩 本地 SSD 热缓存 按需计算 **独立日志服务 · LogService** 三副本日志 RPO = 0 快速恢复 **共享对象存储** 低成本 近乎无限容量 S3 兼容

### 扩容不搬数据

计算与存储独立扩缩容。新节点从共享存储加载数据、从日志服务回放日志即可对齐一致状态。

### 存储成本降约 70%

热数据在本地 SSD 毫秒级访问，沉睡数据按访问频率自动沉降到对象存储。

### 计算节点可单副本运行

事务可靠性由三副本日志服务保证，已提交数据不因计算节点故障丢失。

说明：计算节点可采用单副本部署；事务日志仍由 LogService 多副本强同步，对象存储负责全量数据的高可用持久化。

[  应用场景 ]

## 构建 AI 应用与 Agent 数据底座

企业 RAG 与智能客服 AI Agent 记忆与评测 多模态数据搜索 实时数仓与湖仓分析

### 文档入库，答案出库

切分、向量化、混合搜索、重排和生成在同一个数据库内完成，不必再串联文档存储、Embedding 服务、向量库、搜索引擎和编排框架。

- 替代文档存储、Embedding、向量库、搜索引擎、编排框架等组件
- 全文与向量索引实时一致，权限与审计贯穿全链路
- AI 算子可经 Python UDF 扩展

### 记得住，敢试错

短期状态、语义记忆和业务事实存在同一份数据里，共享同一套事务；需要做对比实验时 Fork 出数据分支，失败即丢弃——不再需要 Redis、向量库和 MySQL 各存一部分上下文。

- 长期记忆、短期状态、工具调用记录、多模态输入统一存储与召回
- Namespace 级逻辑表支撑千万级 Agent 隔离
- Fork Database 毫秒级实验沙箱，MERGE / DROP 收敛，Bad Case 可回溯到 Prompt、模型与工具链
- 沉睡记忆自动沉降到对象存储，RPO=0

### 文件也是数据

文件、模型推理结果和业务字段进入同一张表后，可以按业务属性、摘要关键词和画面语义组合查询——例如在一批车载视频里检索“雨天某车辆在某路段的分流口画面”，是一次普通 SQL 查询。

- 业务属性、摘要关键词、画面语义组合成一次查询
- 推理结果回写原表，像普通列一样被查询、索引和 Join
- LOB 三形态自动分层存储（敬请期待）

### 省掉一条双链路

高频实时写入与大批量导入进入同一个引擎，物化视图增量刷新支撑准实时查询，不必再维护 Lambda 架构的两条链路。

- 流批一体写入，Direct Load 高速导入，物化视图 + MLog 增量加工
- 行存、列存、行列混存按需定义，向量化执行较非向量化大幅提升
- 原生 MPP，节点 - 分区 - 任务多层并行
- 兼容 Arrow Flight SQL，原生集成 Spark / Daft / Ray
- Iceberg / Hive / Paimon 湖上查询加速，统一元数据

[  案例实践 ]

## 基于 OceanBase 构建的 AI 应用与 Agent

经 16 年生产验证的内核，OceanBase AI 数据库继承全部分布式内核能力，AI 场景零妥协。

![蚂蚁阿福](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*ue8nRa4E0b0AAAAAURAAAAgAeiGDAQ/original)

### 蚂蚁阿福

亿级用户 AI 助手，承载记忆库 + 知识检索 + 会话隔离，日均千万级对话

![蚂蚁灵光](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*hirxQrzesJcAAAAARfAAAAgAeiGDAQ/original)

### 蚂蚁灵光

代码智能体平台，Fork Database 支撑海量实验隔离，多模表管理训练数据集

**4000+** 客户核心系统上线 **7.07 亿 tpmC** TPC-C 打破世界纪录 **1526 万 QphH** TPC-H 全球登顶 **RTO < 8 秒 RPO=0** 极致高可用

[  FAQ ]

## OceanBase AI 数据库  
常见问题

与 OceanBase Database 是什么关系？ ![](https://www.oceanbase.com/ai-database/faq-plus-icon.svg)

两者同源内核、不同定位。OceanBase Database 面向对响应时延及稳定性要求极高的 TP / HTAP 场景；OceanBase AI 数据库面向 AI 与湖仓分析场景，继承全部分布式内核能力，共享同一套工具链。

与 OceanBase Lakebase 是什么关系？ ![](https://www.oceanbase.com/ai-database/faq-plus-icon.svg)

OceanBase AI 数据库是 OceanBase Lakebase 的存储引擎。它基于存算分离架构，是一个同时支撑 AI 负载、OLAP 负载与 KV 负载的多模数据库，也是湖库引擎的核心组件。需要数据库本身的能力，选 OceanBase AI 数据库；需要开箱即用的湖库一体平台，选 OceanBase Lakebase。

现有的 MySQL 应用需要改造吗？ ![](https://www.oceanbase.com/ai-database/faq-plus-icon.svg)

基本不需要。支持 MySQL 模式，沿用现有驱动、ORM 和 SQL 语法。另提供 KV 模式（OBKV-Table / OBKV-HBase）承接 HBase 场景。

原有工具链还能用吗？ ![](https://www.oceanbase.com/ai-database/faq-plus-icon.svg)

能。仍配套 ODP 与 MySQL 生态驱动，OCP、ODC、OMS、导数工具与 DataPilot 继续可用，新增 DataStudio 平台支持。

计算节点扩缩容需要迁移数据吗？ ![](https://www.oceanbase.com/ai-database/faq-plus-icon.svg)

不需要。数据持久化在对象存储，本地磁盘仅作缓存，计算节点无状态。新增节点从共享存储加载数据、从日志服务回放日志即可提供服务。

怎么获取和部署？ ![](https://www.oceanbase.com/ai-database/faq-plus-icon.svg)

支持私有化部署与 OB Cloud 云服务，可售区域、规格与上线时间以官方发布为准。支持 x86、ARM 及主流国产操作系统。

## 做 AI 应用，从选择一个为 AI 设计的数据库开始

多模搜索、库内推理、Agent 数据管理，一个引擎全部完成。

[想开箱即用？看看 OceanBase Lakebase 湖库一体平台→](https://www.oceanbase.com/product/lakebase)
