基于湖库一体架构,统一管理结构化、半结构化与非结构化等多模态数据,一个系统承载事务处理、实时分析与 AI 工作负载。
[ Why Lakebase ]
用户、数据、交互
都在变化
AI 正在重塑企业使用数据的方式,数据底座需要为新的交互、新的数据和新的用户而设计。
人和应用 → 人 + 海量 Agent
支撑 Agent 持续读写、并行试错、版本隔离与安全回滚。
结构化数据 → 多模态数据
统一管理结构化数据、向量、文本、文档、图片、音频与视频。
SQL → 语义交互离线 + 在线 → 离在线一体
用自然语言理解需求,让加工结果实时进入分析、搜索与应用。
[ 核心能力 ]
存搜算管一体,让多模态数据直接服务 AI
多模态一体化存储
统一存储结构化数据,以及 JSON、向量、全文、图、GIS、文档、图片、音频和视频等非结构化数据,让各类数据在同一平台统一管理。
多模态一体化搜索
在同一份数据上统一支持 SQL 搜索、向量搜索与混合搜索,让业务条件、关键词和语义理解协同工作。
多模态一体化计算
SQL、Spark ETL 与 Daft on Ray 等计算引擎围绕同一份数据协作,离线加工的结果可以被在线查询与混合搜索直接使用,减少重复复制和同步等待。
多模态一体化治理
统一元数据、权限、行级控制、审计、版本和生命周期,让结构化字段、非结构化对象与向量检索遵循一致的治理边界。
消除数据烟囱,显著降低 TCO
统一多模态数据的存储、计算与治理,减少重复建设和数据搬运。
存、算、管一体化,现代数据基础设施、日常运维更简单。
[ 开放架构 ]
湖的开放与成本,库的实时与可靠 统一在同一架构
Lakebase 采用基于对象存储的存算分离架构,以多模表承载统一数据语义,以开放 Catalog 管理元数据与权限,并让多种计算引擎直接处理同一份数据。
OceanBase SQL 引擎承载 OLTP、OLAP 与 AI 混合搜索;Spark 处理大规模 ETL;Daft on Ray 处理多模态与 AI 计算。
多模表将关系列、多模列和 AI 列组织在同一表语义下;统一 Catalog 管理表、视图、Schema、血缘、权限与策略。
统一承载结构化数据、开放湖格式数据与非结构化对象。数据块存放在对象存储,本地缓存加速热点访问,并可按业务周期管理冷热数据。
[ 更多能力 ]
为 AI 数据全生命周期而设计
Fork Database 数据沙箱
开发者可以为 Agent 评测、数据实验和应用测试创建独立数据沙箱;成功进入后续流程,失败的实验可以直接丢弃或回滚。
AI 列
数据写入后自动触发 Embedding、识别、摘要或打标等模型计算,并将结果作为列写回表中,让模型结果与原始数据保持关联和一致。
行级权限控制
用 RLS 等能力把访问控制落实到数据行,确保不同用户、应用和 Agent 只访问被授权的数据范围。
企业级高可用
继承 OceanBase 面向核心业务构建的事务一致性、容灾和高可用能力,让 AI 数据底座具备进入生产系统的可靠性基础。
[ 应用场景 ]
从数据准备到 Agent 运行,让 AI 更快进入生产
从海量多模态原始数据,快速找到高价值训练样本
统一接入视频、图片、传感器、GPS 与业务标签,完成拆分、抽帧、识别、特征提取和向量化处理。业务团队可以结合场景、时间、地理位置和语义条件,从海量数据中精准召回训练所需样本。
原始对象与派生特征统一管理
训练数据集可版本化、可复现
混合搜索提高样本发现效率
一份数据支撑加工、检索与训练
[ 部署模式 ]
不推倒重来,按企业现状选择建设路径
独立部署方案
面向全新的 AI 或多模态业务场景,快速建设一套包含存储、计算、搜索和治理能力的 Lakebase 环境,从较小初始规模开始,再按业务需求扩展。
智能叠加层方案
与现有数据库、数据湖和对象存储并行运行,连接并复用已有数据资产,统一管理 Lakebase 中的新数据,为上层应用提供一致的数据访问与服务体验。
[ FAQ ]
OceanBase Lakebase
常见问题
传统数据湖更擅长低成本保存海量开放数据,湖仓增强了数据分析和表管理能力。OceanBase Lakebase 进一步把数据库级事务、在线服务、实时分析、混合搜索与统一治理带到同一份数据上,让湖上的数据能够直接支撑生产应用与 AI 工作负载。
不需要。企业可以为新业务独立部署 OceanBase Lakebase,也可以把它作为智能叠加层,与现有数据库、数据湖和对象存储并行运行,逐步接入和增强已有数据资产。
OceanBase Lakebase 面向关系数据、JSON、向量、全文、图、GIS,以及文档、图片、音频和视频等多种数据形态,并通过多模表提供统一的数据组织与访问语义。
OceanBase Lakebase 通过统一 Catalog、角色与权限、行级控制、审计、血缘和生命周期管理,为结构化字段、非结构化对象与 AI 检索建立一致的治理边界。