---
title: "向量搜索概述 - OceanBase 数据库 V4.5.0 | OceanBase 文档中心"
description: 向量搜索概述 本文档介绍了向量数据库与向量搜索的核心概念。 OceanBase 数据库最高支持 16000 维的 Float 类型的稠密向量，支持稀疏向量，支持曼哈顿距离、欧式距离、内积、余弦距离等多种类型向量距离的计算，支持 HNSW/IVF 向量索引的创建，支持索引维护。 OceanBase 向量搜索具备混合搜索…
---
切换语言

- 中文站 - 简体中文
- International - English
- 日本站 - 日本語

文档反馈![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*P8CuR4UJ_FkAAAAAAAAAAAAADiGDAQ/original) OceanBase 数据库分布式版 - V 4.5.0

# 向量搜索概述

更新时间：2026-05-20 17:37:12

[编辑](https://github.com/oceanbase/oceanbase-doc/edit/V4.5.0/zh-CN/640.ob-vector-search/100.ob-vector-search-overview/100.ob-vector-search-intro.md)  

本文档介绍了向量数据库与向量搜索的核心概念。

OceanBase 数据库最高支持 16000 维的 Float 类型的稠密向量，支持稀疏向量，支持曼哈顿距离、欧式距离、内积、余弦距离等多种类型向量距离的计算，支持 HNSW/IVF 向量索引的创建，支持索引维护。

OceanBase 向量搜索具备混合搜索能力。同时提供灵活的访问接口，不仅支持通过 MySQL 协议各种语言客户端使用 SQL 访问，也可以使用 Python/Java SDK 访问。同时 OceanBase 数据库也完成了对 AI 应用开发框架 LlamaIndex、DB-GPT 及 AI 应用开发平台 Dify 的适配，更好的服务于 AI 应用开发。

## 关键概念

### 非结构化数据

非结构化数据是指没有明确定义的数据格式和组织结构的数据。非结构化数据通常包括文本、图像、音频、视频等形式的数据，以及社交媒体内容、电子邮件、日志文件等。由于非结构化数据的复杂性和多样性，处理这些数据需要采用特定的工具和技术，例如自然语言处理、图像识别、机器学习等。

### 向量

向量本质上是一个对象在高维空间的投影。数学意义上向量则是一个浮点数组，有以下两个特点：

- 数组中每个元素表示向量的某个维度，每个元素都是一个浮点数。
 - 向量数组的大小（元素个数）表示整个向量空间的维度。

### 向量嵌入(Embedding)

向量嵌入(Embedding) 指的是通过深度学习神经网络提取非结构化数据里的内容和语义，把图片、视频等变成特征向量的过程。Embedding 技术将原始数据从高维度空间映射到低维度空间，将具有丰富特征的多模态数据转换为多维向量数据。

### 向量最近邻搜索

在当今信息爆炸的时代，用户常需要从海量数据中迅速搜索所需信息。例如在线文献数据库、电商平台产品目录、以及不断增长的多媒体内容库，都需要高效的搜索系统来快速定位到用户感兴趣的内容。随着数据量不断激增，传统的基于关键字的搜索方法已经无法满足用户对于搜索精度和速度的需求，向量搜索技术应运而生。向量最近邻搜索使用特征提取和向量化技术将文本、图片、音频等不同类型的非结构化数据转换为向量，使用相似性度量方法来比较它们之间的相似性，进而捕捉数据的深层次语义信息，从而提供更为准确和高效的搜索结果。

“搜索”和“查询”的区别主要在于结果的准确性，搜索返回近似结果，不保证返回结果 100% 准确，查询返回精确结果，保证返回结果 100% 准确。

其他相关术语请见[OceanBase 术语](https://www.oceanbase.com/docs/common-oceanbase-database-cn-1000000002325135)。

## 为什么选择 OceanBase 向量搜索？

OceanBase 向量搜索能力基于 OceanBase 多模一体化能力上构建，在融合搜索、扩展性、高性能、高可用、低成本、多租户、数据安全等方面均有优异的表现。

### 混合搜索

OceanBase 支持两个维度的混合搜索，真正实现用一套数据库解决应用多样存储搜索需求：

- 向量数据与标量数据的混合搜索。
 - 向量索引与全文索引的混合搜索。

向量索引与全文索引的混合搜索也支持同时叠加标量过滤条件。

### 分布式可扩展

OceanBase 作为原生分布式数据库，其水平扩展能力及多分区能力，支撑 OceanBase 对海量向量数据的支持。

### 高性能

OceanBase 向量搜索能力集成了索引算法库 VSAG，VSAG 算法库在 960 维的 GIST 数据集上表现出色，在 ANN-Benchmarks 测试中远超其他算法。

### 高可用

基于 Paxos 协议的数据同步容灾方案，OceanBase 向量搜索也支持主备/跨机房/跨地域容灾，对于基于内存的 HNSW 索引，容灾切换后也能实时访问。

### 事务性

OceanBase 数据库基于 Multi-Paxos 协议的分布式事务能力不仅保证了向量数据的一致性和完整性，还提供了有效的并发控制和故障恢复机制。

### 低成本

OceanBase 的存储编码压缩能力能够显著降低向量存储空间，节省应用的存储成本。

### 数据安全

OceanBase 数据库已经支持比较完整的企业级安全特性，包括身份鉴别和认证、访问控制、数据加密、监控告警、安全审计，可以有效保证向量搜索场景下的数据安全。

### 简单易用

OceanBase 向量搜索提供灵活的访问接口，不仅支持通过 MySQL 协议各种语言客户端使用 SQL 访问，也可以使用 Python SDK 访问。同时 OceanBase 也完成了对 AI 应用开发框架 LangChain 和 Llamaindex 的适配，更好的服务于 AI 应用开发。

### 完备的工具体系

OceanBase 具备完备的数据库工具体系，支持数据开发、迁移、运维、诊断等数据全生命周期的管理，给 AI 应用的开发维护保驾护航。

## 应用场景

- RAG（Retrieval Augmented Generation）搜索增强生成：RAG 是一个人工智能框架，用于从外部知识库中搜索事实，以便为大型语言模型 (LLM) 提供最准确、最新的信息，并让用户深入了解 LLM 的生成过程，常应用于智能问答、知识库等。
 - 个性化推荐：推荐系统可以根据用户的历史行为和偏好，向用户推荐可能感兴趣的物品。当发起推荐请求时，系统会基于用户特征进行相似度计算，然后返回与用户可能感兴趣的物品作为推荐结果，如饭店推荐、景点推荐等。
 - 图搜图/文本搜图：图像/文本搜索任务是指在大规模图像/文本数据库中搜索出与指定图像最相似的结果，在搜索时使用到的文本/图像特征可以存储在向量数据库中，通过高性能的索引存储实现高效的相似度计算，进而返回和搜索内容相匹配的图像/文本结果，如人脸识别等。

 上一篇 下一篇 ![有帮助](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*y6ocSqN8cqsAAAAAAAAAAAAAARQnAQ)![无帮助](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*BG9IQJyLHF8AAAAAAAAAAAAAARQnAQ)![反馈](https://gw.alipayobjects.com/mdn/ob_asset/afts/img/A*eTWdQKCRKHwAAAAAAAAAAAAAARQnAQ)[AI](https://www.oceanbase.com/obi) 咨询热线
