基于湖库一体架构,统一管理结构化、半结构化与非结构化等多模态数据,一个系统承载事务处理、实时分析与 AI 工作负载。
向量检索的概念、原理与应用
谈到向量数据库,通常会涉及“向量检索(Vector Search)”这一核心概念。本文将介绍向量检索的基本原理及其典型应用场景,并在此基础上,分享 OceanBase 如何通过内建向量检索能力,应对现代 AI 应用对数据存储与查询提出的新挑战。
内容更新时间:2026.07.25
什么是向量检索
在讲到向量数据库时,也会经常涉及向量检索这个概念。向量检索(Vector Search),也称为向量化检索或向量化搜索,是向量数据库的核心能力,是一种基于高维向量的搜索技术,用于在大规模数据集中快速找到与目标向量最相似的数据。
简单来说,向量检索通过计算向量之间的“距离”(比如欧氏距离、余弦相似度等),找到那些看起来“最像”的数据。
传统的信息检索方法(如关键词检索)通常依赖于精确的字符串匹配或符号操作,然而,当面对非结构化数据(如长文本、图像、音频等)时,直接使用关键词可能无法捕捉到语义或内容上的相似性。而向量检索利用了现代深度学习等机器学习技术,将非结构化数据(如自然语言、图片等)映射到向量空间,捕获数据中的语义关系或其他特征,从而实现高效的相似性搜索。
数据经过向量化处理后,可被表示为高维向量(例如,文本转为词嵌入向量,图像转为视觉特征向量)。当用户进行检索时,查询输入的内容(如一段文本、一张图片)同样被转化为向量,系统通过计算查询向量与数据库中存储的向量之间的“距离”(如欧几里得距离或余弦相似度)来衡量其相似性。相似度越高,说明数据与查询结果越相关。
向量检索的应用方向广泛,涵盖智能问答、图像识别、推荐系统、自然语言处理等众多领域,成为人工智能时代不可或缺的数据处理技术。
简单来说,向量检索通过计算向量之间的“距离”(比如欧氏距离、余弦相似度等),找到那些看起来“最像”的数据。
传统的信息检索方法(如关键词检索)通常依赖于精确的字符串匹配或符号操作,然而,当面对非结构化数据(如长文本、图像、音频等)时,直接使用关键词可能无法捕捉到语义或内容上的相似性。而向量检索利用了现代深度学习等机器学习技术,将非结构化数据(如自然语言、图片等)映射到向量空间,捕获数据中的语义关系或其他特征,从而实现高效的相似性搜索。
数据经过向量化处理后,可被表示为高维向量(例如,文本转为词嵌入向量,图像转为视觉特征向量)。当用户进行检索时,查询输入的内容(如一段文本、一张图片)同样被转化为向量,系统通过计算查询向量与数据库中存储的向量之间的“距离”(如欧几里得距离或余弦相似度)来衡量其相似性。相似度越高,说明数据与查询结果越相关。
向量检索的应用方向广泛,涵盖智能问答、图像识别、推荐系统、自然语言处理等众多领域,成为人工智能时代不可或缺的数据处理技术。
向量检索的基本原理
向量嵌入(Embedding)
在向量检索中,将图像、文本、音频等数据转换为向量表示是基础且关键的一步。
● 文本可以通过预训练的词嵌入模型(如Word2Vec、GloVe、BERT等)或句子嵌入模型生成向量。
● 图像可以通过卷积神经网络(CNN)提取特征向量。
● 音频信号可以通过声学模型生成向量。
将这些非结构化数据转换为向量形式,为后续的相似度计算和检索奠定了基础。
● 文本可以通过预训练的词嵌入模型(如Word2Vec、GloVe、BERT等)或句子嵌入模型生成向量。
● 图像可以通过卷积神经网络(CNN)提取特征向量。
● 音频信号可以通过声学模型生成向量。
将这些非结构化数据转换为向量形式,为后续的相似度计算和检索奠定了基础。
相似度度
向量检索中,常用的向量相似度度量方法有多种。
● 欧氏距离(Euclidean Distance,也称为欧几里得距离):计算两个向量之间的直线距离,值越小,相似度越高。
● 余弦相似度(Cosine Similarity):计算两个向量之间的夹角余弦值,值越接近1,相似度越高。
● 曼哈顿距离(Manhattan Distance):计算两个向量在各个维度上的绝对差之和。
● 内积(Dot Product):直接计算两个向量的点积,适用于归一化后的向量。
在实际应用中,为了平衡精度和效率,通常采用近似最近邻算法(ANN, Approximate Nearest Neighbor),而不是精确计算每个向量的距离。这种方法可以显著减少计算时间,同时保证结果的准确性在可接受范围内。
● 欧氏距离(Euclidean Distance,也称为欧几里得距离):计算两个向量之间的直线距离,值越小,相似度越高。
● 余弦相似度(Cosine Similarity):计算两个向量之间的夹角余弦值,值越接近1,相似度越高。
● 曼哈顿距离(Manhattan Distance):计算两个向量在各个维度上的绝对差之和。
● 内积(Dot Product):直接计算两个向量的点积,适用于归一化后的向量。
在实际应用中,为了平衡精度和效率,通常采用近似最近邻算法(ANN, Approximate Nearest Neighbor),而不是精确计算每个向量的距离。这种方法可以显著减少计算时间,同时保证结果的准确性在可接受范围内。
索引技术
当数据量非常庞大时,逐一计算所有向量与目标向量的相似度会带来巨大的计算成本。为了提高效率,通常会使用专门的索引结构来加速检索过程。
HNSW(Hierarchical Navigable Small World Graph)是一种基于图结构的索引。它通过构建多层的图结构来实现高效检索。在HNSW中,每个向量被表示为图中的一个节点,节点之间通过边连接,形成一个层次化的网络。在检索时,从顶层开始,通过节点间的边进行导航,逐步向下层搜索,直到找到与查询向量最相似的向量。这种结构能够利用图的特性,快速定位到可能包含相似向量的区域,减少需要比较的向量数量,从而提高检索速度。
IVF(Inverted File)是一种倒排索引技术。它将向量空间划分为多个子空间,每个子空间包含一部分向量。在检索时,首先通过计算查询向量与每个子空间的中心向量的距离,确定最有可能包含相似向量的子空间,然后在选定的子空间内进行精确搜索。IVF通过减少需要搜索的向量范围,加速了检索过程。
这些索引结构通过不同的方式优化了向量检索的效率,使得在大规模数据集中进行快速相似向量查找成为可能,为向量检索在各种场景中的应用提供了有力支持。
HNSW(Hierarchical Navigable Small World Graph)是一种基于图结构的索引。它通过构建多层的图结构来实现高效检索。在HNSW中,每个向量被表示为图中的一个节点,节点之间通过边连接,形成一个层次化的网络。在检索时,从顶层开始,通过节点间的边进行导航,逐步向下层搜索,直到找到与查询向量最相似的向量。这种结构能够利用图的特性,快速定位到可能包含相似向量的区域,减少需要比较的向量数量,从而提高检索速度。
IVF(Inverted File)是一种倒排索引技术。它将向量空间划分为多个子空间,每个子空间包含一部分向量。在检索时,首先通过计算查询向量与每个子空间的中心向量的距离,确定最有可能包含相似向量的子空间,然后在选定的子空间内进行精确搜索。IVF通过减少需要搜索的向量范围,加速了检索过程。
这些索引结构通过不同的方式优化了向量检索的效率,使得在大规模数据集中进行快速相似向量查找成为可能,为向量检索在各种场景中的应用提供了有力支持。
向量检索的典型应用场景
文本检索
图像检索
智能推荐
文本检索:企业智能知识库和问答助手
在文本检索领域,向量检索技术被广泛应用于企业知识库和智能问答助手,通过理解用户查询的语义,提供精准的答案推荐。
通过将文本转化为向量,利用向量间的相似度计算,能高效判断文本间的语义相似性。比如,企业往往积累了海量的文档、报告等资料,用户或员工在查找信息时,传统关键词检索可能难以精准定位。利用向量检索,可对知识库中的文本进行向量化,构建索引。当用户或员工输入问题时,将问题转化为向量,通过计算与知识库中文本向量的相似度,就能快速返回与问题高度相关的文档,或直接基于GenAI技术生成答案,极大提高工作效率和用户体验,让企业知识资源得以更好地利用。
OceanBase 的向量检索能力
OceanBase 基于原生分布式架构,通过在存储层加入 Vector 向量数据类型,并在索引层加入向量索引,使得 OceanBase 数据库具备了向量检索能力。OceanBase 的向量检索能力主要体现在:
支持的向量数据类型
支持最大 16,000 维的 float 稠密向量数据存储。
支持稀疏向量数据存储。
支持稀疏向量数据存储。
向量索引
● 支持精确搜索和近似最近邻搜索。
● 支持 L2 距离、内积和余弦相似度计算。
● 支持 HNSW/HNSW_SQ/HNSW_BQ 索引,索引列最大维度为 4096。
● 支持 IVF 索引/IVF_SQ 索引/IVF_PQ 索引(实验特性),索引列最大维度为 4096。
除了向量索引,还支持标量索引、半结构化索引(如多值索引、空间索引),以及全文索引,并且支持同时访问多路索引,为复杂的数据检索需求提供了坚实保障。
● 支持 L2 距离、内积和余弦相似度计算。
● 支持 HNSW/HNSW_SQ/HNSW_BQ 索引,索引列最大维度为 4096。
● 支持 IVF 索引/IVF_SQ 索引/IVF_PQ 索引(实验特性),索引列最大维度为 4096。
除了向量索引,还支持标量索引、半结构化索引(如多值索引、空间索引),以及全文索引,并且支持同时访问多路索引,为复杂的数据检索需求提供了坚实保障。
超群的向量性能
同等环境下,VectorDBBench 向量性能测试远超 PGVector、ElasticSearch 等向量数据库;
集成 VSAG 索引算法库,在 ANN-Benchmarks 测试中,960 维 GIST 数据集上性能优异,无惧超高吞吐。
集成 VSAG 索引算法库,在 ANN-Benchmarks 测试中,960 维 GIST 数据集上性能优异,无惧超高吞吐。
向量搜索支持 SQL 运算符
OceanBase支持向量加、减、乘、比较、聚合等基础SQL运算操作符。用户可以通过标准 SQL 语言创建向量表并写入向量数据,使用标准 SQL 语法导入向量数据并进行 DML 操作,还可以直接在对应的向量字段上创建向量索引,并指定索引类型和距离算法,利用 SQL 直接查询,操作简便直观,并可复用 MySQL 生态中各语言的客户端,极大降低开发人员的学习成本。
免费体验 OceanBase 的向量检索能力
OceanBase 一体化数据底座与独立向量数据库的区别
作为具备向量能力的通用数据库,OceanBase 通过其一体化架构、强大的事务能力、HTAP 特性以及生态兼容性,可以为用户提供了更全面、更高效的解决方案,尤其适合需要同时处理结构化和非结构化数据的复杂业务场景。
相较于单独选择向量数据库,OceanBase 一体化架构具备以下优势:
相较于单独选择向量数据库,OceanBase 一体化架构具备以下优势:
混合检索能力
OceanBase 的多模融合一体化架构,可简化 AI 应用开发,降低运维门槛。
OceanBase 不仅原生支持关系型数据,兼容 KV 文档及向量数据,还支持 JSON、GIS、Bitmap 等多种数据类型。企业可以将所有的多模数据集中整合至单一的 OceanBase 数据库中,避免因不同类型数据存储于不同数据库而产生的数据孤岛问题。同时,OceanBase能同时支持向量索引、空间索引、全文索引等多种索引类型,为多模数据混合检索提供了强大支撑。
当面临复杂查询,如同时涉及文本、图像和位置信息的检索时,OceanBase能迅速调用相应的索引进行混合检索。例如在零售场景中,用户输入“在我家附近售卖、价格合理且外观好看的手机”,OceanBase就能综合空间数据、标量数据和图像向量数据,快速返回符合要求的商品信息。混合检索能力打破了传统向量数据库仅能处理单一模态数据的局限,为用户提供更全面、精准的检索结果,极大地提升了AI应用的实用性和用户体验。
OceanBase 不仅原生支持关系型数据,兼容 KV 文档及向量数据,还支持 JSON、GIS、Bitmap 等多种数据类型。企业可以将所有的多模数据集中整合至单一的 OceanBase 数据库中,避免因不同类型数据存储于不同数据库而产生的数据孤岛问题。同时,OceanBase能同时支持向量索引、空间索引、全文索引等多种索引类型,为多模数据混合检索提供了强大支撑。
当面临复杂查询,如同时涉及文本、图像和位置信息的检索时,OceanBase能迅速调用相应的索引进行混合检索。例如在零售场景中,用户输入“在我家附近售卖、价格合理且外观好看的手机”,OceanBase就能综合空间数据、标量数据和图像向量数据,快速返回符合要求的商品信息。混合检索能力打破了传统向量数据库仅能处理单一模态数据的局限,为用户提供更全面、精准的检索结果,极大地提升了AI应用的实用性和用户体验。
更低成本存储海量向量数据
OceanBase 的原生分布式特性,使其在支持 AI 场景的海量数据的高性能存储与计算及灵活扩展方面具备明显的优势。
OceanBase 可实现内存+磁盘分布式处理,支持不同类型企业的千万级、亿级、十亿+级不同规模向量数据的存储,同时,OceanBase 的原生分布式架构,可支持更灵活的横向扩缩容,满足 AI 应用快速增长的海量数据存储需求。
此外,OceanBase 凭借领先的压缩算法,可以从内存与磁盘多层面显著降低存储成本。支持二进制量化算法,同等向量性能下,内存成本可降低 95%;支持半结构化(JSON)数据压缩,从而助力 AI 应用中的半结构化数据存储成本降低超 40%。
OceanBase 可实现内存+磁盘分布式处理,支持不同类型企业的千万级、亿级、十亿+级不同规模向量数据的存储,同时,OceanBase 的原生分布式架构,可支持更灵活的横向扩缩容,满足 AI 应用快速增长的海量数据存储需求。
此外,OceanBase 凭借领先的压缩算法,可以从内存与磁盘多层面显著降低存储成本。支持二进制量化算法,同等向量性能下,内存成本可降低 95%;支持半结构化(JSON)数据压缩,从而助力 AI 应用中的半结构化数据存储成本降低超 40%。
企业级的数据管理能力
作为通用性数据库,OceanBase 的系统稳定性和容灾能力,在双11等大规模业务场景中已经经历十余年的打磨和验证。基于 Paxos 以及数据同步容灾方案,OceanBase 向量检索也支持主备/跨机房/跨地域容灾,对于基于内存的 HNSW 索引,容灾切换后也能实时访问。
同时,OceanBase 数据库已经支持比较完整的企业级安全特性,包括身份鉴别和认证、访问控制、数据加密、监控告警、安全审计,可以有效保证向量检索场景下的数据安全。
同时,OceanBase 数据库已经支持比较完整的企业级安全特性,包括身份鉴别和认证、访问控制、数据加密、监控告警、安全审计,可以有效保证向量检索场景下的数据安全。
上手简单、更易运维
OceanBase 向量检索提供灵活的访问接口,不仅支持通过 MySQL 协议各种语言客户端使用 SQL 访问,也可以使用 Python SDK 访问。同时 OceanBase 也完成了对 AI 应用开发框架 LangChain 和 Llamaindex 的适配,无论是新手还是有经验的开发者,都能快速上手使用。同时,OceanBase 提供了一套完整的运维工具体系,包括数据迁移工具 OMS、开发者工具 ODC、运维管理工具 OCP,支持 AI 应用全生命周期管理。
OceanBase 向量检索能力在 AI 应用中的实践
OceanBase 的向量检索能力可以应用在多个 AI 应用场景。
RAG 智能知识库/智能问答 AI 助手
在检索增强生成(Retrieval-Augmented Generation, RAG)智能问答场景中,OceanBase 的向量检索能力可以将非结构化文本或知识库中的丰富信息高效索引,并快速匹配与用户提问语义相关的内容,从而为生成式 AI 模型提供精准的上下文,提升问答的准确性和丰富度。通过这个能力,企业可以更便捷的搭建基于自己知识库的智能问答AI助手。
AI 助手 Demo 及实现教程
混合检索智能体 AI Agent
在实际场景中,用户的问题往往需要结合多种数据进行检索回答。OceanBase 支持向量数据、关系数据和 GIS 等融合查询,并可通过 SQL 与 SDK 灵活调用,结合多模数据及多类型索引,提供融合查询能力。例如,将空间 GIS 数据和向量检索融合,可以快速通过 OceanBase 去构建一个景点推荐的智能助手,无需再构建多个数据库进行检索。
查看混合检索 Demo 及实现教程
以图搜图
在电商场景中,经常会用到用图片搜索商品的能力。当用户上传一张商品图片进行搜索时,OceanBase 首先利用深度学习模型对图片进行特征提取,将其转化为向量表示。然后,通过高效的索引结构,如 HNSW、IVF 等,在图像向量库中快速查找与查询向量相似度高的图像向量,返回与查询图片相似的商品信息,实现以图搜图。
查看图搜图 Demo 及实现教程
结语
向量检索在信息检索领域具有重要意义,它打破了传统关键词检索的局限,能精准捕捉非结构化数据的深层语义信息,提升信息检索的准确性和效率。
在 AI 应用方面,向量检索为图像识别、语音识别、自然语言处理等提供了核心支持,让 AI 应用能更好地理解和处理复杂多样的数据。无论是构建智能推荐系统,还是打造高效的智能客服,都离不开向量检索的助力。
在 AI 应用方面,向量检索为图像识别、语音识别、自然语言处理等提供了核心支持,让 AI 应用能更好地理解和处理复杂多样的数据。无论是构建智能推荐系统,还是打造高效的智能客服,都离不开向量检索的助力。