---
title: 什么是数据库_数据库概念_数据库应用-OceanBase
description: 介绍什么是数据库，数据库的发展历程、技术原理、分类和适用场景的介绍，以及如何进行数据库选型等数据库基础。企业进行数据库选型，不仅要考虑到当前的业务需求，更要思考 AI 时代下的技术创新和扩展空间。
image: https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*OSPzQ6GUQF4AAAAAQHAAAAgAeiGDAQ/original
---
切换语言

- 中文站 - 简体中文
- International - English
- 日本站 - 日本語

[AI](https://www.oceanbase.com/obi) 咨询热线 目录 [什么是数据库](#distinctionone "什么是数据库") [数据库的发展历程](#distinctiontwo "数据库的发展历程") [数据库核心技术原理](#distinctionthree "数据库核心技术原理") [数据库分类与适用场景](#scenescene1 "数据库分类与适用场景") [数据库技术挑战与趋势](#distinctionfive "数据库技术挑战与趋势") [OceanBase 的一体化数据底座实践](#advantageadvantage1 "OceanBase 的一体化数据底座实践") [数据库选型与实施建议](#distinctionseven "数据库选型与实施建议") [首页](https://www.oceanbase.com/)[数据库专题](https://www.oceanbase.com/topic)数据库基础概念

# 数据库基础概念

介绍什么是数据库，数据库的发展历程、技术原理、分类和适用场景的介绍，以及如何进行数据库选型等数据库基础。企业进行数据库选型，不仅要考虑到当前的业务需求，更要思考 AI 时代下的技术创新和扩展空间。 [免费下载](https://www.oceanbase.com/softwarecenter-standalone) 内容更新时间：2026.07.17

## 什么是数据库

数据库的定义与作用 数据库是用于存储、管理和组织数据的系统或集合，是按照特定的结构和规则将数据长期存此独立 储在计算机或服务器内的、有组织的、可共享的、统一管理的数据集合，便于用户高效地进删除的内容:。用户能对其中的数据进行新增、截取、更 行数据的查询、更新和管理。它通常由数据库管理系统（DBMS）进行控制，以确保数据的安新、删除等操作。 全性、完整性和一致性。
 数据库的核心功能体现在数据存储、管理与检索上。数据存储是其基础功能，能将大量数据有序地保存在计算机系统中，为后续使用提供基础。数据管理，则体现在可对数据进行分类、组织、更新和维护，并确保数据的准确性和一致性。数据检索功能则能让用户快速从海量数据中查找到所需信息，极大地提高了信息获取的效率。
 在信息系统中，数据库占据着核心地位，为各种应用提供数据支持。在企业运营中，数据库存储着客户信息、产品数据、销售记录等关键信息，为企业运营和决策提供数据支撑；在科研领域，数据库用于存储实验数据、研究成果，助力科研人员开展研究；在互联网领域，数据库支撑着高并发应用正常运行，存储用户数据、交易记录等。数据库的高效运行，直接关系到信息系统的稳定性和可靠性，是信息系统不可或缺的重要组成部分。 数据库管理系统（DBMS） 数据库管理系统（DBMS）是一种软件，主要任务是帮助用户轻松地创建、管理和维护数据库，同时确保数据的安全性、完整性和一致性。DBMS通过抽象和屏蔽底层的复杂性，使用户能够以更简单的方式与数据交互。
DBMS 的主要作用包括数据的存储管理、提供查询接口、维护数据一致性、支持多用户并发操作、进行数据备份并防止数据丢失等。DBMS能够处理各类复杂的数据增删改查操作，同时提供性能优化能力以提高数据访问效率。通过权限控制和安全机制，DBMS还能保护数据免受未授权访问和传输安全。此外，DBMS负责进行数据的备份及系统故障后的数据恢复，以确保业务的连续性。

## 数据库的发展历程

早期阶段 在数据库发展早期，文件系统是最早用于数据管理的形式。数据以文件形式存储在计算机系统中，每个应用程序直接操作自己的数据文件。这种方式在数据量较小、应用简单时较为适用，但随着数据量的增加和应用的复杂化，文件系统的问题逐渐暴露，如数据冗余大、数据一致性难以保证、数据共享困难等。
为了解决这些问题，层次数据库和网状数据库应运而生。1968年，IBM推出的信息管理系统（IMS）是典型的层次数据库，它将数据组织成树形结构，数据的存储和检索通过指针进行，具有较高的查询效率。但其数据模型复杂，数据的插入和删除操作较为繁琐。CODASYL推出的网状数据库，采用网络模型，数据记录之间可以形成复杂的关系，在处理复杂关系和高效数据访问方面具有优势，如DBTG系统。不过，这类数据库的复杂性和可扩展性限制了其广泛应用，且由于指针的使用，一旦指针被破坏，整个数据库就可能受损。 关系型数据库崛起 1970年，E.F. Codd在《Communications of the ACM》杂志上发表了《A Relational Model of Data for Large Shared Data Banks》论文，标志着关系模型的诞生。这一模型将现实世界抽象为二维表，通过关系代数的集合运算和关系运算，具有强大的查询表达能力，简化了数据管理和查询的复杂性。关系模型的提出标志着现代数据库系统的诞生。  
 基于关系模型，SQL语言也随之诞生。SQL语言是一种非过程化语言，用户只需提出“做什么”，无需关注“怎么做”，极大地降低了数据库的使用难度。关系型数据库以关系模型和SQL语言为基础，迅速发展起来。INGRES作为早期的关系数据库系统，为后来的数据库发展奠定了基础。Oracle、Microsoft SQL Server等商业关系型数据库产品随后出现，凭借其强大的功能和稳定性，在金融、电信、政务等领域广泛应用。  
 关系型数据库的崛起，使数据库技术进入了一个新的时代。它为数据管理提供了更加规范、高效的方法，支持事务处理和复杂查询，满足了信息时代早期对数据库的使用需求，对后续数据库技术的发展产生了深远影响。 后关系型时代 进入21世纪，互联网的快速发展带来了数据量的急剧增加，传统关系型数据库因严格的事务一致性要求，在扩展能力上受到制约，难以满足海量数据存储和高并发访问的需求。在此背景下，NoSQL数据库应运而生。  
 NoSQL数据库具有灵活的可扩展性，设计之初就为了满足“横向扩展”需求，天生具备良好的水平扩展能力。其数据模型灵活，摒弃了关系数据模型，采用键值、列族等非关系模型，摆脱了关系数据库的各种束缚条件。在大数据时代，NoSQL数据库支持MapReduce风格的编程，能够较好地应用于各种数据管理。  
 NoSQL数据库在应对大数据、高并发场景方面表现出色。例如，键值型数据库Redis，以其高速读写和简单数据结构，在缓存系统中广泛应用。文档型数据库MongoDB，适用于存储和查询复杂、半结构化数据，如用户信息、文章内容等。列族型数据库HBase，基于Hadoop分布式文件系统，适合存储大规模稀疏数据。这些NoSQL数据库的出现，为不同场景下的数据存储和处理提供了更多选择，推动了数据库技术的多元化发展。 云原生与分布式数据库 随着云计算技术的成熟和普及，数据库的云原生与分布式趋势日益明显。云原生数据库充分利用云计算资源，能够根据负载变化自动扩展计算和存储资源，具有弹性伸缩、按需付费、高可用性等特点。云原生数据库采用容器、微服务等云原生技术，实现模块化、可观察、可部署等特性，便于管理和运维。  
 分布式数据库则将数据分布在多台计算机上存储，通过分布式事务处理和并行查询等技术，提供高并发、高扩展性的能力。在分布式架构下，数据库能够充分利用多台服务器的计算和存储资源，有效应对大规模数据存储和高并发访问场景。  
 以分布式数据库OceanBase为例，其原生分布式架构，支持水平扩展，具有高并发、高可用和强一致性的特点，OB Cloud云数据库产品，则充分利用了云上优势，基于多云原生能力打造不同云基础设施的一致体验。OceanBase在金融、互联网、零售等领域广泛应用，成功支撑了双11等大规模高并发场景，展现了分布式数据库的强大实力。此外，其独特的一体化数据架构，可实现事务处理与实时分析的HTAP多工作负载，原生支持SQL 与 NoSQL 多模数据，以及关系、向量、GIS的融合查询，在多模数据融合方面具有独特优势，满足了现代企业对多样性数据处理的多元需求。

## 数据库核心技术原理

数据模型 数据模型是描述数据及其关系的抽象表示，是数据库的基础，用于定义数据的结构、关系和存储方式。常见的数据模型主要有关系型和非关系型。  
 关系型数据模型使用表（表格）来组织数据，数据以行和列的形式存储。表中的每一行代表一个记录，每一列代表一个字段。数据表之间通过关系（键）相互关联，如主键、外键等。这种模型具有模式固定、事务处理和SQL查询语言等特点，支持ACID事务，确保数据的完整性和一致性。适用于复杂的事务处理和需要强一致性的场景，如金融、会计系统。典型的关系型数据库有Oracle、MySQL等。  
 非关系型数据模型则不使用关系模型，而改为键值型、文档型等。键值型数据模型以键值对的形式存储数据，结构简单，查询速度快，适用于需要高速读写和简单数据结构的场景，如缓存系统。文档型数据模型以文档形式存储数据，文档内部可以包含复杂的结构，如JSON文档。它适用于存储和查询复杂、半结构化数据，如用户信息、文章内容等。常见的非关系型数据库有MongoDB、Redis等。  
 关系型数据模型强调数据的结构化和一致性，适合处理复杂事务；而非关系型数据模型更注重数据的灵活性和高并发性能，适用于大规模数据存储和高并发访问场景。 数据存储与索引 数据库的存储技术涉及将数据高效地写入磁盘的机制，包括分区存储、数据压缩和磁盘排序等。为了降低存储和检索成本，数据库采用不同的存储引擎，每种引擎对事务、写入性能和读写优化有不同支持。  
 索引是提高数据库查询性能的关键技术。最常见的索引类型是B+树，它通过多层节点结构实现快速定位；此外还有哈希索引、全文索引等，适用于不同场景。合理设计索引可以显著提升查询性能，但也会增加存储开销和维护成本，因此需要权衡。  
 为了提高存储效率，可以从多个方面入手。在表设计上，合理选择数据类型，减少数据冗余，使用分区技术将大表分割成小表。在索引设计上，根据查询需求选择合适的索引类型，避免过度索引。 查询处理与执行计划 SQL解析是查询处理的起点。当用户提交SQL查询语句后，数据库系统首先对其进行词法分析和语法分析。词法分析将SQL语句分解成一个个具有独立意义的单词，如关键字、表名、列名等。语法分析则根据SQL语法规则，检查语句的合法性，生成语法树。语法树是SQL语句的抽象表示，为后续的查询优化和执行提供了基础。  
 查询优化器是查询处理的核心组件，它的主要任务是从多个可能的执行计划中选择最优的一个。优化器会根据统计信息、表结构、索引情况等信息，评估不同执行计划的代价，如CPU消耗、I/O次数等。常见的优化技术包括基于规则的优化和基于代价的优化。基于规则的优化根据预定义的规则对查询进行转换，如将子查询转换为连接操作等。基于代价的优化则通过计算不同执行计划的代价，选择代价最低的执行计划。  
 执行计划生成是根据优化器选定的最优方案，生成具体的执行步骤。执行计划通常包括数据的读取方式（如全表扫描、索引扫描）、连接算法（如嵌套循环连接、哈希连接）等。数据库系统会根据执行计划，按照步骤执行查询操作，从磁盘或缓存中读取数据，进行计算和筛选，最终返回查询结果。在执行过程中，数据库系统还会根据实际情况动态调整执行计划，以适应数据的变化和系统负载。 事务与ACID特性 原子性通过事务日志和回滚段来实现。在事务开始执行时，数据库系统会将事务的所有操作记录在事务日志中。如果事务执行过程中出现错误或用户主动回滚事务，系统可以通过事务日志回滚到事务开始之前的状态，保证事务中的所有操作要么全部完成，要么全部不完成。 一致性通过约束检查和事务管理来实现。数据库系统会检查事务执行前后是否满足完整性约束，如主键约束、外键约束等。如果事务违反了完整性约束，系统会回滚事务，保证数据的一致性。事务管理通过保证事务的原子性和隔离性，间接地维护数据的一致性。  
 隔离性通过锁机制和MVCC来实现。锁机制通过为数据加锁，防止多个事务同时修改数据，从而保证事务的隔离性。MVCC则通过为数据维护多个版本，使得不同事务可以同时读取和修改数据，而不会产生冲突，从而实现事务的隔离。  
 持久性通过事务日志和磁盘同步来实现。在事务提交时，数据库系统会将事务日志写入磁盘，并确保事务对数据的修改也持久化到磁盘上。这样，即使系统发生故障，也能通过事务日志恢复数据，保证事务的持久性。 [并发控制与锁机制](https://open.oceanbase.com/learning) 锁机制是数据库中最常用的并发控制机制之一。它通过为数据加锁，防止多个事务同时对同一数据进行修改操作，从而保证数据的一致性和完整性。锁可以分为共享锁和排他锁。共享锁允许多个事务同时读取数据，但不允许其他事务修改数据；排他锁则只允许一个事务对数据进行读写操作，其他事务都不能访问该数据。锁的粒度也可以分为行锁、表锁等，行锁只锁定被操作的行，表锁则锁定整个表。  
 MVCC是一种多版本并发控制机制，它通过为数据维护多个版本，使得不同事务可以同时读取和修改数据，而不会产生冲突。在MVCC中，每个事务读取数据时，会看到在它开始之前已经提交的事务所做的修改，而不会看到未提交的事务所做的修改。这样可以避免读取到脏数据，提高事务的并发性能。MVCC的实现通常依赖于版本链和一致性视图。版本链记录了数据的历史版本，一致性视图则决定了事务在读取数据时能看到哪些版本。  
 锁机制和MVCC在并发控制中各具优势。锁机制能够有效地防止数据冲突，保证数据的一致性，但在高并发场景下，可能会导致锁竞争，降低系统性能。MVCC则通过多版本控制，提高了事务的并发性能，但在维护多个版本时，会增加系统的存储和计算开销。在实际应用中，数据库系统会根据不同的场景选择合适的并发控制机制，以达到最佳的并发效果。 大家可以通过 OceanBase 在线课堂了解学习更多数据库的体系化知识 ![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*-yxvSquOh6QAAAAAAAAAAAAADiGDAQ/original)

## 数据库分类与适用场景

### 按存储类型分类

### 按数据部署模式分类

根据存储类型，数据库可分为关系型数据库（RDBMS）和非关系型数据库（NoSQL）。 关系型数据库使用表格形式存储数据，数据以行和列的形式存储。它强调数据的结构化和一致性，提供了事务处理和复杂查询的支持，能确保数据的完整性和一致性。其优势在于数据管理规范，事务处理和查询功能强大。适用于金融和传统企业系统等对数据一致性要求高的场景。 非关系型数据库则具有灵活的数据模型，包括文档型数据库、键值型数据库、图数据库和列族型数据库等。键值型数据库以键值对形式存储数据，结构简单，查询速度快，适合缓存系统。文档型数据库以文档形式存储，内部可包含复杂结构，适用于存储和查询复杂、半结构化数据。列族型数据库基于列族存储，适合存储大规模稀疏数据。非关系型数据库的优势在于灵活的可扩展性，能应对大数据、高并发场景。 [了解 OceanBase 数据库的多模一体化能力![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*-yxvSquOh6QAAAAAAAAAAAAADiGDAQ/original)](https://open.oceanbase.com/blog/12328919072)

## 数据库技术挑战与趋势

数据库面临的主要挑战 数据规模的爆炸式增长：随着数字经济的蓬勃发展，数据规模正以惊人的速度爆炸式增长。从互联网企业的海量用户数据，到科研领域的庞大数据集，再到物联网设备的实时数据流，数据的体量呈几何级数增长。这给数据库技术带来了巨大挑战，传统集中式数据库在存储容量和读写性能上都难以满足需求，如何高效存储和管理这些海量数据，成为亟待解决的问题。
 数据多样性和复杂性激增：互联网时代的数据来源多样化，包括结构化数据（如关系型数据）、半结构化数据（如JSON、XML）、非结构化数据（如图片、音视频、文本），以及物联网生成的大量时序数据。这种异构数据存储和管理难度大大增加。
 实时性与低延迟需求：现代企业对数据的时效性要求越来越高。金融市场的实时交易分析、互联网平台的智能推荐等场景，都需要数据库能够在极短时间内处理大量数据并返回分析结果。而传统数据库在实时数据处理能力上存在短板，难以满足这种毫秒级响应的实时分析需求。 数据库的发展趋势 分布式架构的普及：分布式数据库已成为应对海量数据和高并发访问的主要解决方案。通过分片、复制和一致性协议（如Raft、Paxos），分布式数据库能够在扩展性、可靠性和性能之间取得平衡。  
 数据库加速上云：随着云计算技术的普及，更多企业在加速将数据迁移到云端。云数据库充分利用云计算资源，能够根据负载变化自动扩展计算和存储资源，具有弹性伸缩、按需付费、高可用性等特点。此外，无服务器化（Serverless）的数据库服务逐渐兴起，在无需复杂运维的情况下支持高性能和高可用性。  
 多模（Multi-Model）数据库崛起：多模数据库也是数据库技术发展的重要方向。在实际应用中，企业往往需要同时处理多种类型的数据，如结构化数据、半结构化数据和非结构化数据。多模数据库能够在一个系统中支持多种数据模型，提供统一的查询和管理接口，简化了数据管理的复杂性，提高了数据利用效率。多模数据库融合将更好地满足企业多元化数据处理需求，推动数据库技术向更加全面、灵活的方向发展。  
 AI 与数据库的深度融合：AI 驱动优化是数据库技术发展的另一大趋势。通过将人工智能技术融入数据库系统，可以实现智能查询优化、智能索引推荐等功能。AI能够根据历史查询模式、数据访问频率等信息，自动生成更优的执行计划，提高查询效率；还可以根据数据特点，推荐合适的索引结构，减少索引维护成本。AI 驱动的数据库优化将使数据库系统更加智能化、自适应，更好地满足复杂多变的应用需求。

## OceanBase 的一体化数据底座实践

OceanBase 作为自主研发的国产数据库，通过一体化架构升级，实现了从单机到分布式的灵活切换、TP 与 AP 场景的深度融合，以及多模能力与向量计算、AI 技术的协同进化，帮助用户简化数据架构。 单机分布式一体化 兼备分布式可扩展与集中式性能的双重技术优势，可灵活应对从中小规模到超大规模的不同阶段业务需求。单机版不仅支持从单机到分布式架构的灵活切换，以及主备高可用与多副本高可用模式的动态调整，还依托多模能力，在单机版上调用所有向量能力，助力用户构建专属 AI 应用。 TP + AP多工作负载一体化 支持行存、列存及行列混存，能够同时满足联机事务处理和实时分析工作负载的需求。消除复杂的 ETL 和冗余数据，并提供资源隔离能力，避免对关键业务的干扰和额外存储本开销。配备可处理复杂 SQL 的企业级优化器，确保不同工作负载下始终保持卓越性能。 SQL+NoSQL一体化 通过一个引擎原生支持多种数据访问模式，涵盖 SQL 和 NoSQL API，满足多样化数据模型的需求，简化数据架构。支持多种数据类型，包括键值、JSON、GIS、XML、全文索引和 SQL 查询，并提供 Table API，兼容 HBase 接口，确保在大规模数据存储和高性能读写场景中，始终展现卓越的处理能力。 SQL+AI一体化 支持向量数据、关系数据和 GIS 等融合查询，SQL 执行关系数据操作，无缝集成向量检索，助力 AI 应用快速落地。 支持向量数据、索引与检索，可通过 SQL 与 SDK 灵活调用。结合分布式存储、多模数据及多类型索引，提供统一的查询能力，简化 AI 技术栈，助力 RAG、智能推荐、多模态搜索及 AI Agent 等复杂场景的实现。

## 数据库选型与实施建议

数据库选型关键因素 业务场景是数据库选型的首要考量。 不同业务对数据库的需求差异显著。如金融交易系统，要求数据库具备高事务处理能力和强一致性来保障资金安全；而互联网社交平台，则更看重数据库的高并发读写能力以应对海量用户访问。  
 数据规模也是关键因素。 中小规模数据可采用轻量级数据库；而大规模数据则需选择能支持水平扩展的分布式数据库，如OceanBase。一致性要求方面，对数据准确性要求极高的场景，如医疗记录存储，必须选择支持ACID事务的关系型数据库；而对一致性要求相对宽松的场景，则可选择非关系型数据库。  
 成本预算同样不可忽视，它决定了数据库的选型范围。 在有限的预算下，需权衡数据库的购买成本、维护成本、培训成本及未来升级的成本等，选择性价比最高的方案。综合这些因素，才能选出最符合业务需求的数据库。 [实施步骤](https://www.oceanbase.com/whitepaper/genai-data-platform) 需求分析是数据库实施的基础。要全面了解业务需求，明确数据存储需求、数据处理需求、性能需求等，如需要存储哪些数据、表结构如何设计、预期的并发用户数等。然后根据业务需求，确定需要选择的数据库类型，并据此调查和列出技术生态中主流的数据库产品，作为候选数据库。
在技术评估阶段，需要对候选数据库的功能特性进行深入研究，包括其事务支持、扩展性、一致性和兼容性等，此阶段还需要考虑数据库的技术生态和社区活跃度。
性能测试是验证数据库是否满足业务需求的关键环节。通过搭建测试环境，模拟实际业务负载，以评估其响应时间、吞吐量、失败恢复时间及资源占用等。测试数据要尽可能接近实际业务，包括数据规模、并发量、写入和读取比例等，以保证测试结果的参考价值。例如，可以通过Sysbench或自定义的压测工具，测量数据库的吞吐量、响应时间和资源利用率等指标。
结合业务预算和资源情况，评估候选数据库的成本，包括硬件、软件许可证费用（如付费数据库的授权费用）、运维成本（人力和技术复杂性）以及长期扩展成本。此外，还需关注其资源消耗情况（CPU、内存、磁盘等），确保选择的数据库方案符合现有或预期的资源条件。 此外，还需评估数据库与现有技术架构的兼容性，例如是否支持现有的开发语言、框架，是否可以平滑进行数据迁移等。此外，还需针对潜在的使用风险进行预估，包括技术锁定、故障恢复能力、迁移复杂性，及数据一致性在特殊情况下是否可控。
在综合以上各方面的分析后，最终确定数据库选型并制定实施计划。实施阶段包括数据库的安装、配置、迁移和测试等工作。为了降低风险，建议采用分阶段上线的方式，先在非核心业务中试用新数据库，再逐步扩展到全系统。
大模型和生成式人工智能的快速迭代，正在重塑企业的数据战略。在此背景下，企业进行数据库选型，不仅要考虑到当前的业务需求，更要思考 AI 时代下的技术创新和扩展空间。可以参考 IDC 与 OceanBase联合发布的IDC数据库前沿趋势白皮书《化繁为简 简化架构 —— 一体化数据库，打造GenAI时代数据底座》。 下载 IDC 白皮书《一体化数据库，打造 GenAI 时代数据底座》 ![](https://mdn.alipayobjects.com/huamei_22khvb/afts/img/A*-yxvSquOh6QAAAAAAAAAAAAADiGDAQ/original)
