2024年海内外数据库技术演进深度解析:大数据浪潮下数据库的演进
- 来源:招商证券
- 发布时间:2024/07/08
- 浏览次数:1246
- 举报
海内外数据库技术演进深度解析:大数据浪潮下数据库的演进.pdf
海内外数据库技术演进深度解析:大数据浪潮下数据库的演进。随互联网、大数据发展,数据量膨胀、数据类型不断丰富、数据应用不断深化,模型拓展与架构解耦并存,数据库技术演变特征包括:分布式架构逐渐成熟;数据模型不断拓展,非关系型数据库开始兴起;统一框架支撑分析与事务混合处理;与云基础设施深度结合。本篇我们将围绕这些特征,重点探讨数据库技术的演变趋势。技术架构:分布式架构日渐兴起、逐渐成熟。相较于传统的集中式数据库架构,分布式架构能更好适应高并发、大流量、高可用特征。近年分布式数据库逐渐成熟,其平滑扩展的特性适用于业务弹性较大的业务系统,能够支撑多节点的数据存储和管理,提高数据的可靠性和可扩展性。在分布...
一、数据库发展综述:NoSQL、分析型、分布式和 云蓬勃发展
在大数据系列第一篇《筚路蓝缕,星火燎原——大数据系列(一):数据库深 度复盘与展望》中,我们认为数据库顺应市场需求持续进化,并从数据模型逻 辑、技术架构、需求功能、部署方式、存储介质、商业模式、数据库治理模式 等七大维度对数据库发展脉络进行详细阐述,理清了行业演化逻辑与发展趋势。 在大数据系列第二篇《从 Snowflake 快速崛起深度解析数仓竞争要素——大数 据系列(二):数据仓库深度分析》中,我们分析了在数据量愈加庞大和分析 需求兴起的背景下,数仓的技术发展路径和竞争要素。在大数据系列第四篇 《下游多元需求下国产数据库的崛起——大数据系列(四):国内数据库行业 需求深度分析》中,我们从产品类型及下游行业两个角度分析了国内数据库市 场需求趋势。
1、全球数据库市场规模概览
从数据库分类来看:数据库管理系统是“按照数据结构来组织、存储和管理数 据的仓库”,是一种用于建立、使用、操纵和管理数据库的大型基础软件,既 是业务数据的存储中心,也是统计分析计算的基础,对 IT 核心系统起着关键性 作用,是信息化时代、大数据时代中各行各业不可或缺的重要基础软件。按其 管理的数据结构,可分为关系型数据库、非关系型数据库(NoSQL,包括键值 型、文档型、图、对象型等);按其设计架构可分为集中式数据库和分布式数 据库;按其部署模式可分为本地数据库和云数据库;按其应用场景可分为 OLTP 事务型数据库、OLAP 分析型数据库、HTAP 混合型数据库;按其存储介 质可分为磁盘数据库和内存数据库;按其商业模式可分为商业数据库和开源数 据库。 从市场规模和增速来看:Gartner 发布的 2022 年全球数据库管理系统市场报告 显示,2022 年全球数据库管理系统(DBMS)市场达到 910 亿美元,相较前一年 增长了 14.4%,超过了整体软件市场 11.3%的增长。其中,非关系型 DBMS 市 场增长 26.8%,占 DBMS 市场份额的 21%,而关系型 DBMS(RDBMS)市场增 长 12.2%,市场份额为 78%。根据艾瑞咨询的研究数据,国内 2022 年集中式 数据库市场份额约 80%,分布式部署不到 20%。根据阿里云官网援引 Gartner的预测数据,2021 年,云数据库在整个数据库市场中的占比首次达到 50%,到 2022 年,预计将有 75%的数据库天然部署或迁移至云平台。数据库上云将成为 未来数据库的发展趋势。

2、数据库发展历程综述:当前已进入后关系型阶段
根据中国信息通信研究院《数据库发展研究报告(2021)》,数据库技术演进 与互联网发展相互促进,数据库共经历前关系型、关系型和后关系型三大阶段, 当前已进入后关系型。
(1)前关系型阶段(1960-1970),解决数据集中存储和共享等问题,网状层 次数据库初尝探索。数据模型主要基于网状模型和层次模型,代表产品为 IDS 和 IMS,该类产品在当时较好地解决了数据集中存储和共享的问题,但在数据 抽象程度和独立性上存在明显不足。 1963 年,通用电气公司的 Charles Bachman 等人开发出世界上第一个数 据库管理系统(以下简称 DBMS)也是第一个网状 DBMS——集成数据存 储(Integrated Data Store,IDS)。 同时期为解决“阿波罗登月”计划处理庞大数据量的需求,北美航空公司 (NAA)开发出 GUAM 软件。其设计思想是将多个小组件构成较大组件,最 终组成完整产品。这是一种倒置树的结构,也被称之为层次结构。随后 IBM 加入 NAA,将 GUAM 发展成为 IMS(Information Management System)系统并发布于 1968 年,成为最早商品化的层次 DBMS。
(2)关系型阶段(1970-2008),关系型数据库大规模应用,主要应用于银行、 军工、政府等以处理结构化数据。以 IBM 公司研究员 E.F.Codd 提出关系模型 概念,论述范式理论作为开启标志,期间诞生了一批以 DB2、Sybase、Oracle、 SQL Server、MySQL、PostgreSQL 等为代表的广泛应用的关系型数据库,该 阶段技术脉络逐步清晰、市场格局趋于稳定。 1970 年,IBM 实验室的 Edgar Frank Codd 发表了一篇题为《大型共享数 据库数据的关系模型》论文,提出基于集合论和谓词逻辑的关系模型,为 关系型数据库技术奠定了理论基础。 1974 年,Ingres 原型诞生,为后续大量基于其源码开发的 PostgreSQL、 Sybase、Informix 和 Tandem 等著名产品打下坚实基础。1977 年, Oracle 前身 SDL 成立。1978 年,SDL 发布 Oracle 第一个版本。 20 世纪 80 年代,关系型数据库进入商业化时代。20 世纪 90 年代, Access、PostgreSQL 和 MySQL 相继发布。至此,关系型数据库理论得 到了充分的完善、扩展和应用。
(3)后关系型阶段(2008-至今),因数据量膨胀、数据类型不断丰富、数据 应用不断深化,模型拓展与架构解耦并存。进入 21 世纪,随着信息技术及互联网不断进步,数据量呈现爆发式增长,各行业领域对数据库技术提出了更多需 求,数据模型不断丰富。谷歌的三篇论文开启后关系型数据库阶段,该阶段由 于数据规模爆炸增长、数据类型不断丰富、数据应用不断深化,技术路线呈现 多样化发展。随着各行业数字化转型不断深入,5G、云计算等新兴技术快速发 展,传统数据库的应用系统纷纷优化升级。根据信通院《数据库发展研究报告 (2021 年)》,后关系型阶段的数据库演变特征包括:数据模型不断拓展,非 关系型数据库开始兴起,NoSQL 数据库应运而生;分布式架构逐渐成熟;统一 框架支撑分析与事务混合处理;与云基础设施深度结合。
3、从 Gartner 和 DB-Engines 榜单看当前各类型数据库的 “火爆程度”
根据 Gartner 2011-2022 年 DBMS 市场份额排名变化,可以发现以下几大技术 趋势:(1)云数据库厂商崛起。Amazon、Google、Alibaba、Huawei、 Tencent 等均借助云优势排名稳步上升,其中 Amazon 于 22 年上升一位超越 Microsoft 位居第一;Oracle、IBM、SAP 等传统型数据库厂商排名略有下降; 数仓和大数据分析平台方面,Snowflake、Databricks 也借助云数仓优势排名上 升,而 Teradata、Cloudera、Marklogic 排名均有所下降。(2)非关系型数据 库广受关注。在 22 年份额排名靠前的数据库厂商中,文档数据库 MongoDB、 图数据库 Neo4j 和 TigerGraph 均成功抓住 NoSQL 发展机遇跻身榜单。 Gartner 2023 年数据库管理系统魔力象限展示出了相近的结论:AWS 连续 9 年位列领导者;微软、甲骨文、谷歌等国外科技巨头同样位于领导者象限; Snowflake、Databricks、MongoDB、Neo4j 等新型数据库厂商表现突出;我国 厂商阿里云入选魔力象限。

根据 DB-Engines 按照受欢迎程度排序的数据库榜单:Oracle、MySQL、 Microsoft SQL Server、PostgreSQL 四大流行的关系型数据库位列榜单前四, 第五到七名分别为文档数据库 MongoDB、键数据库 Redis、搜索引擎数据库 Elasticsearch。 而根据各款数据库产品受欢迎程度:文档数据库 MongoDB、云数仓厂商Snowflake、微软推出的云数据库产品 Microsoft Azure SQL Database、搜索引 擎数据库 Splunk 等热度前列,再次印证云和非关系型数据库系大数据时代下的 “利器”。
二、技术架构:分布式架构日渐兴起、逐渐成熟
1、数据库的技术架构分类
数据库按照架构分类:根据计算机学会数据库专委会《数据库系统的分类和评 测研究》,按数据库系统架构角度分类,数据库可以分为单机数据库、集中式 数据库(without data sharding)、分布式数据库(with data sharding):(1) 单机数据库适用于数据量少、对服务可靠性要求不高的场景。一般都是 sharedeverthing 架构,即共享所有计算资源(CPU、RAM、Disk)和数据;(2)集 中式数据库是指多台机器联合管理数据,一般不对数据进行分片,包括一主多 备(备机不可读)、一写多读、多写多读等架构;(3)分布式是分布在计算机网 络上、逻辑上相互关联的数据库,将数据从物理上分割,并分配给多台服务器 (或多个实例),例如通过哈希进行数据划分,或者通过范围进行划分,或者 通过列表进行划分(例如北京、上海数据分配到一个节点),每台服务器可以 独立工作,具备共同的 schema。分布式架构的技术路线包括分库分表+中间件、 共享存储分布式数据库、去中心化的分布式数据库三种。
集中式 VS 分布式:根据计算机学会数据库专委会《数据库系统的分类和评测 研究》,集中式数据库是一种经典、传统的数据库结构,被广泛应用于数据管 理,其数据被集中存储在存储设备中,安全且易于处理。但是,集中式数据库 具有信息化投入成本高、性能及容量无法弹性扩展的资源瓶颈等明显的劣势。 分布式可以解决资源瓶颈问题,但受限于 CAP 理论,需要在一致性与可用性之 间权衡,其最大的挑战便是解决各个节点状态的同步问题;此外,根据中国软 件评测中心发布的《分布式数据库发展路径研究报告》,在集中式数据库中应 用比较成熟的存储过程、触发器、视图、DBLink、外键约束等功能要迁移到全 局层面实现,实现难度较大。即使部分分布式数据库已经实现上述功能,也可 能是受限使用,并且执行效率低于集中式数据库,当前分布式数据库产品在功 能完备度方面距离通用数据库有较大差距,在标准化程度方面也有一定差距。
分布式的技术路线:根据国家工业信息安全发展研究中心《分布式数据库发展 趋势研究报告》,分布式数据库与单机数据库的不同在于其可以将核心功能, 即查询、事务管理、存储等扩展到多台节点,甚至多个地域。从实现方式上看, 当前主要包含 3 条不同的技术路线:分库分表+中间件、共享存储分布式数据库、 去中心化的分布式数据库。根据 Frost&Sullivan《2021 年中国分布式数据库市 场报告》,分库分表+中间件路线的案例包括 GoldenDB、TDSQL MySQL 版、 openGauss 等;共享存储分布式数据库路线的案例包括 AWS Aurora、 PolarDB、TDSQL-C、SequoiaDB-MySQL、GaussDB for MySQL、ArkDB 等; 去 中心化 的分布 式数据库 路线的 案例包括 TiDB 、 Oceanbase、 Google Spanner 等。
2、分布式架构能更好适应高并发、大流量、高可用特征, 金融、电信已有较多落地案例
分布式架构能更好适应高并发、大流量、高可用特征。根据金融电子化援引北 京银行软件开发中心平台架构研发团队的文章《北京银行 OceanBase 分布式数 据库应用实践》,长久以来重要行业的核心数据库一直使用传统的集中式数据 库,传统的集中式数据库架构支持一般业务系统时,可以做到高效、稳定和可 靠,对金融服务的发展起着重要支撑作用,但并不能较好适应数字经济时代金 融业的高并发、大流量、高可用的特征。根据中国信息通信研究院《数据库发 展研究报告(2021 年)》,由于传统基于集中式数据库在应对海量数据及复杂 分析处理时,存在数据库的横向扩展能力受限、数据存储和计算能力受限、不 能满足业务瞬时高峰的性能等根本性的架构问题。根据中国信息通信研究院 《数据库发展研究报告(2021 年)》,利用分布式计算和内存计算等新技术设 计的分布式数据库能够解决上述遇到的性能不足等问题,分布式数据库的数据 分散在网络上多个互联的节点上,数据量、写入读取的负载均衡分散到多个单 机中,集群中某个节点故障整个集群仍然能继续工作,数据通过分片、复制、 分区等方式实现分布存储。每个数据节点的数据会存在一个或者多个副本,提 供数据冗余。当某个数据节点出现故障时,可以从其副本节点获取数据,避免 数据的丢失,进而提升了整个分布式集群的可靠性。为保障分布式事务在跨节 点处理时事务的原子性和一致性,一般使用分布式协议处理。常用两阶段提交、 三阶段提交协议保障事务的原子性;使用 Paxos、Raft 等协议同步数据库的事 务日志从而保障事务的一致性。
各主流数据库厂商均布局分布式架构。早期参与数据库产业并至今仍续存的公 司往往少有分布式数据库产品传承,但在分布式技术的趋势下,大多启动了相 关产品的研发;而新近成立的数据库企业及其它转型参与数据库技术的企业则 较多采取了直接新研分布式数据库或分布式数据库中间件的路线。
国产分布式数据库已进入大型银行核心系统和电信行业多项业务。中国银行、 中国农业银行、中国邮储银行均采用云底座+分布式数据库的方式构建分布式核 心系统;中国工商银行、交通银行则以自研开源数据库+国产数据库的方式引入 国产化数据库方案;中国建设银行则按分行与客户维度渐进式分布切换数据库 投产。
三、数据模型:关系型仍为霸主,非关系型逐步取 得大范围应用
1、非结构化数据激增驱动 NoSQL 发展
大数据时代下,非结构化数据激增驱动 NoSQL 发展。根据《信息通信技术与 政策》,随着人工智能技术、大数据技术以及 5G 等技术的不断发展,社会中 每时每刻都在产生着海量的数据,产生的数据中不仅包含了结构化数据,同时 也有大量的音视频、文本等非结构化数据。根据其援引 IDC 在 2021 年的预测, 在 2020 年以前人类产生的数据量每两年翻一倍,到 2025 年前后全球数据量将 达到惊人的 179.6 ZB,而其中大部分为非结构化数据,占据了全部数据量的 80%~90%,并且非结构化数据增长的速度要比结构化数据增长的速度高出 10~50 倍之多,所以对应的数据存储需求就越来越多样化,也延伸出了很多非 关系型数据库的需求。根据 TWT 社区对江西银行存储工程师程宗憬的访谈,关 系型数据库适合事务处理,而非关系型数据库适合处理大规模的非结构化数据, 更擅长处理大量的并发读写操作。根据京东技术,NoSQL 数据库并没有一个统 一的模型,是以牺牲事务机制和强一致性机制,来获取更好的分布式部署和横 向扩展能力,使其在不同的应用场景下,对特定业务数据具有更强的处理性能。 关系数据库和非关系数据库是应用程序的两种数据存储方法。关系数据库 (SQL 数据库)以包含行和列的表格格式存储数据,列包含数据属性,行包含 数据值。非关系数据库(NoSQL 数据库)使用各种数据模型来访问和管理数据, 专门针对需要大数据量、低延迟和灵活数据模型的应用程序进行了优化。
推动 NoSQL 发展的标志性事件包括如下:根据 CSDN,2005 年,Hadoop 项 目诞生,它是一个运行在普通机器上的、可供大规模存储和访问的分布式文件 系统,是大数据存储的基石,使得大数据这件事情变得可行,在硬件成本上可 控,在软件技术上可实现;2006 年,Google 发布 BigTable 论文,描述了一个 用于管理结构化数据的分布式存储系统——Bigtable 的数据模型、接口以及实 现等内容;根据阿里云公众号,2007 年,亚马逊发布 Dynamo 论文,论文介绍 了 Dynamo 的设计和实现,它是一种高度可用的键值存储系统,亚马逊的一些 核心服务使用它来提供“永远在线”的体验,被认为是 NoSQL 的开山之作; 根据 Neo4j 官网,同年第一款商用图数据库 Neo4j 发布,Neo4j 作为高速图形 数据库,具有无限的规模、安全性和数据完整性,适用于任务关键型智能应用; 根据 twt 企业社区公众号,2009 年,由文档数据库 MongoDB 引发了一场 NoSQL 运动,MongoDB 是一款基于文档式的并且建立在分布式存储系统之上 的 NoSQL 数据库,存储的数据模型是文档,面向的是集合而不是表,所有的 数据存储都以集合为单位,而每个集合里面包含的内容则称为文档;2012 年以 来,Amazon DynamoDB、Databricks、Microsoft Azure CosmosDB、Kdb、NebulaGraph 等一系列 NewSQL 数据库诞生。
根据 DB-Engins,近年来 NoSQL 讨论度和热度持续高升。因步入互联网 Web 2.0 和移动互联网时代,从 2013 年至今的长维度来看,图数据库、时序数据库、 文档数据库、键数据库作为补充性的新需求蓬勃发展;而近一年来,因 AI 需求 爆发,向量数据库为最受欢迎的数据库类型。 AI、图数据分析、时空数据分析等创新业务驱动数据库行业成长。现阶段,向 量数据库在人工智能技术的发展驶入快车道的时期初露锋芒,图数据库为复杂 关联关系提供查询性能释放数据价值,时空数据库对查询、统计、分析时空数 据的实际应用崭露头角,Serverless 无服务器架构计算范式赋能数据库产品及 生态工具云化,以及软硬协同一体化技术加速数据库性能持续优化。
2、关系型将继续保持主流数据库地位,数据湖仓等尚处发 展初期
关系型数据库市场份额占近八成,仍为目前最受欢迎的数据库类型。Gartner 研究报告显示,2022 年全球数据库管理系统(DBMS)市场达到 910 亿美元,增 长了 14.4%,超过了整体软件市场 11.3%的增长。非关系型 DBMS 市场增长 26.8%,占 DBMS 市场份额的 21%,而关系型 DBMS 市场增长 12.2%,市场 份额为 78%。根据 DB-Engines,关系型数据库的受欢迎程度排名份额为 72.1%,远高于非关系型数据库 27.9%的得分总和,占据数据库“霸主”地位。
关系数据库长期并将在可预期的未来继续保持主流数据库地位。随着移动互联 网的发展,涌现出了包括键值、文档、宽列、时序等在内的越来越多非关系型 数据库,其在大数据、互联网领域取得了较大范围的应用。但关系型数据库具 有以下三点价值:(1)满足数据库的 ACID 特性,即原子性、一致性、隔离性、 持久性,根据英特尔中国援引 InfoQ 文章,ACID 能帮助应用开发且简化应用开 发的复杂性;(2)采用 SQL 标准,SQL 是关系型数据库的标准语言,相比 C、 Java、Python 等编程语言,SQL 贴合口语的设计使得其代码复杂度大大简化、 便于数据分析人员上手,同时嵌入式的设计也保证了 SQL 可以被其他编程语言 轻松调用,据 TIOBE 统计,SQL 在近 20 年稳居 TOP10 编程语言榜单;(3)经过长时间的发展和完善,已经形成了基于关系型数据库的庞大信息技术生态。 在未来,随着数据量的不断增长和数据流程的加速,关系型数据库具有的良好 可扩展性、兼容性、成熟稳定性、数据一致性等独特优越性将得到更加充分的 体现。此外,关系型数据库也在继续不断地适应新的技术和需求,保持持续发 展和创新。以 Oracle 为例,在关系模型的基础上,Oracle 可支持文档数据、对 象数据、空间数据、图数据等非关系模型,成为了单一数据库支持多种模型的 “多模数据库”。目前大量传统关系型数据库和新兴非关系型数据库已开始转 为“多模数据库类型”。
多模数据库:支持不同场景下的多种类型数据处理
多模数据库技术是在 NoSQL 技术演进中发展起来的。根据 CCSA TC601 大数 据技术标准推进委员会《数据库发展研究报告(2023 年)》,由于需求不断变 化、RDBMS 的扩展性不佳等诸多因素导致越来越多的开发者选择 NoSQL 数据 库。但多个 NoSQL 数据库系统混用的方式为软件开发团队带来高额的学习成 本和维护费用。多模数据库旨在提供多语言持久性的数据建模优势,通过使用 单个数据库存储来降低操作的复杂性,更好地支持不同场景下的多种类型数据 处理。多模数据库发展呈现两种形态,一是出现了多款原生的多模数据库系统; 二是关系型数据库系统也陆续增加了对多模数据处理的支持。多模数据库不仅 能够为多种数据模型提供该模型适用的查询接口,也可以通过一种语言实现对 多种模型数据的同时查询。
根据星环科技,其多模数据库产品 ArgoDB 在客户 360 分析的案例中,企业需 要组织分析三种类型的数据,并将结果汇总分析,以生成更准确的客户概况: 事务历史记录和产品主数据,由关系型数据库或数据仓库处理;产品或近期交 易的关系,由图数据库处理;来自社交媒体或电子商务网站的产品/商店/人员相 关的评论,由搜索引擎检索。在过去,用户必须使用多个类型的数据库来管理 这些不同类型的数据,并通过提取、转换和加载(ETL)或导出/导入工具将分 析结果结合在一起。这不仅影响了数据的时效性,增加了数据溯源的复杂性, 还影响了数据质量。不同于传统方案为不同类型的数据单独部署和使用不同的 数据库产品,基于星环科技 ArgoDB 的多模型统一技术架构,用户可以实现不 同模型数据的统一存储管理,并且用户只需用一句 SQL 就能同时访问这 3 种存 储模型进行联合分析,替代了之前 3 段代码,一次操作完成了之前三次操作才 能完成的业务,大大简化了开发复杂度,简化用户操作。同时数据也仍保留在 原存储引擎中,也不用对数据进行导入导出或者转换,不会存在数据不一致或 数据冗余存储的问题。
从成熟度和市场渗透率来看,关系型已进入成熟主流期,向量数据库等仍处于 发展初期。根据 Gartner《Hype Cycle for Data Management, 2023》,关系型 数据库发展至今已有 30 余年的历史,已经进入成熟期,在数据库市场中占据主 流地位。非关系型数据库尚处于快速发展期,类型主要包括图型、时序型、向 量型、列簇型和多模型等。其中,图型数据库市场渗透率为目标受众的 5%至 20%,处于成长期;时序型数据库市场渗透率为目标受众的 20%至 50%,为早 期主流;向量型数据库市场渗透率低于目标受众的 1%,处于萌芽期;列簇型数 据库市场渗透率于为目标受众的 20%至 50%,为成熟主流。分布式数据库市场 渗透率低于目标受众的 1%,处于转型期。还有一些厂商开始建造数据仓和数据 湖,数据仓市场渗透率于为目标受众的 5%至 20%,处于成长期;数据湖市场 渗透率于为目标受众的 20%至 50%,为早期主流。
3、文档数据库:适用于数据存储场景,MongoDB 为流行 度第一
文档数据库系以文档形式存储和组织数据,适用于数据量大、读写操作频繁的 场景。根据 PingCAP 官网,文档型数据库是一种 NoSQL(非关系型)数据库, 使用类似于 JSON 或 BSON 的文档格式,可以存储嵌套和非结构化的数据,这 种灵活性使得文档数据库更适合处理具有不同字段和结构的数据。文档数据库 更多适用于如下场景:如使用 MongoDB 存储游戏用户信息、装备、积分等, 直接以内嵌文档的形式存储,方便查询、更新;存储订单信息、订单状态、物 流信息;存储用户信息,朋友圈信息,通过地理位置定位;物联网中存储设备 信息、设备汇报的日志信息并进行多维度分析;存储用户信息、点赞互动信息 等。即适用于数据量大、读写操作频繁、数据价值不高,对事务要求不高的场 景。
根据腾讯云,在腾讯智慧零售优码业务选用文档数据库案例中,腾讯智慧零售 优码业务存储零售商品二维码信息,该信息为智慧零售最核心的数据信息。码 存储的特征有海量数据、关联存储、多维度查询。采用 MySQL + ES 的常见架 构是写操作直接作用于 MySQL,然后通过 canal + Kafka 的方式将数据变更同 步到 ES,然后再根据不同的查询场景从 MySQL 或者 ES 查询数据。然而此种 方案存在数据同步和一致性问题、数据容量问题、成本问题、DDL 运维问题、 开发成本问题、水平扩容问题。在使用 MongoDB 方案时,不需要 MySQL 冗 余表或者 ES 来支持大部分的分布式查询,因此可以避免冗余存储带来的数据 同步和一致性问题、存储成本问题、资源/运维/开发成本。对比可知, MongoDB 不仅能完全满足业务需求,同时在性能、成本、可维护性等各方面都 优于传统关系型数据库方案,因此腾讯优码最终选用的是 MongoDB 作为业务 核心数据码的存储方案。
中国移动和咪咕视频应用案例:
根据 MongoDB 官网,中国移动使用 MongoDB 来支持其最大和最关键的 推送服务之一,该服务每月向超过 10 亿用户发送账单明细。在使用 MongoDB 之前,中国移动技术团队一直依赖 Oracle 数据库,但随着用户 数量的增加,数据库性能也随之下降。尽管投入了大量资金,Oracle 系统 处理日常请求(如最终确定和向用户交付账单)仍然需要很长时间。2019 年,经过全面测试,中国移动迁移到 MongoDB。通过利用 MongoDB 的 原生分片,该系统性能大幅提高了 80%,从原来需要 50 台 Oracle 机器减 少至只需要 12 台 MongoDB 的机器来处理相同的负载。该推送服务不但可 以处理所有当前需求,并为随着未来增长而扩展做好了准备。
根据 MongoDB 官方公众号,2018 年咪咕视讯逐步减少传统数据库的使用, 开始使用 MongoDB 文档模型数据库。团队迅速认识到,MongoDB 是解决 灵活、多样、多变的互联网视频业务,以及大规模复杂的技术系统架构的 最好选择。MongoDB 帮助咪咕视讯有效处理大量非结构化数据和去中心化 部署,赋能咪咕视讯优化现代应用架构,进一步提升业务性能与规模。遵 循“先迁移现有数据、再迁移新数据”的路径,咪咕视讯已成功将其传统 数据库迁移到 MongoDB 中。在部署规模上,传统数据库的“消”对应的 是 MongoDB 的“长”。6 年间,MongoDB 在咪咕核心系统的部署规模增 长了 75%以上,占其所有数据库一半以上。目前,咪咕视讯已逐步重构其 核心系统,实例已超过 450 个。
根据 DB-Engines,MongoDB 为目前最主流的文档数据库,国内对标厂商包 括巨杉软件(SequoiaDB)等。
MongoDB
(1)产品涵盖开源社区版、付费专业版和云开发者数据平台
开源社区版,建立庞大用户社区。Community Server 是 MongoDB 数据库的免 费下载版本,为初识 MongoDB 的用户提供入门机会。同时基于开源模式,建 立了庞大的用户社区,根据用户的反馈改进 MongoDB,不断增强产品的易用性。 付费专业版,专注企业客户的商业数据库。MongoDB Enterprise Advanced 是 为企业客户提供的商业数据库,企业订阅后可获得平台的商业许可及企业数据 库服务器、企业管理能力、分析集成,并可在云、本地或混合环境中运行。 开创多云开发者数据平台,助力收入腾飞。MongoDB Atlas 是 2016 年推出的 云数据库和数据服务的集成套件,是一款基于云的 SaaS 版服务器,覆盖三大 云服务提供商(Amazon Web Services(‘AWS’)、Google Cloud Platform (‘GCP’)、Microsoft Azure),并于 2020 年与我国最大云服务商之一阿里云 达成合作。MongoDB Atlas 内建了 MongoDB 安全和运维最佳实践,可自动完 成基础设施的部署、数据库的构建、高可用部署、数据的全球分发、备份等既 费时又需要大量经验运维工作。近三年,Atlas 已经是 MongoDB 最大的收入来 源(根据 MongoDB 2023 财年财报,Q4 营收中,Atlas 营收占 65%)。

(2)财务和业务情况介绍
稳固的订阅销售模式,瞩目的 DBaaS 产品。MongoDB 在过去几年实现了强劲 的营收增长,主要依赖于其稳定的订阅销售模式。在 FY2021-FY2023,订阅销 售均占据了总收入的 96%+。MongoDB Atlas 自 2016 年 6 月推出以来,在收 入中占比持续增长。FY2023,Atlas 已占总收入的 63%,超出预期的增长表明 了市场对 DBaaS 解决方案的认可与需求的增长。 客户基础扩大,忠诚度较高。根据 MongoDB 年报,公司持续投资于销售和营 销工作以及开发人员社区外联,这对于推动客户获取至关重要。在客户迁移现 有应用程序或构建新应用程序,以及将信息技术基础设施现代化并转向云端的 过程中,MongoDB 不断推动平台的标准化,同时为新客户和现有客户引入新的 工作负载,以增加客户的订阅金额。MongoDB 的付费客户总数从 2021 年的 24,800 个客户增加到了 2023 年的 40,800 个客户,近乎翻倍,表明了公司的市 场吸引力。同时,用于衡量客户增加支出速度的净 ARR 扩张率持续保持在 120% 以上,说明了目前订阅模式在现有客户中的持续增长能力和较强的客户忠诚度。
(3)崛起历程复盘
技术革新之际,引领新数据库范式。随着传统关系型数据库面对现代应用程序 需求时的力不从心,2009 年,采用文档型数据模型的 MongoDB 的应运而生, 为处理大规模、高速度、多样化数据的需求提供了一种新的范式。这种创新性 的设计吸引了开发者的注意,为 MongoDB 的崛起奠定了基础。 逐步拓展商业版图,创新驱动增长。2009 年 2 月,MongoDB 1.0 发布,提供 了大部分基本的查询功能。同年 12 月 MongoDB 1.2 发布,引入了 mapreduce,支持大规模数据处理。2013 年,MongoDB 推出了第一个商业版本的 企业数据库服务器,加速了其在企业级应用中的普及。此后,MongoDB 不断引 入新的功能和服务。MongoDB 早期版本的一个主要问题是保存和管理磁盘数据 的存储引擎相对较弱,于是在 2014 年,MongoDB 收购 WiredTiger 存储引擎, 极大提升了写入性能,加速了数据库处理速度。2015 年,推出了 MongoDB 指 南针和分析集成等工具,为用户提供更便捷的数据库管理和分析方案。2016 年, 推出了数据库即服务 MongoDB Atlas,提供了全新的数据库部署和管理方式。 2017 年,MongoDB 在美国纳斯达克上市,MongoDB Atlas 扩展到了所有三大 公有云提供商,为用户提供了多样化的部署选项,提高了灵活性和选择性。 2018 年,MongoDB 公司收购并集成了在云端提供 MongoDB 服务(DBaaS)的 mLab,将其作为 MongoDB Atlas 云平台的一部分,并通过改变开源版本的许 可条款来限制更多的 DBaaS 竞争者的出现。2019 年,为了将 MongoDB 发展 成一个成熟的云平台,而不仅仅提供数据库服务,公司再次收购云计算移动数 据库公司 Realm,强化云生态系统。 市场影响力强,占据 NoSQL 领先地位。在知名编程论坛 Stack Overflow 2023 年的开发者问卷调查中,MongoDB 位列最常用的数据库技术第四位,显示了其 在开发者社区的广泛认可度。根据 DB-Engines 在 2023 年 10 月的流行度调查, MongoDB 在非关系型数据库中排名第一,进一步巩固了其在 NoSQL 领域的领 导地位。
(4)公司竞争优势
顺应市场需求变化,帮助开发者颠覆行业。MongoDB 结合了关系型数据库和 非关系型数据库的优点,在维持关系数据库的优势的前提下,挑战传统数据库 的限制,满足对性能、可伸缩性、灵活性和可靠性的需求。在 FY2023,与 MongoDB Enterprise Advanced 相关的新业务中,大约 25%来自从传统关系数 据库迁移而来的应用程序。 灵活的数据模型和分布式能力。MongoDB 采用文档型数据模型,允许动态添加 字段,具备非常高的灵活性,能够适应各种数据需求的变化。同时,MongoDB 原生支持分布式数据库,具有快速的水平扩展能力,可以在各种环境中灵活部 署,满足不同规模和需求的应用场景。 多云支持的广泛的应用场景 MongoDB 支持多家云服务商,避免了厂商锁定。 此外,MongoDB Atlas 中提供了多样化的部署选项。用户可以根据实际需求选 择在云端、本地或混合环境中运行,满足不同业务需求。
4、时序数据库:适用于工业、物联网等场景,InfluxDB 为 流行度第一,国内对标厂商包括 DolphinDB 等
根据阿里云,时间序列数据库(TSDB)是一种软件系统,专门用于处理时间序列 数据、按时间索引的数字数组(日期时间或日期时间范围)。时序数据库发展 历程如下:
第一代时序数据存储系统:通用关系数据库虽然可以存储时序数据,但由 于缺乏对按时间间隔存储和检索数据等时间的优化,无法非常有效地处理 时序数据。第一代时间序列数据通常来自监测领域。基于平面文件的简单 存储工具是此类数据的首选存储。RRDTool 和 Whisper 等系统通常处理单 一数据模型,并且独立容量有限。这些系统通常嵌入在监控和警报场景中。
基于通用存储的时间序列数据库:随着大数据和 Hadoop 的发展,时序数 据量开始快速增长,系统服务对处理时序数据提出了更多要求,例如更高 的可扩展性。基于通用存储的专用时序数据库开始出现。时序数据库可以 按时间间隔高效地存储和处理时序数据。这些数据库包括 OpenTSDB 和 KairosDB。这些时序数据库继承了通用数据库的优点,并利用特性避免了 通用存储的缺点。此外,这些数据库在数据模型和聚合分析方面还有许多 针对时间序列的创新。例如,OpenTSDB 继承了 HBase 的宽表,针对时 间序列进行了偏移存储模型的设计,并使用 salt 来缓解热点问题。但它也 存在诸多缺点,例如全局 UID 机制效率低下、聚合数据加载不可控、无法 处理高基数标签查询等。
垂直时间序列数据库的诞生:随着 Docker、Kubernetes、微服务等技术的 发展,物联网的发展预期越来越强烈。随着数据随着时间的推移不断增长, 时间序列数据是增长最快的数据类型之一。开发了高性能、低成本的垂直 时序数据库。具有时间序列特征的数据存储引擎(InfluxDB 是典型例子)正在兴起,并且在市场上变得越来越重要。这些时序数据库通常具有更先 进的数据处理能力、更高效的压缩算法以及更符合时序数据特性的存储引 擎。例如,InfluxDB 具有基于时间的 TSMT 存储、Gorilla 、 rate 和自动汇总等窗口函数。同时,由于架构上索引分离,这些数据库仍 然面临着时间线扩展、混乱或其他类似场景的挑战。

时序数据库适用领域:时序数据库经常应用于工业环境监控、物联网 IOT 设备 采集存储、互联网业务性能监控服务、自动驾驶等基于时间线且多源数据连续 涌入数据平台的应用场景。1)电信:上网记录,通话记录,用户行为,设备监 测;2)电网:智能电表,设备监测;3)银行:交易记录,ATM/POS 监测;4) 交通物流:交通工具和集装箱货物的位置追踪;5)IT 运维:服务器和业务系统 的监测;6)传统制造业:生产设备的实时监控;7)其它:所有能产生时序数 据的领域。 根据 TDengine,在涛思数据时序数据库产品 TDengine 在华自科技的应用案 例中,华自科技旗下的物联网数据平台是电站及泵站智慧运维平台的核心组成。 在数据存储上,此前其采用 MySQL 分库分表方案来存储历史数据,使用 Redis 来存储实时数据,在测点数较少或者集控需求不是很多的场景下,基本满足需 求,但随着平台业务的发展,接入的站点越来越多,运维难、开发难、成本高 等问题逐渐凸显。为了解决这些问题,华自科技决定重新进行技术选型,升级 为时序数据库存储方案。完成改造迁移后,数据存储周期由原来的 5 分钟减 少到 1 秒钟,存储的数据维度更精细了,能为平台的智能诊断、智能分析 服务提供更准确的数据支持,同时各业务场景下的计算查询性能得到提升, 数据库服务器由原来的 6 台减少到目前的 3 个节点集群。 苍穹数码 x TDengine 案例:在地灾专业监测物联网平台项目中,首先需要解 决的就是海量时序数据的存储和计算问题,其有着体量大、时间长,写入、查 询要求高等特点,传统关系型数据库已经无法满足实时写入与高性能查询要求。 该项目在 2018 年创建之初采用的是大型企业级数据库 Oracle,目前已经无法 满足实时写入与高性能查询要求,特别是当雨季来临,传感器数据采集频率提 高到秒级、毫秒级别,数据入库就会阻塞,效率非常低下。苍穹数码选择接入 TDengine 以解决海量时序数据的存储和计算问题。
根据 DB-Engines,InfluxDB 为目前最主流的时序数据库之一,国内对标厂商 包括 DolphinDB(智臾科技)、TDengine(涛思数据)、TSDB(阿里云) 等。
InfuxDB
专为时序数据存储而生,智能制造应用潜力巨大。时序数据库经常应用于工业 环境监控、物联网 IOT 设备采集存储、互联网业务性能监控服务、自动驾驶等 基于时间线且多源数据连续涌入数据平台的应用场景。InfuxDB 专为时序数据 存储而生,尤其是在工业领域的智能制造方面应用潜力巨大。 InfuxDB 是一个由 InfuxData 公司于 2013 年开发的开源分布式时间序列数据 库,其设计意图就是为了能够存储带有大量时间戳的数据,例如物联网设备、 自动驾驶汽车产生的数据等,InfluxDB 致力于对这些数据进行海量的写入以及 高负载查询,由于是由 Go 语言开发,无须外部依赖,安装配置十分便捷,被 广泛用于存储系统的监控数据等领域,成为目前主流的时序数据库之一。 InfluxData 公司成立于 2012 年 1 月,其创始人 Paul Dix 和 Todd Person 在 2013 年开始着手 InfluxDB 的开发,之后获得了多轮投资。发展至今,历经了 多次迭代,目前在 InfuxDB 版本中,部署方式分为单机版和集群版,单机版走 开源路线。在 2016 年 3 月,InfuxData 公司宣布他们会将用于支撑 InfuxDB 集 群水平扩展的组件作为闭源产品单独销售,从而为 InfluxDB 的持续开发建立一 个稳定的收入来源。InfuxDB 单机版是免费使用的,关于 InfuxDB 集群版的售 价可在其官网上查阅价格是随着服务器节点和每个节点的核心数变化的。
版本不断迭代,产品日益完善。2013 年 9 月,Errplane 公司正式发行了 InfuxDB 1.0 版本。2019 年 1 月 23 日 InfuxDB 推出了 InfuxDB 2.x 的 alpha 内 部测试版,通过了二十几个版本的迭代,到 2020 年 1 月 8 日,InfuxDB 2.0 开 始推出 Beta 公开测试版,一直持续到同年 10 月,最终测试版本 v2.0.0-rc.0 正 式推出。后来又推出了 v2.0.1 通用版,截至 2021 年 11 月,InfuxDB 版本已经 迭代到了 v2.1.1。历经这么多版本的迭代,InfluxDB 在用户界面上不断进行完 善,对旧版本的 bug 进行不断改进,并在每个版本上增加了新功能。根据 24 年 5 月 DB-Engines 给出的时间序列数据库排名,InfuxDB 高居第一位。
5、 图数据库:适用于复杂实体联系场景,Neo4j 为领头 羊
图数据库:适用于海量数据的多对多的复杂实体联系场景处理。根据信通院 《图数据库白皮书》,图数据库以图论为理论基础,使用图模型,将关联数据 的实体作为顶点(vertex)存储,关系作为边(edge)存储,解决了数据复杂关联带 来的严重随机访问问题。根据墨天轮《2023 年 7 月我国数据库行业分析报告》, 关系型数据库对数据模式和数据规范化有着严格的要求,这种要求对数据关系 的查询产生了束缚,当数据规模变大,目数据间关系随之变得复杂时,使用关系 模型检索时需要多个表的属性执行连接操作,数据写入时也需考虑外键约束, 从而导致较大的额外开销,产生严重的性能问题,因此传统关系型数据库更适 合实体联系为一对一或一对多的应用场景。而图数据库则在处理复杂关系上有 着天然优势,在海量数据的多对多的复杂实体联系场景中有着异常突出的性能 表现。
根据沙丘社区,在创邻科技公司图数据库产品 Galaxybase 在中国移动电信反 诈系统的应用案例中,中国移动通信集团江西有限公司过去基于传统的 Oracle 关系型数据库做反诈模型,因关联查询超慢、系统时常崩溃、模型语句冗繁等 问题,反而成为反诈系统的业务痛点。经调研,江西移动发现防范打击电信诈 骗、契合图数据库万物互联,直观表达数据之间关联关系的特点,对关系数据 的处理效率是关系型数据库的 2-3 个数量级,同时图数据库还有兼容性强的特 点,可以与现有数据库对接,于是决定将传统数据库反诈模型向图数据库反诈 模型迁移。江西移动通过“一转、二模、三深挖”构建基于图数据库的新一代 反诈系统,将江西移动海量传统关系型数据结构转换为图数据结构,生成“反 诈图数据库”;将原有反诈模型转换成图数据库反诈模型,同时新建图数据库 高阶反诈模型并持续迭代优化;基于图数据库特性,深挖涉诈号码关联关系, 溯源打击诈骗团伙头目,从诈骗源头打击根治。基于图数据库的新一代电信网 络诈骗预防劝阻和溯源打击系统具有快、准、狠的三大特点。

图数据库主要发展历程:根据信通院《图数据库白皮书》,自 2007 年第一款商用图数据库 Neo4j 诞生以来,图数据库的发展虽然不过十余年,却已经历了 底层存储、架构等技术方面的重大变革,由最初的单机图数据库向分布式大规 模图数据库发展。
Graph 1.0 时代(2007 年-2010 年):小规模原生图存储。以 Neo4j 为代 表,采用原生图的方式实现了图存储,获得了比关系型数据库快得多的复 杂关联数据查询性能。O'Reilly 出版的《图数据库》一书中在 5000 万点和 边的数据规模下,对比了 Neo4j 与关系型数据库在关联查询的时间对比, 随着关联关系深度的增加,关系型数据库性能呈指数倍增长甚至无法执行, 图数据库的优势不言而喻。然而,当时在软件架构设计上只支持单机部署, 图数据库产品性能和业务扩展能力有限。
Graph2.0 时代(2010 年-至今): 分布式大规模图存储。随着大数据和物 联网的蓬勃发展,数据本身的丰富程度增加,数据之间的关联性增多,扩 展性成为数据库行业共同的痛点,分布式架构的兴起催生了很多的分布式 图数据库项目。在这一发展阶段,支持分布式大规模图存储是关注的重点, 图存储是否以原生的方式实现,不再是那么重要的问题,例如 OrientDB 选 择了支持原生图存储,自研了分布式图数据存储模块,而 JanusGraph 则 是在其他数据库(Cassandra、HBase 等)之上封装实现图的语义。通过 支持在通用硬件上进行水平扩展(Scale Out),分布式图数据库具备了在 海量关联关系数据的存储与实时深度查询上绝佳的性能,但是在全图分析 等需要迭代计算的场景下仍需要结合图处理引擎进行离线计算与分析。
高性能计算技术愈加被重视,图数据库建设迎来发展的黄金时代:随着通信技 术和大数据快速发展,金融行业具有的数据资产体量剧增,数据间的关联关系 变得愈发复杂交错。传统的对少量、单维度、静态化数据的分析已经难以满足 金融业数字化转型需求。图数据库作为深入挖掘数据信息的有力工具,开始受 到全行业的关注。
图数据库在金融领域正式进入应用阶段:根据《金融业图数据库建设发展 调研报告》,当前图数据库在金融行业中已经获得长足发展,但总体建设 进度不一。国有大行、股份制银行较其他类型银行与金融机构对图数据有 更深入了解,数据应用规模更大。除一家尚处于 POC 测试阶段外,其他均 已使用过一种及以上的图数据库,60%的国有大行的图数据规模超过 10TB, 图规模超过 100 亿点边,集群规模超过 10 节点。此外,66.7%的国有大行、 40.0%的股份制银行已采购或正立项采购商业版图数据库。
图数据库是一种高效的分析型技术,已在金融行业多场景落地:根据《金 融业图数据库建设发展调研报告》,已部署图数据库的 41 家被调研机构中, 分别有 85.4%、73.2%、70.7%的机构在对公、内部管理以及零售三类业 务场景中应用了图数据库。整体来看,银行更多将图数据库应用于对公业务,保险和证券则更加专注于内部监管等相关场景。零售场景或成为图数 据库应用的一个增长点。
“自研应用+外采图数据库”是当前金融业最主流的建设路径:根据《金融业 图数据库建设发展调研报告》,相对于从 0 到 1 进行图数据库自研,金融 机构倾向将自研重心放到自己更擅长的应用领域。行级图平台的建设能够 高效满足金融机构对数据资产的统一管理。报告显示,整体上,79.6%的 被调研机构规划建设行级图数据库平台,所有参与调研的国有大行与股份 制银行均表示计划建设行级图平台。金融机构选择图数据库产品时需要从 性能、安全可控性、业务支撑度、简单易运维、应用能力五个维度分析图 数据库产品间的核心差异。报告显示,当前金融业对于图数据库产品的技 术价值关注度主要聚焦于存储、查询、分析能力,87.8%的被调研机构将 图数据库的大数据处理性能看作最重要的考量指标。值得一提的是,随着 外部环境的不断变化,金融机构对安全可控提出了更高要求。48%的被调 研机构将产品完全自主可控列为重要考量因素。此外,金融机构同样对于 图数据库厂商的业务支撑能力表现出了较高的关注度,68.4%的被调研机 构认为该能力十分重要。各类金融机构普遍对图数据库的便捷运维性提出 了要求:64.8%的被调研机构认为简单易运维是选择图数据库的重要考量 因素。
根据最新的 DB-Engines 图数据库排行榜单,Neo4j 稳居图数据库领头羊的地 位,国内对标厂商包括 NebulaGraph、gStore、Galaxybase 等。
Neo4j
发展历程:坚定投身图数据库领域,领头羊地位稳固。2000 年起,市场环境主 要是关系型数据库,但随着互联网尤其是移动互联网的发展,大量数据涌现, 关系型数据库已满足不了客户的需求。Neo4j 的创始人和初创团队看到市场需 求,并投身到图数据库这个领域。2007 年,怀揣图数据库理想的 Neo4j 公司正 式在瑞典成立。十几年之后,根据 Neo4j 亚太区副总裁 Nik Vora 讲话,截止 21 年 Neo4j 公司已经成为全球领先的图数据库平台,服务全球 400 多家企业客 户(包括空客、康卡斯特、eBay、美国宇航局、瑞银、沃尔玛等),坐拥数百 万社区用户;根据 Growjo 网站数据,Neo4j 目前估计年收入为 171.6 百万美元, 员工人数为 857 人(2024 年 5 月);根据桔子 IT 网站数据,2021 年 11 月 Neo4j 完成 3.9 亿元的 F 轮融资,投后估值为 35 亿美元。 客户资源优越,主要系知识图谱应用场景。根据 Nik Vora,Neo4j 的客户覆盖 NASA、沃尔沃、瑞银等强势客户。以 NASA 为例,NASA 有数以千计的数据 中心,NASA 的科学家或工程师之前找数据非常困难,因为有太多的文档,查 找极其耗时。NASA 登陆火星项目应用了 Neo4j,创建了知识图谱,把上亿信 息关联起来,方便工程师,将项目缩短了两年的时间,能提前完成项目并节省 成本。我国很多公司也在投入和学习知识图谱。在我国很多大型机构,知识图 谱都是非常流行的一个应用,大家投入很多的精力去学习,甚至已经开始研究 知识图谱如何帮助企业。Neo4j 在我国已经积累了很多客户,包括来自电信、 银行、金融、制造行业的领先公司。
产品从图数据库走向图数据平台。Neo4j 的核心产品仍然是图数据库,同时提供了开源社区版和企业版。但随着数据的多样性关联性不断丰富,以及业务需 求的不断变化,我们处理的数据复杂性和量级都在不断增长。Neo4j 从图数据 库演变成图数据平台,也是在不断丰富产品本身和扩展交互能力,力求满足当 前对于关联数据的丰富需求。不同的角色都可以通过 Neo4j 图数据平台开展工 作,除了开发者和 DBA 以外,还有业务分析人员、数据分析师、数据科学家, 以及大数据工程师等,都可以通过他们熟悉的工具和技术,来实现基于 Neo4j 图数据平台的工作。
6、 键值数据库:适用于快速查询与临时数据存储,以 Redis 为代表
根据 AWS 官网,键值数据库使用简单的键值方法来存储数据,该数据库将数据 存储为键值对集合,其中键作为唯一标识符,键和值都可以是从简单对象到复 杂复合对象的任何内容。
根据 AWS 官网,键值数据库的适用场景如下:会话管理:一个面向会话的应用程序(如 Web 应用程序)在用户登录某个 应用程序时启动会话,并保持活动状态直到用户注销或会话超时。在此期 间,该应用程序会将所有用户会话属性存储在主内存或数据库中,用户会 话数据可能包括个人资料信息、消息、个性化数据和主题、建议、有针对 性的促销和折扣。每个用户会话具有唯一的标识符,除了主键之外,任何 其他键都无法查询会话数据,因此快速键值存储更适合于会话数据。一般 来说,键值数据库所提供的每页开销可能比关系数据库要小。 购物车:在假日购物季,电子商务网站可能会每秒收到数十亿的订单。键 值数据库可以处理大量数据扩展和极高的状态变化,同时还通过分布式处 理和存储为数百万并发用户提供服务。此外,键值存储还具有内置冗余, 可以处理丢失的存储节点。 元数据存储引擎:键值存储可以充当底层存储层,以实现更高级别的数据 访问。例如可以扩展媒体和娱乐工作负载(例如实时视频流和交互式内容) 的吞吐量和并发度,还可以使用玩家数据、会话历史记录和数百万并发用 户的排行榜构建游戏平台。 缓存:可以使用键值数据库来临时存储数据,以便更快地进行检索,例如 社交媒体应用程序可以存储经常访问的数据(新闻源内容等)。
7、 向量数据库:大模型的记忆体,Pinecone、Milvus、 Transwarp Hippo 等均具备优势
AI 大模型催生向量数据库新应用。向量数据库简化原本复杂的底层数据处理系 统,实现数据类型形式上的统一,可以以高效达到相似性搜索,因其可以将向 量的特征进行分组与引索的能力。在引索方面,高效搜索可以被向量数据库通 过各类向量操作而实现,可用的向量操作有如向量相加、相似度计算、聚类分 析等。向量数据库也可以降低储存与计算成本,因向量数据库可以通过向量化 技术实现从高维向量到低维空间的映射。近年向量数据库的实际应用场景也因 大语言模型(LLM)的发展逐渐扩大,在大语言模型中,向量数据库可以储存 由大语言模型训练而产生的向量嵌入(Embeddings)。
向量数据库是大模型的记忆体。GOTC 2023 大会上,Zilliz 创始人兼首席执行 官星爵表示以 ChatGPT 为代表的大模型仍处于发展过程中,知识储备十分有限, 经常出现“AI 幻觉”,加上大模型的训练成本高昂,使得大模型的应用受到诸 多限制。向量数据库作为大模型的记忆体,不仅能够为其提供数据存储,而且 能通过数据检索的方式让大模型进行知识增强。在向量数据库的加持下,大模 型将变得博闻强识、成本可控。而根据 Zilliz 合伙人兼技术总监栾小凡,当下 “AI 幻觉”是大模型的主要痛点之一,由于信息密度不足,大模型经常会生成 一些无意义或不可信的内容。在此情况下,需要 CVP Stack(C 是 ChatGPT, 即利用大语言模型实现以 ChatGPT 为代表的智能问答;V 是 Vector database, 即通过向量数据库为 ChatGPT 提供大规模的、可靠的知识库;P 是 Prompt as code,即使用提示匹配用户问题与来自知识库的参考内容)。在整个 CVP Stack 中,向量数据库扮演着重要角色,它是为 AI 而生的数据库,Milvus 是这 一赛道的奠基者与领先者。Milvus 2.0 是云原生分布式的一款向量数据库,具有 百亿规模的向量可扩展性,能够实现存储计算分离、离在线一体化等。同时, Milvus 2.0 的性能亦值得关注,它的查询速度高于 ES 10 倍,高于主流竞品 2 倍,具备毫秒级延迟响应。此外,可插拔引擎、云端一体的特点也让 Milvus 2.0 成为全球领先的向量数据库。

Pinecone
Pinecone 发展历程:Pinecone 是向量数据库领域的早期探索者之一,成立于 2019 年,其创建是为了提供构建和运行最新 AI 应用程序所需的关键存储和检 索基础架构。Pinecone 更新迭代至今,能适用于广泛的应用程序:包括语义文 本搜索、生成问答、混合搜索和图像相似度搜索;并且拥有运行成本低、完全 托管、快速处理大量数据等特点。
与 OpenAI 达成合作,实现快速可扩展的向量搜索。Pinecone 与 OpenAI 达成 合作,专为 OpenAI 的 GPT-4 等大型语言模型(LLMs)提供长期记忆服务:用户 可以通过 OpenAI 的 Embedding API 生成语言嵌入,然后在 Pinecone 中为这 些嵌入建立索引,以实现快速且可扩展的向量搜索。Pinecone 还与 Cohere 等 LLM 生成商达成合作,如今已有 1500 个客户。 根据公司官网和 Growjo,截至目前,Pinecone 付费客户超过 200 名,其中包 括 Workday、Xandr(Microsoft)、Gong、Course Hero、BambooHR、Expel 和 Zapier 等等;Pinecone 目前使用数量正在快速上升,Pinecone 的免费计划 每天有超过 1 万个注册,并且在增长迅速中;Pinecone 估计年收入目前为 26.6 百万美元,估值为 7.5 亿美元。
Milvus(Zilliz)
Milvus 是全球首家以“向量数据库”命名的非结构化数据项目,由商业公司 Zilliz 进行运营支持。截至目前,Milvus 已得到全球上千家企业级用户的信赖, 包括 NVIDIA、eBay、Shopee、Walmart、快手、宜家等,最大部署规模超过 10 亿向量。同时,在很多应用场景下,Milvus 的 QPS 超过 10K。
Milvus 典型的应用场景包括:在长文本领域,可以进行翻译、问答、语义检索、 情感分析,语义检索和问答可以与 ChatGPT 配合使用,提升其回答的准确度; 在图片领域可以进行去重、目标检测、图片检索、多模态的图文互搜;在视频 领域进行推荐、合规检测、分类等。 以及众多新兴的应用场景,包括在生物制药领域把生物分子式转化成向量,判 断生物小分子与蛋白质能否紧密结合;在音频领域进行去重、情感分析;在风 控领域识别潜在的风险;在自动驾驶领域可以通过向量检索帮助自动驾驶找出 实时判断过程中没有分析出来的物体。
四、部署方式:“云化”为大势所趋
根据 CCSA TC601 大数据技术标准推进委员会,云被视为数字化转型的高度 战略性平台,云计算成为数据库发展的重要驱动力。数据库产品及生态工具上 云成为趋势,从全球范围看,目前,Elasticsearch、MongoDB、Databricks、 Snowflake 等数据库厂商,已与微软、谷歌、亚马逊、阿里云、腾讯云、 Clever CloudAiven 等公有云厂商开展合作。从国内范围看,近两年部分数据库 产品及生态公司如新数科技 ShinData DMP、沃趣科技 OFusion、飞轮科技 SelectDB、玫章算术 Ninedata、涛思数据 TDengine、悦数科技 NebulaGraph 等,已与阿里云、华为云联合推出 DBaaS 版本,持续完善公有云数据库产品及 运维体系,为用户搭建高效、便捷、安全的数据库云生态应用场景服务。
DBaaS 提供弹性灵活的数据库管理解决方案,助力企业降本增效。DBaaS 模 式最早由亚马逊提出,随后 Oracle、MongoDB、微软、谷歌、阿里巴巴、SAP、Redis Labs、IBM、腾讯、EnterpriseDBRackspace 等供应商纷纷推出相关服 务。随着建立和管理多云环境正在成为国外用户趋势,互有竞争关系的甲骨文 和微软甚至联合推出 Oracle Database Service for Azure,旨在为其共同客户的 应用迁移上云降低复杂性,更是为 OCI(Oracle Cloud Infrastructure)在 DBaaS 方面与 AWS 的竞争提供支撑。根据 Forrester 调查数据,33%的全球基础设施 业务决策者已经在生产环境中部署 DBaaS 版本。企业支持的使用场景类型已大 大增加,不仅限于简单的测试、开发和备份,更扩大到错综复杂的客户体验、 物联网、移动和大数据等应用领域。未来,DBaaS 将与其它技术更加深入融合。 随着 DBaaS 技术的普及和成熟,DBaaS 供应商逐步提供一些创新功能。例如 通过人工智能技术实现数据库部署、运维、管理全流程的自动化,减少人为干 预的同时加快部署,帮助企业迅速构建和支持庞大且更复杂的业务应用程序和 操作型系统。 以无服务器架构(Serverless)为核心计算范式的云原生技术飞速发展,云原生 数据库取得不断进步。越来越多的云原生数据库通过存储计算分离架构,实现 资源池化和极致弹性,具备高扩展性高可用性、跨地域规模、低成本等优势, 可为用户提供真正具备秒级智能弹性扩容能力、随需而动的云原生数据库服务。 云原生数据库 Serverless 关键技术以底层池化资源为基础,利用 RDMA 高性能 网络高效管理、使用物理资源实现资源池化及弹性扩展、高可用、高性能、低 成本的 Serverless 能力。Serverless 服务大部分以 API 形式提供,无需运维同 时用户也无需关注后端使用情况。服务还能实现是实时弹性扩缩容,用户可以 像使用自来水一样按使用量进行付费。最初的云数据库主要是模仿线下数据库 使用方式,为用户提供数据库托管服务。但云上主机的型号选择并不灵活,很 难根据用户业务及资源需求进行协调。云原生数据库计算和存储分离的架构很 好地解决了这一问题,这也是数据库 Serverless 化基础。目前存在一些 Serverless 数据库在架构上分为三层,即接入层、计算层和存储层。
五、需求功能:存储与分析需求驱动 OLAP、HTAP 技术发展,湖仓一体化前景广阔
1、数据湖仓:为处理复杂数据的存储和分析需求而诞生
根据 CCSA TC601《湖仓一体技术与产业研究报告》,在存储和分析海量数据 需求的推动下,数据平台架构持续演进,经过数十年的发展,主要经历了数据 库、数据仓库、数据湖三个阶段。
数据库:20 世纪 60 年代,企业的数据量不大且数据类型比较单一。企业对 数据的使用需求主要是面向管理层从宏观层面对公司的经营状况做描述性分 析,处理的数据为有限的结构化数据,支撑数据存储和计算的软件系统架构 比较简单。20 世纪 70 年代,最早出现的关系型数据库已经得到了一定程度 的应用。关系型数据库主要应用于联机事务处理 OLTP 场景,如银行交易 等。
数据仓库:随着互联网的快速普及,门户、搜索引擎、百科等应用用户快速 增长,数据量呈爆发式增长,原有的单个关系型数据库架构无法支撑庞大的 数据量。20 世纪 90 年代数据仓库理论被提出,主要是为解决单个关系型数 据库架构无法支撑庞大数据量的数据存储问题而诞生。数据仓库是为了对数 据整合而形成的架构,核心是基于 OLTP 系统的数据源,根据联机分析处 理 OLAP 场景诉求,将数据经过数仓建模形成 ODS、DWD、DWS、DM 等不同数据层,每层都需要进行清洗、加工、整合等数据开发(ETL)工作, 并最终加载到关系型数据库中。
数据湖:随着移动互联网的飞速发展,半结构化、非结构化数据的存储、计 算需求日益突出,对数据平台提出了新的要求。2010 年,数据湖概念被提 出,数据湖是一种支持结构化、半结构化、非结构化等数据类型大规模存储 和计算的系统架构。随着 Hadoop 技术的成熟与普及,企业开始基于 Hadoop、Spark 及其生态体系中的配套工具搭建平台处理结构化、半结构 化数据,同时利用批处理引擎实现数据批处理。而以开源 Hadoop 体系为代 表的开放式 HDFS 存储、开放的文件格式、开放的元数据服务以及多种引 擎(Hive、Presto、Spark 等)协同工作的模式,形成了数据湖的雏形。 Hudi、Delta Lake 和 Iceberg 三大开源数据湖技术的成熟,加速了数据湖产 品化落地。数据湖将数据管理的流程简化为数据入湖和数据分析两个阶段。 数据入湖即支持各种类型数据的统一存储。数据分析则以读取型 Schema(schema on read)形式,极大提升分析效率。

此前多采用“数据湖+数据仓库”混合架构,存在较大弊病。为满足多种数据类型 存储、多场景分析等业务诉求,企业的数据平台采用混合部署模式,数据湖、数 据仓库、关系型数据库等多种架构并存,其中数据湖和数据仓库通过 ETL 进行 数据交换。数据湖和数据仓库是两套独立的体系,其中数据湖基于 Hadoop 技术 生态(HDFS、Spark、Flink 等技术)来实现,主要用于支撑多源异构的数据存 储,执行批处理、流处理等工作负载。数据仓库主要基于 MPP 或者关系型数据 库来实现,主要支撑结构化数据在 OLAP 场景下的 BI 分析和查询需求。混合架 构的模式会带来数据冗余,增加存储成本;两个系统间额外的 ETL(抽取、转化、 加载)流程导致时效性差;数据一致性保障低,增加数据校验成本;混合架构复 杂,开发运维难度大、成本高等弊端。 湖仓一体技术应运而生。2020 年 Databricks 提出“湖仓一体”概念,随着云计算 的深入应用,以容器、DevOps、微服务等为代表的云原生技术与大数据技术进 一步深度融合,采用存算分离架构,同时利用云原生的资源弹性扩缩容、按需分 配特点实现了资源进一步集约化,进而降低成本,同时促进了湖仓一体技术的兴 起。湖仓一体是指融合数据湖与数据仓库的优势,形成一体化、开放式数据处理 平台的技术。通过湖仓一体技术,可使得数据处理平台底层支持多数据类型统一 存储,实现数据在数据湖、数据仓库之间无缝调度和管理,并使得上层通过统一 接口进行访问查询和分析。
2、湖仓一体化代表厂商:Databricks、Snowflake 崛起之 路复盘
根据 CCSA TC601《湖仓一体技术与产业研究报告》,湖仓一体技术路线的代 表产品包括 Databricks、Snowflake、阿里云 MaxCompute 和亚马逊 Redshift 等。
Databricks
数据湖中支持数仓的功能主要是通过功能性开发实现,如多版本并发控制、自 适应 Schema、提供文件级事务等来实现数仓功能,这类产品以 Databricks 的 DeltaLake、Uber 的 Apache Hudi 等为代表。 发家背景:根据 Databricks 官网,Databricks 是 ApacheSpark 背后的商业公司, 美国科技独角兽,起源于学术界和开源社区。2013 年由 ApacheSpark™、 DeltaLake 和 MLflow 的原始创建者创立,总部位于美国旧金山,致力于提供基 于 Spark 的云服务。Databricks 在世界各地设有办事处,拥有数百家全球合作 伙伴,包括 Microsoft、Amazon、Tableau、Informatica、Capgemini 和 BoozAllenHamilton,其使命是简化数据和 AI 并使之民主化,帮助数据团队解 决世界上最棘手的问题。作为世界上第一个也是唯一一个云中的湖仓一体平台, Databricks 结合了最好的数据仓库和数据湖,为数据和 AI 提供了一个开放、统 一的平台。
Databricks 起源于支持开源 Apache Spark 的数据湖。Databricks 成立于 2013 年,是一个基于数据湖的云数据平台,专注于数据科学和机器学习应用。 Databricks 平台的核心组件包括数据湖(存储引擎)、Delta Lake(处理引擎) 以及 Unity Catalog(用于数据治理和安全管理的引擎)。所有这些组件都构建 在云平台(如 AWS 或 Azure)的基础之上。Databricks 建立在三个核心开源系 统(Apache Spark、Delta Lake 和 MLflow)上,并且支持包括 SQL 的多种编 程语言。从 Delta Lake 到 Delta Sharing,Databricks 的所有关键产品线都可以 免费使用。同时客户可以选择使用 Databricks 的企业级产品以获得更高级的功 能和支持。这样开放的系统为 Databricks 积累了强大且忠实的工程师社区支持。 Databricks 从简单的数据湖逐步发展为广泛的数据湖仓库。数据湖仓库把面向 企业的数据仓库技术与数据湖存储技术相结合,避免传统的数据湖、数据仓库 之间的数据移动,将原始数据、加工清洗数据、模型化数据,共同存储于一体 化的“湖仓”中,既能面向业务实现高并发、精准化、高性能的历史数据、实 时数据的查询服务,又能承载分析报表、批处理、数据挖掘等分析型业务。 ETL 能够将未经规整的数据湖层数据转换成数仓层结构化的数据,在数据湖仓 库的构建中起了非常重要的作用。
发展历程:2017 年,DataBricks 与微软合作推出 AzureDatabricks。2020 年, DataBricks 公司首次提出了湖仓一体(DataLakehouse)概念,希望将数据湖 和数据仓库技术合而为一,此概念一出各路云厂商纷纷跟进。2023 年 7 月, Databricks 宣布收购大模型企业 MosaicML,此次收购后 Databricks 将可为企 业提供统一的平台来管理数据资产,并且能够使用自己的专有数据来构建、拥 有和保护自己的生成式 AI 模型。2023 年 9 月 14 日 Databricks 宣布在 I 轮融资 中筹集了超过 5 亿美元资金,Databricks 的估值已达到 430 亿美元。截至 2024 年 1 月底,Databricks 表示其年收入突破 16 亿美元,同比增长 50%+。根据 Growjo,公司员工人数为 8883 人。 产品及客户:根据 Databricks 官网,如今,全球有 9,000 多家组织(包括荷兰 银行、康泰纳仕、再生元和壳牌)依靠 Databricks 来实现大规模数据工程、协 作数据科学、全生命周期机器学习和业务分析,主要产品涉及 Databricks 共享 和统辖平台、人工智能、马赛克 ML、数据管理、数据仓库、实时分析、数据工 程、数据科学等多个方面。例如:DatabricksLakehouse 帮助 AT&T 在运营中 加速 AI,包括将欺诈减少 70%-80%,减少客户流失并增加 CLV;壳牌将 Databricks 用作现代商业智能工具,帮助公司转向数据和人工智能来提高运营 效率,通过能源解决方案进行创新,打造更清洁的世界;荷兰银行通过 DatabricksLakehouse 将数据和 AI 付诸行动,在全球范围内实现银行业转型; Rolls-Royce 通过使用 DatabricksLakehouse 的实时数据收集来减少碳排放, 为航空旅行带来更绿色的未来;USPSOIG 通过 DatabricksLakehouse 为数百 万人提供高效的邮政服务;Walgreens 使用 DatabricksLakehouse 创建了一个 智能数据平台,该平台能够在其近 9,000 家药房的网络中预测需求并重新分配 药物,同时为药剂师提供近乎实时的见解和建议,以帮助为患者提供更个性化 的建议。

Snowflake
Snowflake 将存储和计算功能分离是区别于传统数仓最大的技术革新。 Snowflake 成立于 2012 年,由一些不满意 Oracle 的架构师所创立。公司最初 提供云数据仓库服务,用于存储数据和运行分析计算工作负载。传统数仓无法 实现存储和计算单独拓展,而 Snowflake 存算分离架构实现“不影响数据库(存 储层)工作状态的条件下,根据需求动态匹配计算资源”。没有查询语句执行时, 可彻底“关闭”计算资源,减少资源浪费。 Snowflake 从单一数据仓库产品向数据融合、智能实时分析等方向拓展,不断 朝着数据云一体化方向进化。Snowflake 打破传统数据仓库发展桎梏,持续提 升产品能力。根据最新的 Gartner 云数据管理系统(Cloud DBMS)魔力象限统 计,Snowflake 的技术创新加速行业升级变革,和 Databricks 一起成功由 2020 年的挑战者升级为 2021 年的领导者。Snowflake 于 2014 年推出云数据仓库产 品,实现数据高效存储和计算;2019 年数据仓库进化为云数据平台,实现数据 的合并、分析等功能;2020 年云数据平台升级为可看作生态系统的数据云,用 户、合作伙伴、数据提供者可在 Snowflake 平台内紧密交互,深度挖掘数据价 值,实现数据分析和决策。
编辑:火腿肠- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 10 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
