什么是数据虚拟化(Data Virtualization)?

2021-07-28 17:18yonghe

本文将简单易懂地介绍数据虚拟化技术及数据虚拟化软件架构的实现方法,尽量避免教条主义。如需要了解虚拟化定义,可通过wiki 百科了解。

先引用一段百度百科的文字来说明数据虚拟化的定义:

数据虚拟化(data virtualization)是用来描述所有数据管理方法的涵盖性术语,这些方法允许应用程序检索并管理数据,且不需要数据相关的技术细节,例如它格式化的方式或物理位置所在。

正如百科的定义,采用数据虚拟化技术构建的系统或软件,可以充当跨多个不同数据源的桥梁,将关键的主数据集中在一个虚拟层,通过统一的访问方式提供给需要数据的系统或应用。

数据虚拟化提供了一个新的数据层,将企业内部的所有数据源抽象后,成为一个面向领域的统一数据访问层,使用户或者业务系统能够采用统一的接口或者语义访问企业所有的数据,包括传统数据库、大数据源以及云和物联网系统中的数据。这样做的好处是通过数据虚拟化技术,屏蔽了企业内部多元异构数据的多样性和复杂性,大大提升了企业对数据的使用效率,并且显而易见地降低了沟通和使用成本。


数据虚拟化系统应具备的 4 大功能

敏捷设计和开发(Agile design and development):需要从内部审视可用的数据、发现数据之间隐藏的关系、对各个视图/服务进行建模、验证,并按需进行修改定制。所以需要通过敏捷设计和开发一些自动化的功能,已应付大量的重复工作。这些功能可自动执行、缩短解决方案实施的时间,并提高对象的重用率。

高性能运行时(High-performance runtime):当应用程序调用数据请求时,能够执行优化过后的查询语句,并返回适当的格式化数据结果。这类功能需确保提供最新的数据、最优的执行性能和减少源数据读写。

适当使用缓存(Use of caching when appropriate):一旦向外提供数据,意味需要提供高性能高并发的数据交付,适当使用缓存可以提升系统的查询响应性能】避免因网络限制无法读写源数据库,并实现 7x24 小时的可用性。

使数据易于查找和管理(Make data easy to find):提供使数据易于查找的业务目录可用于对数据进行搜索和分类、浏览、选择以及与 IT 部门协作,以提高数据质量和实用性。

数据虚拟化系统/产品的架构实现

数据虚拟化产品的架构一般有两种实现方式,联邦查询和实时镜像。

数据联邦查询通过连接各数据源实现数据统一访问,采用缓存进行加速,不全量负责数据。 当应用调用数据请求时,联邦查询会对查询语句进行优化并执行,发别从缓存或数据源端抽取数据,并进行合并和组装,以应用需要的格式返回数据结果。

优点:无需全量复制,硬件成本低;
缺点:查询的执行过程中会对数据源系统有侵入,需要和源系统改动联动,并且响应的延迟高,无法对查询响应的延迟承诺。
联邦查询

实时镜像的方式实现数据虚拟化,需要建立一个中央化的数据存储库,通过对各个数据源进行连接并实时同步,将各个数据源的数据按 1:1 的方式,镜像到中央数据存储库,然后基于中央数据存储去做数据建模和统一管理。

优点:对源系统无影响或影响较小,可实现亚秒级的查询响应;
缺点:需要额外的存储成本;
实时镜像

Tapdata 数据虚拟化方案

Tapdata 是由深圳钛铂数据研发的一款实时数据服务平台的产品,该产品采用的是“实时镜像” 的方式实现数据虚拟化。

Tapdata 产品架构图 摘自 tapdata.net

Tapdata 主打的是实时数据场景,并专注在为 OLTP 型业务提供数据服务。满足 OLTP型业务的基本条件有三个:高并发、毫秒级响应和实时同步。

Tapdata 采用中央存储库镜像数据,以确保能应付数十万并发请求,并提供毫秒级查询响应的数据服务,此外并在数据实时同步和处理方面花了比较大的功夫,比如基于 CDC 日志挖掘能确保源端数据发生变化,在1秒以内反映到目标数据库(中央存储);在数据处理方面抛弃了现有的开源解决方案,完全重新了计算引擎,支持批流一体数据处理,实现数据合并、清洗和转换。

总体来看,基本做到了实时同步、实时处理的目标,使数据服务满足高并发、毫秒级响应和实时同步 3 大条件,符合 OLTP 业务对数据的要求。

数据虚拟化的好处

业务价值加速:更完整、更新、易于访问的数据,比 ETL 需要花费更少的投入,并获得更快的产品迭代速度,获得更大的价值;

业务洞察力改进:可以对更全面的数据进行分析,助力企业洞察和决策;

减少开发成本:可重复使用的数据服务和交互式开发体验,降低沟通成本、缩短数据准备的工期,可提高项目质量并避免项目返工;

降低数据安全风险:集中式管理,提升了管理的效率,降低了数据安全的风险。


Tapdata 实时数据服务平台

官网: https://tapdata.nettapdata.net


推荐阅读

Tapdata 推出“钛计划”公益项目,着力打通数据孤岛助推社会数字化升级

为响应数据要素市场化配置改革政策方向的指引,Tapdata 推出“钛计划”打通数据孤岛公益行动,面向非盈利机构(如各城市政务服务数据管理局、社会公益组织/项目等)以及为社会培养数据技术人才的相关培训机构,提供 Tapdata 实时数据服务平台的特殊免费授权,助推公共领域数据互通、共享与实时应用......

Tapdata 钛铂数据的产品理念

Tapdata 是全球首个基于数据即服务架构理念、面向 TP 场景的企业实时主数据服务平台,可以帮助企业快速实现主数据的统一管理和发布,并为所有数据库、数仓、大数据平台提供最实时的源数据,让数据随时可用。

Tapdata Cloud 是什么?

Tapdata Cloud 是钛铂数据自研的异构数据库实时同步工具 Tapdata Replicator 的云服务版本,现在免费提供所有开发者和企业使用Tapdata Cloud 目前支持 Oracle、MySQL、PostgreSQL、SQL Server、MongoDB、Elasticsearch 之间的数据迁移和同步,未来将陆续上线 DB2、Sybase ASE、Redis、Kafka 等。

什么是数据即服务(Data as a Service)?

数据即服务(DaaS)是一种数据管理策略,旨在利用数据作为业务资产来提高业务创新的敏捷性。它是自 1990 年代互联网高速发展以来越来越受欢迎的“一切皆服务”(XaaS)趋势下关于数据服务化的那一部分,介于 PaaS 和 SaaS 之间。与 SaaS 类似,DaaS 提供了一种方式来管理企业每天生成的大量数据,并在整个业务范围内提供这些有价值的信息,以便于进行数据驱动的商业决策。同时,我们也...

什么是数据虚拟化(Data Virtualization)?

本文将简单易懂地介绍数据虚拟化技术及数据虚拟化软件架构的实现方法,尽量避免教条主义。如需要了解虚拟化定义,可通过wiki 百科了解。先引用一段百度百科的文字来说明数据虚拟化的定义:数据虚拟化(data virtualization)是用来描述所有数据管理方法的涵盖性术语,这些方法允许应用程序检索并管理数据,且不需要数据相关的技术细节,例如它格式化的方式或物理位置所在。正如百科的定义,采用数据...

Tapdata 数据库实时同步的技术要点

Tapdata 专注于实时数据的处理技术,在数据库迁移和同步方面,Tapdata 的表现非常优秀,实时、多元、异构,尤其在关系数据库到非关系数据库之间的双向同步方面,无论是从操作上,还是效率上,都体现了业界领先的水平。本文重点阐述 Tapdata 在数据库实时同步方面的技术要点。

教育中台与第三方系统对接整合数据案例

最近, 南京秦淮区教育中台系统,成功地和市系统进行了一次圆满对接。通过教育中台提供的统一数据能力和低代码API对接能力,实现了对市系统数据的实时推送和拉取,以及各类业务逻辑上的处理。这次对接为南京市中小学生创客大赛的成功举办提供了及时可靠的数据支撑, 体现了中台系统在快速响应业务方面的优越性。

周生生 | 全渠道商品中心建设

通过Tapdata 构建全渠道商品中心,实现: - 支持中国大陆港澳台的上千家门店的生产环境; - 使用JS脚本来进行流处理计算,业务需求从开发到上线过程快至 1 天以内; - 任务配置与执行监测全程可视化操作,不懂技术也能完成操作,极大降低维护成本; - 一套产品可满足不同需求,根据业务需求产出不同类型的业务模型节省大量人力物力。

关系型数据库到MongoDB实时数据同步解决方案

使用MongoDB作为主机下行或新一代数据库的选择,将业务数据从已有主机或Oracle等关系型数据库复制到MongoDB; 使用Tapdata Replicator的CDC技术,实时监听现有业务库的数据变动并同步至MongoDB; 使用Tapdata 的RDM技术将关系型表合并转型到MongoDB JSON数据结构,并保持和源库的高度数据一致; 在MongoDB上进行新业务的开发。

Tapdata肖贝贝:实时数据引擎系列(一)-新鲜的数据流

前言2006 年诞生的 hadoop 和 她周边的生态, 在过去的这些年里为大数据的火热提供了足够的能量, 十几年过去了, 场景在变化, 技术在演变, 大家对数据的认知已经不再局限于 T+1 与 高吞吐高延迟 为主要特征的上一代框架理念, 在真实的场景里, 实时, 准确, 多变 的数据也发挥着越来越重要的作用为满足这些新的需求, 各种框架和中间件如雨后春笋般不断涌出hive 的出现让这头大象...
联络我们:
Email:team@tapdata.io    电话:0755-26656080
深圳市南山区临海大道香江金融中心 2410-13
官方服务号
Tapdata 微信公众号
扫码关注