数据湖与数据仓库之间的桥梁

发布时间:2021.07.26来源:亿信华辰数据治理知识库浏览量:195次标签:数据治理

自Pentaho首席技术官James Dixon提出“数据湖”一词以来已经有十年了。这个术语及其底层技术比以往任何时候都热门。

数据湖.jpg

尽管数据仓库(DWH)系统已经存在并得到认可,但数据行业已经接受了更新的存储库,即数据湖,特别是在大数据增长,向云存储的转变以及实施数据仓库之后。 


可以争论的是,数据湖的优势包括:

1、更快的访问:用户可以轻松访问数据湖,从而实现实时分析。

2、适应性:数据湖可以存储小规模或巨大的数据量(甚至PB)。

3、灵活性:数据湖能够处理各种数据类型和数据源。

4、成本效益:与本地数据湖相比,云数据湖更加经济实惠。


数据湖的吸引力和新颖的功能对传统的数据仓库(DWH)系统构成了巨大的威胁。DWH的主要缺点包括与不适应不断发展的数据环境的刚性内部结构相关的高昂成本,而DWH在设计和构建复杂数据存储方面可能会非常耗时。


尽管如此,数据湖解决方案通过提供具有成本效益的云存储选项并使界面和功能更易于识别和简化而在竞争中获得了改观。此外,对DWH的需求仍然很高,其好处包括:

1、效率: 数据湖数据是结构化的,可以在几毫秒内检索到。

2、趋势分析:由于数据湖专为查询和分析而设计,因此它包含历史数据,使用户可以随时间回答一系列预定义的问题。

3、治理:由于许多数据湖系统遵循基于内部数据标准和策略的方法(例如Kimball或Inmon),因此可以帮助数据用户就规则,标准和解释达成一致。


面对大数据问题,数据湖的新范例确实可以完美满足AI的需求,但是结构化数据可以更好地为许多分析或业务用户提供服务。因此,结合了结构化和半结构化数据系统的混合解决方案越来越受欢迎。


如今,数据湖和数据湖已成为数据行业公认的存储库。根据业务用途,数据湖和数据湖可以用于不同的目的并提供各种优势。


但是,两个存储系统仍然存在一个共同的未解决问题: 资料品质。著名的80/20数据科学难题,无论您选择何种数据存储方式,都需要80%的时间用于清理而20%的时间用于分析。


关于数据质量的主要区别在于,数据清理是在将数据加载到数据湖之后进行的,而数据质量过程则是在将数据加载到数据湖中之前实施的;在这两种情况下,这将使花费在改进数据质量上的时间相似。


已经创建了平台来解决这个常见的数据质量问题,该问题在整个数据团队中消耗大量的工程时间。


数据质量对于两种类型的数据存储系统都非常重要:

1、数据湖中的数据质量:这可以通过应用有关GDPR或其他数据相关法律的质量规则来防止“脏”数据值馈入AI模型或强制执行数据提供者的数据传递SLA来实现。

2、数据湖中的数据质量:为了使DWH的集成速度更快,至关重要的是能够在几分钟内增加质量层次,加快集成过程和数据质量洞察力。


许多组织正在采用混合存储系统解决方案,这使得在所有存储系统中拥有一致的数据质量视图比以往任何时候都更加重要。因此,实施可在混合方案中使用的数据质量工具对于优化数据系统,授权数据团队和业务部门以及希望将80/20规则反转为80%的分析和20%(或更少)的清理至关重要。


了解更多数据湖或数据治理相关知识:https://www.esenruizhi.com/ 

(部分内容来源网络,如有侵权请联系删除)
立即免费申请产品试用 免费试用
相关文章推荐
  • 影响企业大数据分析的三大误区

    影响企业大数据分析的三大误区

    我们现在身处一个虚拟时空交易与现实时空交付的数字化时代。数字化正在各行业快速发展,许多企业将会经历前所未有的改变。数据正发挥着越来越重要……查看详情

    发布时间:2022.03.08来源:小亿浏览量:208次

  • 那些关于数据治理的不过时观点

    那些关于数据治理的不过时观点

    数据是有成本,数据是有成本的。存储数据是需要成本的,数据的成本绝非只有物理存储空间成本那么简单,实际上它包括了下述五种成本要素:……查看详情

    发布时间:2019.08.19来源:CSDN浏览量:221次

  • 如何做好银行金融大数据治理平台建设

    如何做好银行金融大数据治理平台建设

    大数据、云计算、互联网等技术,将人类带入了一个以PB为单位的大规模生产、分享和应用数据的新时代。当治理的对象发生变化时,治理体系也应进行……查看详情

    发布时间:2019.10.15来源:知乎浏览量:299次

  • 什么是数据标准?如何制定数据标准?这份指南送上

    什么是数据标准?如何制定数据标准?这份指南送上

    随着大数据行业的兴起,数据的重要性不言而喻,对数据进行应用的工具层出不穷,带来了巨大的经济效益。可很快就发现了诸多数据问题,制约了数据应……查看详情

    发布时间:2020.09.29来源:头条浏览量:174次

  • 数据治理的目标和原则

    数据治理的目标和原则

    所有成功的数据治理和管理计划,流程和项目都充实了这些原则。它们是帮助利益相关者聚集在一起解决 每个组织固有的数据相关冲突类型的原则 ……查看详情

    发布时间:2019.03.19来源:亿信华辰浏览量:272次

  • 大数据时代企业数据不治理就破产-居安思危

    大数据时代企业数据不治理就破产-居安思危

    数据治理并不等同于数据管理,而只是数据管理的顶层执行层面。数据管理指规划、控制和提供数据及信息资产,发挥数据和信息资产的价值,强调在企业……查看详情

    发布时间:2020.02.21来源:知乎浏览量:197次

  • 数据治理:如何入门

    数据治理:如何入门

    无论是在零售业,银行业还是医疗保健业,如今最精明的商业领袖都将数据列入其顶级企业资产 - 与产品,设备,设施和员工一样有价值 - 并且他……查看详情

    发布时间:2018.11.23来源:Henry DeVries浏览量:201次

  • 数据分析加数据治理-让数据清澈如水

    数据分析加数据治理-让数据清澈如水

    在如今数据大浪潮下,如果您的业务很多,那么它就会大量堆积并且产生新的问题。我们生活在一个数据驱动的世界里。数据推动了我们从不同地方获得的……查看详情

    发布时间:2019.08.30来源:浏览量:224次

  • 数据中台和传统的数据系统出发点不一样

    数据中台和传统的数据系统出发点不一样

    原来的数据平台也好,数据湖也好,数据仓库也好,它们的出发点很多时候有局限性,应该说更是一个支撑性的技术系统,即一定要去考虑我先有什么数据……查看详情

    发布时间:2021.01.23来源:知乎浏览量:171次

  • 大型传统企业如何利用数据管理系统把握好业务和数据的关系,逐步实现智能化转型?

    大型传统企业如何利用数据管理系统把握好业务和数据的关系,逐步实现智能化转型?

    关于“数据治理”的定义各大研究学派给出的都概念不尽相同,但看了这么多不同的说法小亿翻译成人话,其实就是要搞清楚:数据治理治什么?谁来治?……查看详情

    发布时间:2020.08.31来源:亿信华辰浏览量:154次

相关主题
您点击 “提交”,表明您已理解并同意接受本网站隐私政策和用户协议