询问数据治理教练:数据湖上的数据治理?
发布时间:2019.03.22来源:亿信华辰浏览量:80次标签:数据治理
目前有很多关于数据湖泊及其提供的可能性的兴奋,特别是关于分析和数据可视化。因此,我越来越多地被问到您是否真的需要在数据湖上进行数据治理。毕竟,数据湖是一个集中式存储库,允许您以可扩展的方式存储所有结构化和非结构化数据。
与数据仓库不同,您可以按原样存储数据,而无需先构建数据。这导致许多组织以不受控制和轻率的方式将大量数据“倾倒”到数据湖中。结果是许多人称之为“数据沼泽”,并没有提供他们希望的惊人见解。
所以这个问题的简单答案是肯定的 - 你确实需要数据治理数据湖,以防止它们成为用户不使用的数据沼泽,因为他们不知道那里有什么数据,他们找不到它,或者他们只是不相信它。如果您的数据库上有数据治理,那么您和您的用户可以确信它包含可以找到并正确使用的干净数据。
但我不指望你只是接受我的话; 让我们看一下为什么要对数据库中的数据实施数据治理的一些原因:
数据所有者已达成一致
数据所有者应该批准他们拥有的数据是否适合加载到Data Lake,例如它是否是敏感数据,如果在加载之前是匿名的?
此外,数据湖的用户如果对数据有任何疑问及其可以或不可以使用的内容,则需要知道联系人。
数据定义
虽然数据定义在所有情况下都是可取的,但对数据湖来说它们更为必要。在没有定义的情况下,更多结构化数据库中的数据用户可以使用该数据的上下文来收集数据可能是什么的一些想法。由于数据湖本质上是非结构化的,因此没有这样的背景。
缺少数据定义意味着用户可能无法找到或理解数据,或者使用错误的数据进行分析。因此,数据湖可以提供现成的数据来源,但缺乏对它的理解将意味着它无法快速,轻松地用于响应机会,并且数据湖的使用将局限于一个小的专家用户数量。
数据质量标准
数据质量标准使您能够监控和报告数据湖中保存的数据的质量。虽然在分析大量数据时并不总是需要完美的数据,但用户确实需要了解数据的质量。如果没有标准(以及监控它们的能力),用户将无法知道数据是否足以进行分析。
数据清理
在数据湖内以自动方式完成的任何数据清理需要与数据所有者和数据使用者达成一致,以确保所有此类行为符合定义和标准,并且不会导致数据无法用于某些分析目的 - 例如,将缺席的出生日期默认到约定的日期可能会影响分析,这些分析涉及查看客户的年龄。
数据质量问题解决
虽然在某些情况下数据湖内的自动数据清理可能是适当的,但数据湖中所有已识别的数据质量问题都应通过现有流程进行管理,以确保数据所有者和数据同意最合适的解决方案。消费者。
数据沿袭
记录数据流总是有价值的,但为了满足某些监管要求,(包括EU GDPR)组织需要证明他们知道数据的位置以及数据在整个公司中的流动方式。
关键数据治理可交付成果之一是数据沿袭图。应将数据流中的关键或敏感数据记录在数据流图中。这将通过突出显示数据的来源来增加对数据使用者的理解。此类文档还有助于防止将来将重复数据加载到数据湖中。
我希望我已经说服你,如果你想要一个数据湖来支持你的业务决策,那么就需要数据治理。虽然它可能不需要像您为数据仓库安装的定义和文档那样精细,但需要确保您创建和维护数据湖而不是数据沼泽!
在没有首先理解数据的情况下将数据提取到数据湖中,这只是经常发生的许多数据治理错误之一。您可以在此处下载我的免费报告,找出最常见的错误,更重要的是如何避免错误。
-
数据治理“起航” 推动银行业高质量发展
银行业金融机构数据治理提上日程。近日,银监会发布《银行业金融机构数据治理指引(征求意见稿)》(以下简称《指引》),要求银行业金融机构将数……查看详情发布时间:2019.02.21来源:和讯网浏览量:76次
-
企业数据治理战略中的重要任务
尽管许多企业的数据治理在被不经意间悄悄地忽视了,只有48%的企业拥有明确的规划或计划,但这并不影响数据治理的重要性,它聚焦于三个关键因素……查看详情发布时间:2020.07.14来源:知乎浏览量:65次
-
大数据如何成为了驱动社会治理的创新转向?
大数据、智能化、移动互联、云计算成为了驱动经济发展和社会转型的重要力量,“用数据说话、用数据决策、用数据管理、用数据创新”成为了公共管理……查看详情发布时间:2018.09.30来源:中新界面浏览量:72次
-
十年经验总结:企业物料主数据建设方案
目前很多企业已建立ERP系统,关联到整个企业运营的物料数据仍然存在“一物多码”、“描述不规范”等数据质量问题,这会对企业数据流通共享和经……查看详情发布时间:2021.05.21来源:亿信数据治理知识库浏览量:223次
-
为什么你应该有一个数据治理策略
有效的数据治理也是一个持续的过程。政策定义,审查,调整和审计以及合规审查和质量控制都会作为数据治理生命周期经常受到影响或重复。因此,数据……查看详情发布时间:2019.03.08来源:亿信华辰浏览量:82次
-
数据治理能力正在成为互联网+时代城市竞争新优势
新型智慧城市的四个新视角解读 城市服务要以人为中心,但是城市的服务不但以人为中心,还是要做到数据,由于数据为核心,没有好的数据,就没有……查看详情发布时间:2019.01.08来源:亿信华辰浏览量:75次
-
数据虚拟化 实现大数据的有效管理
关于在石油天然气的钻探和出产过程中所发生的数据的价值,并没有太多的争议。尽管数字化油田运动的最初意图,是将与设备的监测和维护相关的使命完……查看详情发布时间:2019.03.05来源:亿信华辰浏览量:98次
-
如何有效的进行数据治理?
如果你处理或使用过大量数据,一定有听到过“数据治理”这个词。你会思考数据治理是什么?数据治理是否适合你?如何实施……查看详情发布时间:2019.01.09来源:亿信华辰浏览量:80次