大数据治理——元数据是关键

发布时间:2018.12.03来源:数据管理浏览量:98次标签:数据治理

在大数据时代,当数据以多种格式分散在整个企业中并且来自许多来源时,需要一种新的数据治理方法。
随着可用数据的数量、种类和速度都在以惊人的速度持续增长,企业面临着两个紧迫的挑战:如何发现这些数据中的可操作的洞察力,以及如何保护它。这两个挑战直接取决于数据治理的高水平。 
Hadoop生态系统可以使用元数据方法提供这种级别的治理,理想情况下是在单个数据平台上。

需要一种新的治理方法有以下几个原因。在大数据时代,数据分散在整个企业中。它是结构化的、非结构化的、半结构化的和各种其他格式。此外,数据源不在需要管理的团队的控制之下。

在这种环境下,数据治理包括三个重要目标:
保持数据质量
实现访问控制和其他数据安全措施
捕获数据集的元数据以支持安全性工作并促进最终用户数据的消耗 


Hadoop生态系统中的解决方案 

在Hadoop环境中实现大数据治理的一种方法是通过数据标记。在这种方法中,当数据通过各种企业系统时,将控制数据使用的元数据嵌入到该数据中。此外,此元数据被增强以包括超出常见属性的信息,如文件大小、权限、修改日期等。例如,它可能包括业务元数据,这些元数据将帮助数据科学家评估其在特定预测模型中的有用性。 
最后,与企业数据本身不同,元数据可以集中在单个平台上。 
标准的Hadoop分布式文件系统HDFS具有扩展的属性能力,允许丰富的元数据,但是对于大数据并不总是足够的。幸运的是,存在另一种解决方案。Apache Atlas元数据管理系统支持数据标记,还可以充当集中式元数据存储,可以为正在搜索相关数据集的数据分析师提供“一站式购物”。此外,流行的Hadoop友好的Hive和Spark SQL数据检索系统的用户可以自己进行标记。 
为了安全,Atlas可以与Apache Ranger集成,Apache Ranger是一个提供对Hadoop平台的基于角色的访问的系统。 


平台加载挑战 

将元数据初始加载到Atlas平台以及随后的增量加载都面临重大挑战。对于大型企业来说,在初始阶段,数据量的庞大将是主要问题,为了有效地执行这个阶段,可能需要优化一些代码。

增量加载是一个更复杂的问题,因为表、索引和授权用户一直在变化。如果这些变化没有快速反映在可用的元数据中,那么最终的结果就是最终用户可用的数据质量下降。为了避免这个问题,事件侦听器应该包括在系统的构建块中,以便可以近乎实时地捕获和处理更改。实时解决方案不仅意味着更好的数据质量。它还提高了开发人员的生产率,因为开发人员不必等待批处理过程。 


数字化改造的基础

随着企业追求数字转换并寻求更多的数据驱动,高级管理层需要意识到,没有高质量的数据就不可能实现这个方向的任何结果,这需要强有力的数据治理。当涉及大数据时,基于驻留在中央存储库中的增强元数据的治理是一种可行的解决方案。

(部分内容来源网络,如有侵权请联系删除)
立即免费申请产品试用 免费试用
相关文章推荐
  • 客户数据中台CDP是什么?真的能构建用户全景画像,消除数据孤岛吗?

    客户数据中台CDP是什么?真的能构建用户全景画像,消除数据孤岛吗?

    现代营销依赖于数据。所有人都想从最基本的开始做起,了解客户是谁。这似乎很简单,但客户与业务互动渠道的激增,使这个简单的目标变得极其复杂。……查看详情

    发布时间:2021.07.16来源:亿信数据治理知识库浏览量:230次

  • 数据资产如何安全可追溯,你们应该这样做!

    数据资产如何安全可追溯,你们应该这样做!

    近年来,食品安全中提到产地的可追溯性,给许多生鲜打上了专属的身份证以便出现问题可以追根溯源。而这并不稀奇,在使用报表工具时处于数据安全考……查看详情

    发布时间:2021.03.12来源:知乎浏览量:124次

  • 什么是数据治理?

    什么是数据治理?

    可用性指数据可用、可信且有质量保证,不会因为分析结果的准确性造成偏差,从业者可以放心地根据数据结果做业务决策;完整性分为两个方面,一方面……查看详情

    发布时间:2019.11.01来源:知乎浏览量:134次

  • 数据资产管理“管”什么

    数据资产管理“管”什么

    目前,数据资产管理已经形成了一套科学的管理架构体系,其体系架构如下图所示,主要包含9个活动职能和2个保障措施,9个活动职能指的是数据标准……查看详情

    发布时间:2020.09.11来源:知乎浏览量:104次

  • 为健全数据治理奠定基础

    为健全数据治理奠定基础

    本文展示了如何构建具有广泛业务涉众参与的“基层”数据治理能力。 ……查看详情

    发布时间:2019.01.14来源:亿信华辰浏览量:103次

  • 数据治理的坑你遇到过几个?

    数据治理的坑你遇到过几个?

    数据治理是一项长期而繁杂的工作,很多时候大家都为如何做好数据治理而感到困惑,甚至很多时候对此失去了信心。……查看详情

    发布时间:2019.08.19来源:御数坊浏览量:144次

  • 数据治理与数据质量有何不同?

    数据治理与数据质量有何不同?

    当下是一个大数据的时代,有越来越多的企业开始应用大数据来创造价值,为了能够充分的利用数据价值,企业需要对数据进行管理,当我们听到数据管理……查看详情

    发布时间:2019.07.26来源:知乎浏览量:137次

  • 2019—开启你的数据治理道路

    2019—开启你的数据治理道路

    如今,数字系统正在生产越来越多具有公认价值的数据,数据治理正变得越来越受欢迎和必要。然而,并非所有数据都被视为相同。……查看详情

    发布时间:2019.06.28来源:知乎浏览量:120次

  • 深度思考:从BERT看大规模数据的无监督利用

    深度思考:从BERT看大规模数据的无监督利用

    在击败 11 个 NLP 任务的 State-of-the-art 结果之后,BERT 成为了 NLP 界新的里程碑, 同时打开了新的思……查看详情

    发布时间:2019.02.20来源:亿信华辰浏览量:231次

  • 企业级数据治理面临的挑战与对策

    企业级数据治理面临的挑战与对策

    数据治理是社会深度信息化的产物,显示数据正从独占转为共享、从封闭走向开放、从权力变成资源的趋势。目前国内外对其有多种定义,如数据治理是对……查看详情

    发布时间:2019.08.20来源:知乎浏览量:203次

相关主题
您点击 “提交”,表明您已理解并同意接受本网站隐私政策和用户协议