大数据治理——元数据是关键

发布时间:2018.12.03来源:数据管理浏览量:95次标签:数据治理

在大数据时代,当数据以多种格式分散在整个企业中并且来自许多来源时,需要一种新的数据治理方法。
随着可用数据的数量、种类和速度都在以惊人的速度持续增长,企业面临着两个紧迫的挑战:如何发现这些数据中的可操作的洞察力,以及如何保护它。这两个挑战直接取决于数据治理的高水平。 
Hadoop生态系统可以使用元数据方法提供这种级别的治理,理想情况下是在单个数据平台上。

需要一种新的治理方法有以下几个原因。在大数据时代,数据分散在整个企业中。它是结构化的、非结构化的、半结构化的和各种其他格式。此外,数据源不在需要管理的团队的控制之下。

在这种环境下,数据治理包括三个重要目标:
保持数据质量
实现访问控制和其他数据安全措施
捕获数据集的元数据以支持安全性工作并促进最终用户数据的消耗 


Hadoop生态系统中的解决方案 

在Hadoop环境中实现大数据治理的一种方法是通过数据标记。在这种方法中,当数据通过各种企业系统时,将控制数据使用的元数据嵌入到该数据中。此外,此元数据被增强以包括超出常见属性的信息,如文件大小、权限、修改日期等。例如,它可能包括业务元数据,这些元数据将帮助数据科学家评估其在特定预测模型中的有用性。 
最后,与企业数据本身不同,元数据可以集中在单个平台上。 
标准的Hadoop分布式文件系统HDFS具有扩展的属性能力,允许丰富的元数据,但是对于大数据并不总是足够的。幸运的是,存在另一种解决方案。Apache Atlas元数据管理系统支持数据标记,还可以充当集中式元数据存储,可以为正在搜索相关数据集的数据分析师提供“一站式购物”。此外,流行的Hadoop友好的Hive和Spark SQL数据检索系统的用户可以自己进行标记。 
为了安全,Atlas可以与Apache Ranger集成,Apache Ranger是一个提供对Hadoop平台的基于角色的访问的系统。 


平台加载挑战 

将元数据初始加载到Atlas平台以及随后的增量加载都面临重大挑战。对于大型企业来说,在初始阶段,数据量的庞大将是主要问题,为了有效地执行这个阶段,可能需要优化一些代码。

增量加载是一个更复杂的问题,因为表、索引和授权用户一直在变化。如果这些变化没有快速反映在可用的元数据中,那么最终的结果就是最终用户可用的数据质量下降。为了避免这个问题,事件侦听器应该包括在系统的构建块中,以便可以近乎实时地捕获和处理更改。实时解决方案不仅意味着更好的数据质量。它还提高了开发人员的生产率,因为开发人员不必等待批处理过程。 


数字化改造的基础

随着企业追求数字转换并寻求更多的数据驱动,高级管理层需要意识到,没有高质量的数据就不可能实现这个方向的任何结果,这需要强有力的数据治理。当涉及大数据时,基于驻留在中央存储库中的增强元数据的治理是一种可行的解决方案。

(部分内容来源网络,如有侵权请联系删除)
立即免费申请产品试用 免费试用
相关文章推荐
  • 为什么要进行数据交换

    为什么要进行数据交换

    企业大量的IT投资建立了众多的信息系统,但是随着信息系统的增加,各自孤立工作的信息系统将会造成大量的冗余数据和业务人员的重复劳动。企业急……查看详情

    发布时间:2020.08.10来源:知乎浏览量:109次

  • 数据治理有助于为分析构建坚实的基础

    数据治理有助于为分析构建坚实的基础

    如果您的业务很多,那么它就会大量投资于分析。我们生活在一个数据驱动的世界里。数据推动了我们从零售商处获得的建议,我们从杂货店获得的优惠券……查看详情

    发布时间:2019.01.23来源:亿信华辰浏览量:150次

  • 数据治理及其在激励数据中的作用

    数据治理及其在激励数据中的作用

    数据治理是一种包罗万象的数据工程和数据管理概念,组织采用该概念来确保整个数据生命周期中的高质量数据。此概念基于四个概念 - 可用性,适用……查看详情

    发布时间:2018.12.18来源:数据治理浏览量:145次

  • 业务词汇表和元数据:数据治理和词汇表准备

    业务词汇表和元数据:数据治理和词汇表准备

    我经常被问到“我们如何捕获数据词汇表资产”和“我们是否已准备好与数据管理员合作?”我的回答始终是:如果您能说明数据治理计划的目标并拥有赞……查看详情

    发布时间:2018.12.21来源:数据治理浏览量:124次

  • 4+7集采进入大数据时代,科技巨头驱动医药行业大变局

    4+7集采进入大数据时代,科技巨头驱动医药行业大变局

    未来的医疗大数据将影响整个医药产业格局。 根据国家医保局及“4+7”带量采购发布的文件,包括天津、大连、沈阳等城市药品带量采购细则……查看详情

    发布时间:2019.03.28来源:亿信华辰浏览量:81次

  • 数据治理:推动结果的引擎

    数据治理:推动结果的引擎

    组织成功取决于某些与共同业务目标一致的构建块。这些构建块包括业务活动,数据和分析。……查看详情

    发布时间:2019.01.26来源:亿信华辰浏览量:136次

  • 2019年IT关注的重点:大数据分析的存储架构

    2019年IT关注的重点:大数据分析的存储架构

    存储行业的技术专家和分析师预测,IT组织将专注于改进其存储架构,以便在2019年更好地利用数据分析、人工智能和物联网。并指出,改进大数据……查看详情

    发布时间:2019.03.26来源:亿信华辰浏览量:83次

  • 深入浅出元数据及元数据管理

    深入浅出元数据及元数据管理

    大数据时代下,数据已被公认为一项重要的资产。而元数据管理作为数据管理框架中一项重要的管理职能,也越来越多的出现在大家的视野中。但是对于元……查看详情

    发布时间:2019.10.24来源:亿信华辰浏览量:105次

  • 什么是cgeit?对经验丰富的IT治理专业人员的认证

    什么是cgeit?对经验丰富的IT治理专业人员的认证

    cgeit是一个供应商中立的认证,为负责管理it企业治理的IT专业人士设计,以验证他们在该领域的技能。……查看详情

    发布时间:2019.01.09来源:亿信华辰浏览量:127次

  • 数据治理:建立有效政策的10个步骤

    数据治理:建立有效政策的10个步骤

    数据治理通常与法规遵从性相关。但数据质量和理解是数据治理的核心。作为竞争优势,更全面地使用快速增长的企业数据的能力也是数据治理策略的公认……查看详情

    发布时间:2018.12.14来源:数据治理浏览量:163次

相关主题
您点击 “提交”,表明您已理解并同意接受本网站隐私政策和用户协议