高质量的数据一般包括哪些特征?

发布时间:2022.06.09来源:小亿浏览量:3495次标签:数据治理

基于数据决策的前提是数据可靠且相关,数据必须是“真实可信的”,否则“输出将是误导和无效的”。但是企业所收集的数据可能不完全,或者更新不及时。不完全的数据,特别是不准确的数据,可能会带来更危险的决策。但是,所收集的数据来源多样,种类丰富,也很容易出现同一个数据从不同的部门得到的数值不一样的情况。

一、高质量数据的六个特征

1、易用性

是指在指定条件下使用时,软件产品被理解、学习、使用和吸引用户的能力。对于数据来说,我认为数据的易用可以分为两方面:是否被需要、是否被理解。它更多的是和日常沟通、产品需求及规划相关。

是否被需要,意思是当前我们提供的数据,是否真的能够满足用户需要,数据的真正效果有没有达到。比如,我们给用户提供的是它自己品牌的数据,但用户可能更需要的是行业下的数据来做进一步的市场规划。

是否被理解,意思是当前我们对数据的定义是否是行业认可的,是否存在团队与团队之间、用户与开发者之间理解的不一致。

2、功能性

软件提供了用户所需要的功能。二级特性包括:适合性、准确性、互用性、安全性。对数据而言,个人觉得重要的应该属于准确性和安全性。

1)对于准确性,如果一句话概括就是,先数据要有,其次数据要全,后数据要准。

2)对于安全性,尤其是数据安全,命题也很大,这里不再赘述。但需要提的一点是,数据安全涉及到隐私或者差分攻击的预防,也可能是由业务同学考虑的范畴,所以在数据质量模型中不能忽视。

3、效率

是指在规定条件下,相对于所用资源的数量,软件产品是否在规定时间内可提供适当的性能的能力。比如计算倾斜或者计算资源不足导致数据产不出来。效率也是一种根因,终影响的还是功能性。

4、可靠性

在指定条件下使用时,软件产品维持规定的性能水平的能力。比如上游数据无法定时给出,依赖关系的强弱配置不正确,可能影响的就是数据无法定时产出。可靠性是一种根因,终影响的还是功能性。

5、可移植性

是指软件产品从一种环境迁移到另一种环境的能力,也是开发阶段主要考虑的。服务或者网站的可移植性大家了解比较多,数据的可移植性是指什么?我个人认为可移植性强调的更多是跨技术平台的移植,而不是模块间的数据复用。在数据上可能就是数据直接从一个计算平台迁移到另一个计算平台,或者SQL代码从一个计算平台迁移到另一个计算平台。

6、可维护性

是指是在修改或者新增需求时,当前的开发架构是否足够灵活的支持,是开发阶段主要考虑的。比如在数仓开发中,当新上游到来时,如果从下到上全部采用烟囱式开发,那对新增的需求必定是不友好的。如果改为Hub或者集市模式,可能只需要开发接入数据的ETL代码,剩下的完全可以复用,就是提升可维护性的一种手段。

二、提高数据质量的策略

1.建立数据的标准,明确数据的定义。

从整个企业的角度出发,建立统一的数据标准和数据定义,同时,整个企业必须就这个数据标准和数据定义达成共识。

2、建立一个可重复的数据收集、数据修改和数据维护流程。

数据管理面临的两个主要挑战是企业本身的复杂性和身份信息不断变化。这两个客观原因的存在意味着企业的数据质量保证行动永远没有结束之日,因此,企业在制订数据质量的保证措施和数据质量指标时,必须保证这些措施和指标能够不断重复。

3、在数据转化流程中设立多个性能监控点。

在数据发生转换后就与前一时期进行比较,从而对数据质量进行评估。如果此前所采用的数据质量改进方法有助于提高最终用户的满意度,那么,这些中间指标的达标也预示着项目的最终成功。

4、对流程不断进行改善和优化。

通过一个不断改进的流程,持续不断地排除错误、对数据进行整合和标准化,最后达到流程的自动化,从而降低数据质量保证计划的总体开销。

5、把责任落实到人。

对于负责数据的产生、数据的合理化以及对数据进行清理和维护的人员,应该给他们的活动制订明确的指标,这样他们才能真正理解人们到底希望他们达到什么目标。

三、数据质量管理工具有哪些?

亿信华辰自主研发的EsDataClean数据质量管理平台,以数据标准为数据检核依据,以元数据为数据检核对象,通过向导化、可视化等简易操作手段,将质量评估、质量检核、质量整改与质量报告等工作环节进行流程整合,形成完整的数据质量管理闭环。

(部分内容来源网络,如有侵权请联系删除)
立即免费申请产品试用 免费试用
相关文章推荐
  • 业务词汇表和元数据:数据治理和词汇表准备

    业务词汇表和元数据:数据治理和词汇表准备

    如果您能说出数据治理计划的目标并拥有赞助组织,那么您可能已经准备好了 在回答How,When和Where问题之前,您需要回答Why,Wh……查看详情

    发布时间:2019.01.22来源:亿信华辰浏览量:196次

  • 数据标准在数据资产管理中的意义

    数据标准在数据资产管理中的意义

    尽管出现了很多专家和专著,但真正理解这个概念的人并不多,懂得如何实操数据资产管理、在企业中真正落地的更寥寥无几。笔者有幸参与了国内几个典……查看详情

    发布时间:2019.03.12来源:亿信华辰浏览量:179次

  • 为什么数据标准这么重要,三个小招教你实现

    为什么数据标准这么重要,三个小招教你实现

    评价是现代社会各领域的一项经常性的工作,是科学做出管理决策的重要依据。随着人们研究领域的不断扩大,所面临的评价对象日趋复杂,如果仅依据单……查看详情

    发布时间:2020.07.17来源:CSDN浏览量:139次

  • 建立统一的数据交换平台实现各部门的数据共享

    建立统一的数据交换平台实现各部门的数据共享

    要实现各部门的数据共享,必须先建立统一的数据交换平台,通过交换平台实现各异构数据库之间的数据集成,实现原有各业务系统在数据级集成,保证异……查看详情

    发布时间:2020.08.21来源:知乎浏览量:261次

  • 数据湖与数据仓库之间的桥梁

    数据湖与数据仓库之间的桥梁

    数据湖的吸引力和新颖的功能对传统的数据仓库(DWH)系统构成了巨大的威胁。DWH的主要缺点包括与不适应不断发展的数据环境的刚性内部结构相……查看详情

    发布时间:2021.07.26来源:亿信华辰数据治理知识库浏览量:191次

  • 数据治理和数据管理不可互换

    数据治理和数据管理不可互换

    从什么时候开始数据管理和数据治理可以互换? 这个问题让我感到困惑和沮丧。追求数据管理供应商与业务利益相关者建立联系,因为业务部门在决策……查看详情

    发布时间:2018.11.20来源:Michele Goetz浏览量:180次

  • 数据治理:如何入门

    数据治理:如何入门

    无论是在零售业,银行业还是医疗保健业,如今最精明的商业领袖都将数据列入其顶级企业资产 - 与产品,设备,设施和员工一样有价值 - 并且他……查看详情

    发布时间:2018.11.23来源:Henry DeVries浏览量:191次

  • 业务流程建模及其在企业中的作用

    业务流程建模及其在企业中的作用

    为实现其目标,组织必须完全了解其流程。因此,业务流程设计和分析是定义业务运营方式的关键,并确保员工理解并负责履行其职责。……查看详情

    发布时间:2019.02.18来源:亿信华辰浏览量:273次

  • 创新者的破局之路:煤炭行业首个集团级数据治理项目落地

    创新者的破局之路:煤炭行业首个集团级数据治理项目落地

    工业互联网激起能源领域一池春水,新一代信息技术则是其不断发展的加速器。山东能源集团下属临沂矿业集团有限责任公司(以下简称临矿集团)率先在……查看详情

    发布时间:2021.02.04来源:亿信华辰浏览量:433次

  • 敏捷/精益数据治理最佳实践

    敏捷/精益数据治理最佳实践

    数据治理 的目标 是确保组织内的质量,可用性,完整性,安全性和可用性。你对此的看法取决于你。许多传统的数据治理方法似乎在实践中都很困难,……查看详情

    发布时间:2018.12.18来源:数据治理浏览量:154次

相关主题
您点击 “提交”,表明您已理解并同意接受本网站隐私政策和用户协议