什么是数据质量?如何衡量它以获得最佳结果?

发布时间:2018.12.25来源:数据治理浏览量:203次标签:数据治理

我们过去谈过很多关于数据质量的问题 - 包括糟糕数据的成本。但是,尽管对数据质量有了基本的了解,但许多人仍然不太了解“质量”究竟是什么意思。

例如,有没有办法衡量这种质量,如果有,你是如何做到的?在本文中,我们将寻求回答这些问题等等。但首先…

 

数据质量

消除数据质量神话

 在创建基本要求时,确保数据质量的基础

关于数据质量的最大误区之一是它必须完全没有错误。随着网站和其他广告系列收集如此多的数据,几乎不可能获得零错误。相反,数据只需要符合为其设置的标准。为了确定“质量”是什么,我们首先需要了解三件事:

    1. 谁创造了要求        

    2. 如何创建需求,以及

    3. 在满足这些要求方面,我们有多大程度的自由度


许多企业都有一个独特的“数据管理员”,他们理解并设定了这些要求,并且是确定错误容忍度的人。如果没有数据管理者,IT通常会发挥作用,确保负责数据的人了解可能影响数据的任何缺点。

你可以拥有它好,快或便宜 - 选择两个

数据质量

 

从收集数据到使其符合公司需求,一切都可以解决潜在的错误。拥有100%完整且100%准确的数据不仅非常昂贵,而且耗时且几乎没有推动ROI针头。

有这么多数据进入,必须迅速做出决策。这就是为什么数据质量是一个微妙的平衡行为 - 杂耍和判断准确性和完整性。如果它听起来像一个很高的要求,你会很高兴知道有一种疯狂的方法,第一步是数据分析。

什么是数据分析?

数据质量

 

数据分析涉及查看数据库中的所有信息,以确定它是否准确和/或完整,以及如何处理不是的条目。例如,导入贵公司制造的产品数据库并确保所有信息都是准确的,这是相当简单的,但当您导入有关竞争对手产品或其他相关细节的详细信息时,情况就不同了。

通过数据分析,您还可以查看数据的准确程度。如果您在2016年7月1日推出,系统是否记录为1916年或2016年?您可能甚至可以在梳理您获得的信息时发现重复和其他问题。以这种方式分析数据为我们提供了一个起点 - 从确保我们使用的信息具有最佳质量的跳板。

确定数据质量

现在我们有一个起点来确定我们的信息是否完整和准确,下一个问题就变成了 - 当我们发现错误或问题时我们该怎么办?通常,您可以执行以下四种操作之一:

  • 接受错误 - 如果它在可接受的标准范围内(即主街而不是主街),您可以决定接受它并转到下一个条目。
  • 拒绝错误 - 有时,特别是对于数据导入,信息严重受损或不正确,最好只删除条目而不是尝试纠正它。
  • 纠正错误 - 客户名称的拼写错误是一个很容易纠正的常见错误。如果名称有变化,您可以将其中一个设置为“主”,并在所有数据库中保持数据的整合和正确。
  • 创建一个默认值 - 如果您不知道该值,那么在那里(未知或不适用)可能更好。


整合数据

当您在不同数据库中拥有相同的数据时,错误和重复的机会已经成熟。成功集成的第一步是查看数据的位置,然后以一致的方式组合数据。在这里投资成熟的数据质量和准确性工具来帮助协调和同步数据库中的信息是非常值得的。

您的数据质量检查表

数据质量

 

最后,因为您在很多不同的领域处理如此多的数据,所以有一个清单可以确定您是否正在使用最高质量的数据。DAMA UK创建了一个关于“ 数据维度 ” 的出色指南,可用于更好地全面了解如何确定数据质量。

他们的数据质量维度包括:

完整性 - 包含一个或多个值的数据的百分比。重要的是首先完成关键数据(例如客户姓名,电话号码,电子邮件地址等),因为完整性不会对非关键数据产生太大影响。

唯一性 - 当针对其他数据集进行测量时,只有一个类型的条目。

及时性 - 日期和时间对数据的影响有多大?这可能是之前的销售,产品发布或在一段时间内依赖的任何信息都是准确的。

有效性 - 数据是否符合为其设定的相应标准?

准确性 - 数据如何反映出由其识别的真实世界的人或事物?

一致性 - 数据与先入为主的模式的一致性如何?出生日期有一个共同的一致性问题,因为在中国,标准是 YYYY / MM /DD,而在欧洲和其他地区,DD / MM / YYYY的使用是标准的。

数据质量的大图

正如您所看到的,没有“一刀切”的方法来保持每个企业的每种类型数据的准确性和完整性。随着大数据对信息的兴趣越来越大,每天都越来越重要,正面解决数据质量问题变得越来越重要。虽然看起来势不可挡,但值得利用数据卫生工具让计算机做他们最擅长的事情 - 数字紧缩。

您可以采取的最重要的步骤就是开始。随着越来越多的潜在客户加入并发现新市场,数据总是会增长,因此永远不会成为解决数据质量问题的“最佳时机”。花时间来确定数据质量对您的公司或组织意味着什么可以产生改善客户服务,更好的客户体验,更高的转换率和更长的客户保留率的连锁反应 - 这些都是投资回报的类型任何企业都会全心全意地拥抱!

(部分内容来源网络,如有侵权请联系删除)
立即免费申请产品试用 免费试用
相关文章推荐
  • 数据治理中,符合数字标准意味着什么

    数据治理中,符合数字标准意味着什么

    数据治理中,符合数字标准意味着什么?您需要采取什么措施来确保您的数据系统,1、确保数据完整性;2、溯源数据来源;3、主数据服务……查看详情

    发布时间:2021.04.23来源:亿信数据治理知识库浏览量:164次

  • 数据治理治什么?在哪治?怎么治?

    数据治理治什么?在哪治?怎么治?

    数据是指对客观事件进行记录并可以鉴别的符号,是对客观事物的性质、状态以及相互关系等进行记载的物理符号或这些物理符号的组合。其实在我看来,……查看详情

    发布时间:2020.06.24来源:知乎浏览量:135次

  • 数据治理的血缘分析

    数据治理的血缘分析

    数据治理里经常提到的一个词就是血缘分析,血缘分析是保证数据融合(聚合)的一个手段,通过血缘分析实现数据融合处理的可追溯。……查看详情

    发布时间:2019.11.22来源:CSDN浏览量:226次

  • 大数据构成挑战?数据治理提供解决方案

    大数据构成挑战?数据治理提供解决方案

    大数据导致许多组织的复杂性,不仅仅是因为他们收集的数据量很大,而是因为他们收集的数据种类繁多。……查看详情

    发布时间:2019.01.23来源:亿信华辰浏览量:139次

  • 数据交换平台解决方案

    数据交换平台解决方案

    数据交换平台提供各子系统接入的接口,实现数据交换平台和各信息系统的有机结合,以统一的接口规范实现数据自动提取、数据转换、数据发送、数据校……查看详情

    发布时间:2020.04.23来源:知乎浏览量:208次

  • 数据仓库应该怎么建立

    数据仓库应该怎么建立

    现在的社会就是一个数据化的社会,大数据已经成为大家讨论的热门话题了,对于每个企业来说,建立自己的数据仓库已经显得非常重要了,尤其是对于新……查看详情

    发布时间:2019.07.17来源:数据仓库小编浏览量:108次

  • 您是否与数据治理的战略转变保持一致?

    您是否与数据治理的战略转变保持一致?

    大多数企业都知道数据是收入增长和长寿的关键,并且他们必须找到一种方法来利用这些资产获取洞察力以获得竞争优势。……查看详情

    发布时间:2019.03.27来源:亿信华辰浏览量:155次

  • 统一数据平台 - 连接所有重要事项

    统一数据平台 - 连接所有重要事项

    企业可以从统一的数据平台中获益良多。……查看详情

    发布时间:2019.02.15来源:亿信华辰浏览量:131次

  • 数据质量问题的影响因素

    数据质量问题的影响因素

    数据质量反映的是数据的“适用性(fitness for use)”,即数据满足使用需要的合适程度。数据质量通过完整性、一致性、准确性、及……查看详情

    发布时间:2020.04.09来源:百度浏览量:598次

  • 浅谈数据质量管理

    浅谈数据质量管理

    随着互联网及数字化技术的飞速发展,我们生活在一个数字化转型的时代,各种数字化正在实实在在的改变着企业的日常运营,以及我们每个人的衣食住行……查看详情

    发布时间:2019.07.17来源:知乎浏览量:152次

相关主题
您点击 “提交”,表明您已理解并同意接受本网站隐私政策和用户协议