提高数据质量的方法

发布时间:2019.11.15来源:知乎浏览量:214次标签:数据治理

1、明确业务需求并从需求开始控制数据质量
要想真正解决数据质量问题,应该从需求开始,企业往往在定义清楚业务需求后忽略对数据质量的控制,而只对已经产生的数据做检查,然后再将错误数据剔除,这种方法治标不治本,不能从根本上解决问题。

企业需要将数据质量的控制从需求开始集成到分析人员、模型设计人员与开发人员的工作环境中,让大家在日常的工作环境中自动控制数据质量,在数据的全生命周期中控制数据质量。

2、建立数据质量管理机制
从业务出发做问题定义,由工具自动、及时发现问题,明确问题责任人,通过邮件、短信等方式进行通知,保证问题及时通知到责任人。跟踪问题整改进度,保证数据质量问题全过程的管理。

(1)探查数据内容、结构和异常通过探查,可以识别数据的优势和弱势,帮助企业确定业务实施计划。一个关键目标就是明确指出数据错误和问题,例如将会给业务流程带来威胁的不一致和冗余。

(2)建立数据质量度量并明确目标企业需建立一个共同的平台并完善度量标准,用户可以在数据质量记分卡中跟踪度量标准的达标情况,并通过电子邮件发送URL来与相关人员随时进行共享。

(3)设计和实施数据质量业务规则明确企业的数据质量规则,即可重复使用的业务逻辑,管理如何清洗数据和解析用于支持目标应用字段和数据。业务部门和IT部门通过使用基于角色的功能,一同设计、测试、完善和实施数据质量业务规则,以达成最好的结果。

(4)将数据质量规则构建到数据集成过程中

数据质量服务由可集中管理、独立于应用程序并可重复使用的业务规则构成,可用来执行探查、清洗、标准化、名称与地址匹配以及监测。

在企业大数据治理过程中,对于大数据生产线中的每个集成点,都需要做数据质量的检查,严格控制输入数据的质量。比如在数据采集过程,集成过程,分析过程等等都需要做检查。

但在大数据环境中,每个集成点都会有海量数据量流过,把数据逐条检查这种传统方式是行不通的,应该采用抽样的方式,对一批数据做数据质量的检查,来确定这批数据是否满足一定的质量区间,再决定是否需要对这批数据做详细的检查。

(5)检查异常并完善规则

在执行数据质量流程后,大多数记录将会被清洗和标准化,并达到企业所设定的数据质量目标。然而,无可避免,仍会存在一些没有被清洗的劣质数据,此时则需要完善控制数据质量的业务规则。

目前企业内的数据主要分为外部数据和内部数据,大数据时代到来让各企业广泛采购第三方数据,第三方数据的质量逐渐成为决定企业数据质量的关键因素。

对于企业的内部数据,可以通过业务梳理直接获得质量检核规则。但是对于外部第三方数据,需要先对这些数据进行采样,并应用关联算法自动发现其中的质量检核规则,并将这些检核规则持续积累,形成外部数据的检核规则库。

(6)对照目标,监测数据质量

数据质量控制不应为一次性的“边设边忘”活动。相对目标和在整个业务应用中持续监测和管理数据质量对于保持和改进高水平的数据质量性能而言是至关重要的。可选择仪表板和报告进行监测。
(部分内容来源网络,如有侵权请联系删除)
立即免费申请产品试用 免费试用
相关文章推荐
  • 企业数据治理中的应对

    企业数据治理中的应对

    首先,数据治理的核心认识是,数据治理是一个持续并且长久的一个过程,不同的产品可以解决比如采集、传输等数据治理层面上的不同问题,但并不存在……查看详情

    发布时间:2019.11.01来源:知乎浏览量:214次

  • 资金模型:资助数据治理

    资金模型:资助数据治理

    数据治理框架以两种方式解决资金问题……查看详情

    发布时间:2019.03.19来源:亿信华辰浏览量:241次

  • 数据治理的四个阶段

    数据治理的四个阶段

    数据治理的定义是对数据资产管理行使权力和控制的活动集合。其最终目的是挖掘数据价值,推动业务发展,实现盈利。……查看详情

    发布时间:2021.03.06来源:亿信数据治理知识库浏览量:237次

  • 数据虚拟化 实现大数据的有效管理

    数据虚拟化 实现大数据的有效管理

    关于在石油天然气的钻探和出产过程中所发生的数据的价值,并没有太多的争议。尽管数字化油田运动的最初意图,是将与设备的监测和维护相关的使命完……查看详情

    发布时间:2019.03.05来源:亿信华辰浏览量:175次

  • 什么是数据治理及其为什么对您的业务至关重要?

    什么是数据治理及其为什么对您的业务至关重要?

    数据治理如何影响他们:由于您没有雇用一组全新的理事会成员,因此DGC数据治理的最大影响将是与数据和数据策略相关的额外工作。如果或出现问题……查看详情

    发布时间:2018.11.26来源:数据治理浏览量:222次

  • 数据治理最佳实践利用大数据

    数据治理最佳实践利用大数据

    大数据时代的新兴技术,如人工智能和物联网,意味着有更多的数据可以从中受益,并且数据治理策略可以管理和保护。……查看详情

    发布时间:2019.06.28来源:知乎浏览量:226次

  • 业务词汇表和元数据:数据治理和词汇表准备

    业务词汇表和元数据:数据治理和词汇表准备

    如果您能说出数据治理计划的目标并拥有赞助组织,那么您可能已经准备好了 在回答How,When和Where问题之前,您需要回答Why,Wh……查看详情

    发布时间:2019.01.22来源:亿信华辰浏览量:205次

  • 数据治理准备的支柱:企业数据管理方法

    数据治理准备的支柱:企业数据管理方法

    Facebook的数据问题继续成为头条新闻的主导,并进一步凸显了企业范围内数据资产视图的重要性。备受瞩目的案件与其他着名的数据丑闻有所不……查看详情

    发布时间:2019.01.24来源:亿信华辰浏览量:223次

  • 企业何时进行数据治理才是最佳时机

    企业何时进行数据治理才是最佳时机

    找准数据治理的切入点,是关乎数据治理成败的关键。如果将数仓建设分为数仓雏形阶段、数仓迭代阶段和能力沉淀阶段,数据治理应该在哪个阶段切入为……查看详情

    发布时间:2020.06.30来源:知乎浏览量:155次

  • 四位一体的大数据治理框架是什么?

    四位一体的大数据治理框架是什么?

    大数据治理有着自身独特的框架,这一框架经由人、物、技术、数据的高度融合而成,大数据的价值与保护在这一框架内被重新定义。除此之外,凡身处这……查看详情

    发布时间:2019.01.08来源:亿信华辰浏览量:231次

相关主题
您点击 “提交”,表明您已理解并同意接受本网站隐私政策和用户协议