数栈:为数据治理而生

发布时间:2019.01.04来源:NinGoo浏览量:205次标签:数据治理


2018年5月21日,中国银保监会印发《银行业金融机构数据治理指引的通知》(银保监发〔2018〕22号),新规从征求意见到正式稿落地仅仅2个月时间,后续监管政策补短板会加快。金融行业对于数据治理的迫切需求,在指引中,明确提出了数据治理架构、数据管理、数据质量控制、数据价值实现等问题,是大数据发展到一定程度的必然结果。

从业务数据化到数据业务化,大数据已经越来越多的成为企业的资产,但在发展过程中,数据来源繁多、数据口径不一、数据质量缺乏管控、数据安全存在隐患,这些都是阻碍企业实现数字化转型和数据驱动的问题,如何有效和高效的解决这些问题,既体现了企业数字化转型的决心,也体现了企业数据驱动的能力。

互联网的发展过程,实际上就是不断业务数据化的过程,通过将人的衣食住行等行为都在线化,从电商、到外卖、到租房、到共享出行,每一个快速成长的互联网业务,都是将各种业务场景在线化的过程。在线化是实现数据化的前提,数据化是在线化的必然结果。这也是为什么云计算和大数据等基础技术的突破必然会在互联网企业出现并壮大的原因。

2009年,阿里巴巴就设立了CDO岗位,担任第一任CDO的,正是后来成为阿里巴巴第二任CEO的陆兆禧。这比银保监会在这次指引中“提出可结合实际情况设立首席数据官”的数据治理架构提前了近十年。当然,阿里当初设立CDO并不仅仅为了数据治理,更是为了数据价值实现,也就是数据业务化。2009年阿里在数据领域发生了三件大事,设立CDO只是其一,另外两件分别是自研大数据计算平台和以数据为资产的阿里小贷业务创新。

阿里自研的大数据平台,实际上分为两层:底层的计算存储引擎MaxCompute和上层的开发套件Dataworks。计算存储引擎是为了解决EB级的数据计算能力,开发套件则是为了提升数据开发和数据治理的效率。结合集团业务的不断发展,开发套件的功能逐渐丰富,成为数据中台非常重要的生产力工具。经过八年内部实践,2015年在阿里云内部开启了“数加“项目,在2016年初将这个能力通过阿里云公共云对外开放。

从计算和存储能力上来讲,开源的Hadoop生态在过去十年也是飞速发展,可以满足大多数企业对于PB甚至EB级数据计算能力的需求。但在数据开发和数据治理方面,开源生态距离数加这样经过大型互联网企业实践验证的产品还是欠缺的。正是提前看到了这个问题,袋鼠云从创业开始,就把产品定位在了数据中台PaaS方向。从去年的数栈1.0解决了开发套件的核心功能,到今年的数栈2.0全面丰富了数据地图(数据管理)、数据模型、数据质量、数据API、标签工厂等一系列数据治理和数据应用引擎工具,正式打造成了一站式企业级数据中台PaaS。

前几天有个数栈的天使客户,在数栈产品经理只去过两次做现场交流的情况下,基于数栈完成了多个数据项目的开发,从模型分层到表的命名规范,从任务调度到补数据运维,非常流畅的完成了数据全生命周期的管理。客户反馈说之前基于开源的Hadoop需要一天的开发任务,基于数栈只需要30分钟就能完成。所谓生产力工具,为客户提供的价值就在于此。

但是,数栈的目标不仅是提升数据开发的效率。更重要的是希望能够借助阿里多年的大数据经验沉淀,帮助企业客户进一步提升数据治理的能力。从这两年接触的很多客户的实际情况来看,数据治理一直是个老大难的问题。首先,很多企业客户还没有实现全域的数据集中。经过多年的企业IT信息化建设,来自多个供应商的业务系统像烟囱一样林立,相互之间的数据标准不一,难以打通。有些企业甚至都还没有数据仓库,业务数据留存在各个业务数据库中,通过DBLink等方式在不同系统之间实现部分数据共享。有些企业虽然建立了数据仓库,但只是将领导关系的部分KPI指标相关的数据集中到了数据仓库中进行分析处理。数据源的多样性和分散性,给企业的数据治理带来了很高的门槛。

袋鼠云数据中台的理念认为,企业首先应当建立集中统一的数据中台,将全域的数据都同步到统一的数据中台,基于数中台来进行数据治理,事半功倍。数据存储统一,可以在后续的数据治理和数据业务化的过程中实现数据不搬动,降低数据的处理成本;数据计算统一,可以实现基础元数据的自动维护,为数据治理打下最坚实的基础。

在数栈的产品体系中,基于开源Spark和Flink实现的数据计算引擎,可以提供PB级的统一数据计算和存储的能力,当然,数栈也可以兼容企业现有的Hadoop平台,包括Cloudera、星环等。数栈的开发套件提供了统一的ETL任务开发和调度运维的入口,通过这个入口的元数据自动采集和维护,在数据地图模块中为数据管理提供了准确实时的基础数据,在此之上结合企业的现状调研和咨询,可以构建企业级的数据资产类目体系和数据安全体系;同时,通过数据质量模块,可以针对ETL任务实现数据处理的质量管控,提前发现并预警数据质量问题。然后通过数据API和标签工场,为上层丰富的数据应用价值实现提供引擎能力。

从数据同步、到数据开发、到数据管理、到数据质量控制、到数据应用价值实现,数栈在产品层面对于指引都能提供支撑,这是将多年大数据实践经验产品化的结果。数栈,就是为数据治理而生的企业级一站式数据中台PaaS。


(部分内容来源网络,如有侵权请联系删除)
立即免费申请产品试用 免费试用
相关文章推荐
  • 做数据的守护者亿信华辰推新一代数据治理解决方案

    做数据的守护者亿信华辰推新一代数据治理解决方案

    为帮助银行业客户满足监管合规的要求,亿信华辰在2018年推出了最新版的数据治理解决方案,其中包含数据治理组织架构的建设、数据管理专项工作……查看详情

    发布时间:2019.10.24来源:知乎浏览量:123次

  • 主数据管理平台有哪些?

    主数据管理平台有哪些?

    主数据管理平台正是基于平台型建设思路设计的多主题域管理平台,以统一的数据平台为支撑,通过数据模型的扩展,实现对企业的顶层业务模型的支持,……查看详情

    发布时间:2022.05.09来源:小亿浏览量:276次

  • 提高企业数据质量能做些什么?

    提高企业数据质量能做些什么?

    如今,我们生活在数据时代,各种数字化正在实实在在的改变着企业的日常运营,我们的生活、工作、学习,现在都离不开数据,对于企业来说,数据就是……查看详情

    发布时间:2019.11.01来源:知乎浏览量:158次

  • 创新基础:智能数据治理是一项团队运动

    创新基础:智能数据治理是一项团队运动

    对于任何希望创新其战略以提高运营效率,提高质量,优化人口健康管理或推动精准医疗的卫生系统而言,数据治理是必不可少的必备措施之一。……查看详情

    发布时间:2018.11.26来源:数据治理浏览量:165次

  • 持续的业务改进取决于数据治理

    持续的业务改进取决于数据治理

    当我们认为有价值的东西时,我们需要确定我们如何以及何时使用它以及保护它。我们通过建立标准,政策和流程来定义如何利用和保护此资产。……查看详情

    发布时间:2019.01.26来源:亿信华辰浏览量:183次

  • 数据治理与IT治理的区别

    数据治理与IT治理的区别

    最近,我们一直专注于数据治理,从数据中获取最大价值并防止下一次重大漏洞,我们中的许多人忽略了IT治理基础,这有助于我们实现卓越的数据治理……查看详情

    发布时间:2018.11.15来源:Cindy Ng浏览量:228次

  • 数据治理是否灵活?

    数据治理是否灵活?

    许多组织现在认识到数据治理的必要性,但仍在努力寻找正确的方法来构建它。一个好的方法是——敏捷!……查看详情

    发布时间:2019.01.11来源:亿信华辰浏览量:134次

  • 数据治理的全过程

    数据治理的全过程

    数据治理是指从使用零散数据变为使用统一主数据、从具有很少或没有组织和流程治理到企业范围内的综合数据治理、从尝试处理主数据混乱状况到主数据……查看详情

    发布时间:2019.08.07来源:CSDN浏览量:118次

  • 什么是数据治理及其为什么对您的业务至关重要?

    什么是数据治理及其为什么对您的业务至关重要?

    数据治理如何影响他们:由于您没有雇用一组全新的理事会成员,因此DGC数据治理的最大影响将是与数据和数据策略相关的额外工作。如果或出现问题……查看详情

    发布时间:2018.11.26来源:数据治理浏览量:187次

  • 数据治理和数据管理、数据管控是什么关系

    数据治理和数据管理、数据管控是什么关系

    如果要用一个模型来描述数据治理、数据管理、数据管控这三个名词,那应该是一个“金字塔”模型。……查看详情

    发布时间:2021.04.12来源:亿信数据治理研究院浏览量:164次

相关主题
您点击 “提交”,表明您已理解并同意接受本网站隐私政策和用户协议