数栈:为数据治理而生

发布时间:2019.01.04来源:NinGoo浏览量:228次标签:数据治理


2018年5月21日,中国银保监会印发《银行业金融机构数据治理指引的通知》(银保监发〔2018〕22号),新规从征求意见到正式稿落地仅仅2个月时间,后续监管政策补短板会加快。金融行业对于数据治理的迫切需求,在指引中,明确提出了数据治理架构、数据管理、数据质量控制、数据价值实现等问题,是大数据发展到一定程度的必然结果。

从业务数据化到数据业务化,大数据已经越来越多的成为企业的资产,但在发展过程中,数据来源繁多、数据口径不一、数据质量缺乏管控、数据安全存在隐患,这些都是阻碍企业实现数字化转型和数据驱动的问题,如何有效和高效的解决这些问题,既体现了企业数字化转型的决心,也体现了企业数据驱动的能力。

互联网的发展过程,实际上就是不断业务数据化的过程,通过将人的衣食住行等行为都在线化,从电商、到外卖、到租房、到共享出行,每一个快速成长的互联网业务,都是将各种业务场景在线化的过程。在线化是实现数据化的前提,数据化是在线化的必然结果。这也是为什么云计算和大数据等基础技术的突破必然会在互联网企业出现并壮大的原因。

2009年,阿里巴巴就设立了CDO岗位,担任第一任CDO的,正是后来成为阿里巴巴第二任CEO的陆兆禧。这比银保监会在这次指引中“提出可结合实际情况设立首席数据官”的数据治理架构提前了近十年。当然,阿里当初设立CDO并不仅仅为了数据治理,更是为了数据价值实现,也就是数据业务化。2009年阿里在数据领域发生了三件大事,设立CDO只是其一,另外两件分别是自研大数据计算平台和以数据为资产的阿里小贷业务创新。

阿里自研的大数据平台,实际上分为两层:底层的计算存储引擎MaxCompute和上层的开发套件Dataworks。计算存储引擎是为了解决EB级的数据计算能力,开发套件则是为了提升数据开发和数据治理的效率。结合集团业务的不断发展,开发套件的功能逐渐丰富,成为数据中台非常重要的生产力工具。经过八年内部实践,2015年在阿里云内部开启了“数加“项目,在2016年初将这个能力通过阿里云公共云对外开放。

从计算和存储能力上来讲,开源的Hadoop生态在过去十年也是飞速发展,可以满足大多数企业对于PB甚至EB级数据计算能力的需求。但在数据开发和数据治理方面,开源生态距离数加这样经过大型互联网企业实践验证的产品还是欠缺的。正是提前看到了这个问题,袋鼠云从创业开始,就把产品定位在了数据中台PaaS方向。从去年的数栈1.0解决了开发套件的核心功能,到今年的数栈2.0全面丰富了数据地图(数据管理)、数据模型、数据质量、数据API、标签工厂等一系列数据治理和数据应用引擎工具,正式打造成了一站式企业级数据中台PaaS。

前几天有个数栈的天使客户,在数栈产品经理只去过两次做现场交流的情况下,基于数栈完成了多个数据项目的开发,从模型分层到表的命名规范,从任务调度到补数据运维,非常流畅的完成了数据全生命周期的管理。客户反馈说之前基于开源的Hadoop需要一天的开发任务,基于数栈只需要30分钟就能完成。所谓生产力工具,为客户提供的价值就在于此。

但是,数栈的目标不仅是提升数据开发的效率。更重要的是希望能够借助阿里多年的大数据经验沉淀,帮助企业客户进一步提升数据治理的能力。从这两年接触的很多客户的实际情况来看,数据治理一直是个老大难的问题。首先,很多企业客户还没有实现全域的数据集中。经过多年的企业IT信息化建设,来自多个供应商的业务系统像烟囱一样林立,相互之间的数据标准不一,难以打通。有些企业甚至都还没有数据仓库,业务数据留存在各个业务数据库中,通过DBLink等方式在不同系统之间实现部分数据共享。有些企业虽然建立了数据仓库,但只是将领导关系的部分KPI指标相关的数据集中到了数据仓库中进行分析处理。数据源的多样性和分散性,给企业的数据治理带来了很高的门槛。

袋鼠云数据中台的理念认为,企业首先应当建立集中统一的数据中台,将全域的数据都同步到统一的数据中台,基于数中台来进行数据治理,事半功倍。数据存储统一,可以在后续的数据治理和数据业务化的过程中实现数据不搬动,降低数据的处理成本;数据计算统一,可以实现基础元数据的自动维护,为数据治理打下最坚实的基础。

在数栈的产品体系中,基于开源Spark和Flink实现的数据计算引擎,可以提供PB级的统一数据计算和存储的能力,当然,数栈也可以兼容企业现有的Hadoop平台,包括Cloudera、星环等。数栈的开发套件提供了统一的ETL任务开发和调度运维的入口,通过这个入口的元数据自动采集和维护,在数据地图模块中为数据管理提供了准确实时的基础数据,在此之上结合企业的现状调研和咨询,可以构建企业级的数据资产类目体系和数据安全体系;同时,通过数据质量模块,可以针对ETL任务实现数据处理的质量管控,提前发现并预警数据质量问题。然后通过数据API和标签工场,为上层丰富的数据应用价值实现提供引擎能力。

从数据同步、到数据开发、到数据管理、到数据质量控制、到数据应用价值实现,数栈在产品层面对于指引都能提供支撑,这是将多年大数据实践经验产品化的结果。数栈,就是为数据治理而生的企业级一站式数据中台PaaS。


(部分内容来源网络,如有侵权请联系删除)
立即免费申请产品试用 免费试用
相关文章推荐
  • 做好数据标准管理对企业来说有什么意义?

    做好数据标准管理对企业来说有什么意义?

    数据标准是数据全生命周期质量控制的机制与制度保障,贯穿数据从采集到存储、治理和分析应用的全过程,只有建立一套完备的标准体系,数据标准化之……查看详情

    发布时间:2020.05.08来源:知乎浏览量:140次

  • 数据治理 VS 数据管理!

    数据治理 VS 数据管理!

    与早期的数字化原生企业相比,不进行数据管理或治理的企业将面临着严重的后果 。至于说到良好的数据管理和应用的实践,大多数人只会将这个词与那……查看详情

    发布时间:2022.06.15来源:互联网浏览量:279次

  • 新模型:组合投资组合管理和数据治理建议

    新模型:组合投资组合管理和数据治理建议

    通常,组织决定不让投资组合管理网守优先/授权所有来自治理主导的问题分析的建议。因此,创建了一个新模型,第三个存储桶。……查看详情

    发布时间:2019.03.29来源:亿信华辰浏览量:136次

  • 基于大数据架构的医院数据中心管理

    基于大数据架构的医院数据中心管理

    医疗数据较为复杂,以医院来说建设的业务系统接近百来个,例如HIS系统、急诊系统、护理系统、电子病历系统、检验系统、检查系统、输血系统、生……查看详情

    发布时间:2019.02.14来源:亿信华辰浏览量:158次

  • 中小银行行数据治理是否错过最佳建设期?

    中小银行行数据治理是否错过最佳建设期?

    数据治理基础建设缺失、人才匮乏、意识觉醒较晚。目前中小银行数据治理难点有哪些?中小银行行数据治理是否错过最佳建设期。……查看详情

    发布时间:2019.11.28来源:知乎浏览量:139次

  • 社交网络大数据的应用有多大的价值

    社交网络大数据的应用有多大的价值

    随着互联网技术高速的发展,网民的数量呈指数上升,社交网络进入了强调用户参与和体验的时代。……查看详情

    发布时间:2019.03.13来源:亿信华辰浏览量:126次

  • 什么是数据孤岛?为什么要消除数据孤岛?

    什么是数据孤岛?为什么要消除数据孤岛?

    数据孤岛通常具有负面含义。它描述了孤立的数据岛,数据孤岛通常存在以下问题:1.由于代码较旧或不兼容而无法以编程方式与其他系统一起工作2.……查看详情

    发布时间:2021.05.28来源:亿信数据治理知识库浏览量:544次

  • 数据治理到底是什么?

    数据治理到底是什么?

    幸运的是,培训可以为精通数据的员工提供这些技能。通过正确的沟通工作,您的数据治理团队可以开展治理业务,确信他们能够为您的各种数据利益相关……查看详情

    发布时间:2019.03.19来源:亿信华辰浏览量:229次

  • “数据治理”:重构和愿景

    “数据治理”:重构和愿景

    对于数据业者而言,数据治理(datagovernance)并不陌生。根据国际标准化组织IT服务管理与IT治理分技术委员会、国际数据治理研……查看详情

    发布时间:2020.06.19来源:CSDN浏览量:173次

  • 数据质量问题分析

    数据质量问题分析

    数据质量问题主要包含四个问题域:技术问题、信息问题、流程问题、管理问题。1、技术问题由于具体数据处理的各技术环节异常所造成的数据质量问题……查看详情

    发布时间:2019.01.07来源:亿信华辰浏览量:196次

相关主题
您点击 “提交”,表明您已理解并同意接受本网站隐私政策和用户协议