为什么数据标准这么重要,三个小招教你实现

发布时间:2020.07.17来源:CSDN浏览量:88次标签:数据治理

评价是现代社会各领域的一项经常性的工作,是科学做出管理决策的重要依据。随着人们研究领域的不断扩大,所面临的评价对象日趋复杂,如果仅依据单一指标对事物进行评价往往不尽合理,必须全面地从整体的角度考虑问题,多指标综合评价方法应运而生。所谓多指标综合评价方法,就是把描述评价对象不同方面的多个指标的信息综合起来,并得到一个综合指标,由此对评价对象做一个整体上的评判,并进行横向或纵向比较。

而在多指标评价体系中,由于各评价指标的性质不同,通常具有不同的量纲和数量级。当各指标间的水平相差很大时,如果直接用原始指标值进行分析,就会突出数值较高的指标在综合分析中的作用,相对削弱数值水平较低指标的作用。因此,为了保证结果的可靠性,需要对原始指标数据进行标准化处理。

目前数据标准化方法有多种,归结起来可以分为直线型方法(如极值法、标准差法)、折线型方法(如三折线法)、曲线型方法(如半正态性分布)。不同的标准化方法,对系统的评价结果会产生不同的影响,然而不幸的是,在数据标准化方法的选择上,还没有通用的法则可以遵循

常见的方法有:min-max标准化(Min-max normalization),log函数转换,atan函数转换,z-score标准化(zero-mena normalization,此方法最为常用),模糊量化法。本文只介绍min-max法(规范化方法),z-score法(正规化方法),比例法(名字叫啥不太清楚,归一化方法)。

 

数据的标准化(normalization)是将数据按比例缩放,使之落入一个小的特定区间。在某些比较和评价的指标处理中经常会用到,去除数据的单位限制,将其转化为无量纲的纯数值,便于不同单位或量级的指标能够进行比较和加权。其中最典型的就是数据的归一化处理,即将数据统一映射到[0,1]区间上,常见的数据归一化的方法有:min-max标准化(Min-maxnormalization)也叫离差标准化,是对原始数据的线性变换,使结果落到[0,1]区间,转换函数如下:其中max为样本数据的最大值,min为样本数据的最小值。这种方法有一个缺陷就是当有新数据加入时,可能导致max和min的变化,需要重新定义。log函数转换通过以10为底的log函数转换的方法同样可以实现归一下,具体方法如下:看了下网上很多介绍都是x*=log10(x),其实是有问题的,这个结果并非一定落到[0,1]区间上,应该还要除以log10(max),max为样本数据最大值,并且所有的数据都要大于等于1。atan函数转换用反正切函数也可以实现数据的归一化:使用这个方法需要注意的是如果想映射的区间为[0,1],则数据都应该大于等于0,小于0的数据将被映射到[-1,0]区间上。而并非所有数据标准化的结果都映射到[0,1]区间上,其中最常见的标准化方法就是Z标准化,也是SPSS中最为常用的标准化方法:z-score 标准化(zero-meannormalization)也叫标准差标准化,经过处理的数据符合标准正态分布,即均值为0,标准差为1,其转化函数为:其中μ为所有样本数据的均值,σ为所有样本数据的标准差。

 


1 什么是数据标准化(Normalization

将数据按比例缩放,使之落入一个小的特定区间。在某些比较评价的指标处理中经常会用到,去除数据的单位限制,将其转化为无量纲的纯数值便于不同单位或量级的指标能够进行比较和加权

2 有哪些常用方法呢?

方法一:规范化方法

pic1

  •  也叫离差标准化,是对原始数据的线性变换,使结果映射到[0,1]区间。

方法二:正规化方法pic2

  • 这种方法基于原始数据的均值(mean)和标准差(standard deviation)进行数据的标准化。将A的原始值x使用z-score标准化到x’。
  • z-score标准化方法适用于属性A的最大值和最小值未知的情况,或有超出取值范围的离群数据的情况。
  • spss默认的标准化方法就是z-score标准化。
  • 用Excel进行z-score标准化的方法:在Excel中没有现成的函数,需要自己分步计算,其实标准化的公式很简单。

步骤如下:
1.求出各变量(指标)的算术平均值(数学期望)xi和标准差si ;
2.进行标准化处理:
zij=(xij-xi)/si
其中:zij为标准化后的变量值;xij为实际变量值。
3.将逆指标前的正负号对调。
标准化后的变量值围绕0上下波动,大于0说明高于平均水平,小于0说明低于平均水平。


方法三:归一化方法

pic3


(部分内容来源网络,如有侵权请联系删除)
立即免费申请产品试用 免费试用
相关文章推荐
  • 数据共享,奇葩证明的解药——亿信华辰

    数据共享,奇葩证明的解药——亿信华辰

    出境旅游,要求出具“母子关系证明”;市民迁户口,要证明“你爸是你爸”;车在大风中被树木刮伤,理赔要出示“风力证明”;去买房,要证明“结婚……查看详情

    发布时间:2019.03.04来源:亿信华辰浏览量:129次

  • 98%的企业备战数据治理,尚未入局的你还在等什么

    98%的企业备战数据治理,尚未入局的你还在等什么

    UBM近日发布了一份2018企业数据治理白皮书。白皮书中分析了数据治理的现状:虽然越来越多的企业(尤其是业务部门及IT部门)逐渐开始关注……查看详情

    发布时间:2018.12.10来源:亿信华辰浏览量:138次

  • 数据治理的定义:什么是数据治理?

    数据治理的定义:什么是数据治理?

    数据治理(DG)是增长最快的学科之一,但在定义数据治理方面,许多组织都在努力。 Dataversity称DG是“有助于确保组织内数据资……查看详情

    发布时间:2018.11.15来源:Zak Cole浏览量:154次

  • 大数据治理 [Big Data Governance an Emerging Imperative]

    大数据治理 [Big Data Governance an Emerging Imperative]

    《大数据治理》是一个信息治理专家奉献的鸿篇巨制,作者以极其实用和通俗易懂的风格,倾心向读者解读大数据治理这一复杂主题。作为一家大公司的资……查看详情

    发布时间:2018.11.29来源:数据治理浏览量:135次

  • 读懂工业大数据 这篇文章不得不看

    读懂工业大数据 这篇文章不得不看

    工业大数据是互联网、大数据和工业产业结合的产物,是中国制造2025、工业互联网、工业4.0等国家战略在企业的落脚点。……查看详情

    发布时间:2019.03.27来源:亿信华辰浏览量:111次

  • 数据交换平台的功能结构设计与实现

    数据交换平台的功能结构设计与实现

    数据交换平台是数据中心与其它应用系统沟通的桥梁,是进行数据交换的枢纽站。数据交换平台负责从各个业务系统采集数据,对数据进行清洗与整合,按……查看详情

    发布时间:2020.08.06来源:知乎浏览量:232次

  • 什么是元数据管理框架?元数据管理框架如何制定?

    什么是元数据管理框架?元数据管理框架如何制定?

    元数据管理框架描述了一种使数据和元数据资产更易于访问和用于实现业务目标的组织方法。它根据组织的需求,动员并扩展了作为元数据管理基础的现有……查看详情

    发布时间:2021.07.16来源:亿信数据治理知识库浏览量:144次

  • 金融数据治理的特征与趋势

    金融数据治理的特征与趋势

    大数据时代下金融数据治理的特征(一)金融数据治理目标双核化进入“大数据时代”,不仅更多的金融业态被催生出来,数据……查看详情

    发布时间:2019.01.04来源:亿信华辰浏览量:135次

  • 企业数据治理的实际步骤

    企业数据治理的实际步骤

    数据治理是一项业务活动。到目前为止,已经有多项努力从IT内部开始。但是,数据属于业务,而不属于IT。IT可以提供建议,帮助管理存储库,提……查看详情

    发布时间:2018.11.20来源:数据治理浏览量:123次

  • 为正在进行的数据治理提供资金

    为正在进行的数据治理提供资金

    我们不会在这里更详细地讨论这些选项; 它们遵循与为数据治理计划的设计提供资金时所讨论的相同的一般模式。但是,值得注意的是,使数据治理依赖……查看详情

    发布时间:2019.03.18来源:亿信华辰浏览量:126次

相关主题
您点击 “提交”,表明您已理解并同意接受本网站隐私政策和用户协议