应用数理统计
聚类分析与判别分析
(第二次作业)
学院: 姓名: 学号:
2013年12月16日
我国各地区居民消费水平的聚类分析和判
别分析
摘要:本文基于《中国统计年鉴》(2012年版)统计数据,寻找评价各省份人
民消费水平的指标,包括居民消费水平、农村居民消费水平、城镇居民消费水平和居民人均消费四个指标,利用统计软件SPSS综合考虑各指标,对全国各省份进行K-Means 聚类分析,利用Fisher线性判别待判城市类型,进一步验证所建模型的有效性。
关键字:聚类分析,判别分析,SPSS,居民消费水平 1,引言
人均消费水平是指一定时期内(月、年)平均每人占有和享受的物质生活资料和服务的数量。它是一个国家整个经济活动成果的最终体现,也是反映人民物质和文化生活需要的满足程度。一个国家的国民生产总值(GNP)除以该国国民人口的总数所得出的商。即指分摊到每个国民份上的国民生产总值的平均值。在经济学上,一般用来衡量或表示一个国家的经济发展程度。
经过改革开放后三十多年的长足进展,尽管世界格局在走向多极化的过程中不断呈现出错综复杂、风云变幻的局面,但中国领导人高瞻远瞩,始终不渝地坚持以经济建设为中心,坚持走和平发展的道路,使中国步履稳健、坚定不移地走向世界,融入经济全球化的历史进程之中。中国在为经济全球化作出贡献的同时,也从中获取了巨大的增长动力,中国人民的生活水平和消费水平也在不断提高。
2014年全国居民人均可支配收入20167元,比上年增长10.1%,扣除价格因素,实际增长8.0%。按常住地分,城镇居民人均可支配收入28844元,比上年增长9.0%,扣除价格因素,实际增长6.8%;城镇居民人均可支配收入中位数为26635元,增长10.3%。农村居民人均可支配收入10489元,比上年增长11.2%,扣除价格因素,实际增长9.2%;农村居民人均可支配收入中位数为9497元,增长12.7%。全年农村居民人均纯收入为9892元。全国居民人均消费支出14491元,比上年增长9.6%,扣除价格因素,实际增长7.5%。按常住地分,城镇居民人均消费支出19968元,增长8.0%,扣除价格因素,实际增长5.8%;农村居民人均消费支出8383元,增长12.0%,扣除价格因素,实际增长10.0%。
但是,经济和消费水平的增长比例关系却不尽如人意,经济增长大大慢于消费增长,消费需求对经济增长的贡献率不断下降并成为当前经济运行中的重要问题。为实现扩大内需、拉动经济增长的长效目的,我们要在洞察当前居民消费现状的基础上,深入分析居民消费增长缓慢的原因,并探索扩大居民消费需求、拉动经济增长的对策和措施。所以我希望通过对居民消费情况进行分析,得到影响居民消费水平的地域因素和其他影响因子等。
2,相关统计基础理论
2.1,聚类分析
聚类分析指将物理或抽象对象的集合分组成为由类似的对象组成的多个类的分析过程。聚类分析的目标就是在相似的基础上收集数据来分类。从统计学的观点看,聚类分析是通过数据建模简化数据的一种方法。传统的统计聚类分析方法包括系统聚类法、分解法、加入法、动态聚类法、有序样品聚类、有重叠聚类和模糊聚类等。采用k-均值、k-中心点等算法的聚类分析工具已被加入到许多著名的统计分析软件包中,如SPSS、SAS等。
本文使用统计软件SPSS对所收集的数据进行快速聚类,其特点是:在确定类别数量基础上,先给定一个粗糙的初始分类,然后按照某种原则进行反复修改,直至分类较为合理。在选定类中心作为凝聚点的基础上进行分类和修正的方法有很多,本文使用的是K-Means 算法。
K-Means 算法接受输入量 k ;然后将n个数据对象划分为 k个聚类以便使得所获得的聚类满足:同一聚类中的对象相似度较高;而不同聚类中的对象相似度较小。聚类相似度是利用各聚类中对象的均值所获得一个“中心对象”(引力中心)来进行计算的。
K-Means 算法的工作过程说明如下:首先从n个数据对象任意选择 k 个对象作为初始聚类中心;而对于所剩下其它对象,则根据它们与这些聚类中心的相似度(距离),分别将它们分配给与其最相似的(聚类中心所代表的)聚类;然后再计算每个所获新聚类的聚类中心(该聚类中所有对象的均值);不断重复这一过程直到标准测度函数开始收敛为止。一般都采用均方差作为标准测度函数。一般而言,k个聚类具有以下特点:各聚类本身尽可能的紧凑,而各聚类之间尽可能的分开。 2.2,判别分析
判别分析是市场研究的重要分析技术,也是多变量分析技术。它可以就一定数量的个体的一个分类变量和相应的其它多元变量的已知信息,确定分类变量与其它多元变量之间的数量关系,建立判别函数,并利用判别函数构建Biplot二元判别图(概念图)。同时,利用这一数量关系对其他已知多元变量的信息、但未知分组的子类型的个体进行判别分组。判别分析属于监督类分析方法,例如:市场细分研究中,常涉及判别个体所属类型的问题,也常涉及不同品牌在一组产品属性之间的消费者偏好和认知概念,判别分析可以很好地对这种差异进行鉴别。并在低维度空间表现这种差异。
判别分析主要有距离判别、贝叶斯(Bayes)判别、费舍尔(Fisher)判别等几种常用方法。
距离判别的基本原理是:首先对样本到总体G之间的距离进行合理规定,然后依照“就近”原则判定样本的归属,常用马氏距离(Mahalanobis)规定为:
d2(x,G)?(x?u)'??1(x?u)
式中?为p元总体G的协方差阵,x是取自G的样品,则该式即为样品x到总体G的马氏距离。
贝叶斯判别既考虑了先验分布产生的影响,也考虑到误判损失产生的影响,是衡量一个判别优劣的比较合理的准则。
费舍尔判别的基本思想与主成分分析十分相似,当总体是高维向量时,先把其综合成一个一维变量,然后在对一维变量进行距离判别,费舍尔判别实际上是一种降维处理,降维压缩后,样品y到各个总体Gj的距离可以用欧式距离度量,即:
*d(y,G)?||y?uj||??(ai'x?ai'uj)2
2*j*2i?1m由此导出Fisher判别规则为:
d2(y,Gj*)?mind2(y,Gj*),则x?Gl
1?j?k本文及使用Fisher判别建立线性判别函数进行距离判别。
3,模型建立
3.1 设置变量
本文综合考虑了衡量人民消费水平因素,选取各地区居民消费水平,消费水平包括城镇居民消费水平和农村居民消费水平,综合考虑了居民人均消费作为类别分析的主要经济指标:
X1:居民消费水平(元) X2:城镇居民消费水平(元) X3:农村居民消费水平(元) X4:居民人均消费(元)
从区域发展角度从上面5个经济指标将城市经济发展水平划分为三大类:
G1:高消费地区 G2:中等消费地区 G3:低消费地区 3.2 数据收集和整理
本文所有数据来源于《中国统计年鉴(2014)》,选取2014年度31个省份主要居民消费水平做模型建立及分析。其中前31个省份相关消费指标水平作为初始样本用于划分类别,建立类别总体G;再利用判别函数进行判别分析。所有相关数据经过量纲统一规则化处理见表1所示。
表1:各省份居民消费水平
省份 北京市 天津市 河北省 山西省 内蒙古自治区 辽宁省 吉林省 黑龙江省 上海市 江苏省 浙江省 安徽省 福建省 江西省 山东省 河南省 湖北省 居民消费水平 33337 26261 11557 12078 17168 20156 13676 12978 39223 23585 24771 11618 17115 11910 16728 11782 13912 农村居民消费 17663 14954 6460 7476 8218 10417 7773 7478 20221 14571 15458 6114 10147 7429 9224 6438 7755 城镇居民消费 35836 28779 17198 16341 23590 25161 18714 17102 41464 28753 30101 17779 21725 16728 23358 18833 19156 居民人均消费 31102.89 22342.98 11931.54 10863.83 16258.12 16067.98 13025.97 12768.76 33064.76 19163.56 22551.97 11726.99 17644.47 11088.89 13328.9 11000.44 12928.31