[统计学,数据到结论10.ppt

  1. 1、本文档共59页,可阅读全部内容。
  2. 2、有哪些信誉好的足球投注网站(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
[统计学,数据到结论10

统计学 ─从数据到结论 第十章主成分分析和因子分析 汇报什么? 假定你是一个公司的财务经理,掌握了公司的所有数据,这包括众多的变量,如:固定资产、流动资金、借贷的数额和期限、各种税费、工资支出、原料消耗、产值、利润、折旧、职工人数、分工和教育程度等等。 如果让你向上级或有关方面介绍公司状况,你能够把这些指标和数字都原封不动地摆出去吗? 需要高度概括 在如此多的变量之中,有很多是相关的。人们希望能够找出它们的少数“代表”来对它们进行描述。 需要把这种有很多变量的数据进行高度概括。 10.1 主成分分析 本章介绍两种把变量维数降低以便于描述、理解和分析的方法:主成分分析(principal component analysis)和因子分析(factor analysis)。 实际上主成分分析可以说是因子分析的一个特例。在引进主成分分析之前,先看下面的例子。 成绩数据(student.txt) 100个学生的数学、物理、化学、语文、历史、英语的成绩如下表(部分)。 从本例可能提出的问题 目前的问题是,能否把这个数据的6个变量用一两个综合变量来表示呢? 这一两个综合变量包含有多少原来的信息呢? 能否利用找到的综合变量来对学生排序或据此进行其他分析呢? 空间的点 例中数据点是六维的;即每个观测值是6维空间中的一个点。希望把6维空间用低维空间表示。 先假定只有二维,即只有两个变量,由横坐标和纵坐标所代表; 每个观测值都有相应于这两个坐标轴的两个坐标值; 空间的点 如果这些数据形成一个椭圆形状的点阵(这在二维正态的假定下是可能的)该椭圆有一个长轴和一个短轴。在短轴方向上数据变化很少; 在极端的情况,短轴如退化成一点,长轴的方向可以完全解释这些点的变化,由二维到一维的降维就自然完成了。 椭圆的长短轴 当坐标轴和椭圆的长短轴平行,那么代表长轴的变量就描述了数据的主要变化,而代表短轴的变量就描述了数据的次要变化。 但是,坐标轴通常并不和椭圆的长短轴平行。因此,需要寻找椭圆的长短轴,并进行变换,使得新变量和椭圆的长短轴平行。 椭圆的长短轴 如果长轴变量代表了数据包含的大部分信息,就用该变量代替原先的两个变量(舍去次要的一维),降维就完成了。 椭圆的长短轴相差得越大,降维也越有道理。 主轴和主成分 多维变量的情况和二维类似,也有高维的椭球,只不过不那么直观罢了。 首先把高维椭球的主轴找出来,再用代表大多数数据信息的最长的几个轴作为新变量;这样,主成分分析就基本完成了。 主轴和主成分 正如二维椭圆有两个主轴,三维椭球有三个主轴一样,有几个变量,就有几个主轴。 和二维情况类似,高维椭球的主轴也是互相垂直的。 这些互相正交的新变量是原先变量的线性组合,叫做主成分(principal component)。 主成分之选取 选择越少的主成分,降维就越好。什么是标准呢? 那就是这些被选的主成分所代表的主轴的长度之和占了主轴长度总和的大部分。 有些文献建议,所选的主轴总长度占所有主轴长度之和的大约85%即可,其实,这只是一个大体的说法;具体选几个,要看实际情况而定。 主成分分析的数学 要寻找方差最大的方向。即,使向量X的线性组合a’X的方差最大的方向a. 而Var(a’X)=a’Cov(X)a;由于Cov(X)未知;于是用X的样本相关阵R来近似. 要寻找向量a使得a’Ra最大(注意相关阵和协方差阵差一个常数) 这涉及相关阵和特征值。回顾一下吧! 选择几个主成分呢?要看“贡献率.” 10.2 因子分析 主成分分析从原理上是寻找椭球的所有主轴。原先有几个变量,就有几个主成分。 而因子分析是事先确定要找几个成分,这里叫因子(factor)(比如两个),那就找两个。 这使得在数学模型上,因子分析和主成分分析有不少区别。而且因子分析的计算也复杂得多。根据因子分析模型的特点,它还多一道工序:因子旋转(factor rotation);这个步骤可以使结果更好。 10.2 因子分析 对于计算机,因子分析并不费事。 从输出的结果来看,因子分析也有因子载荷(factor loading)的概念,代表了因子和原先变量的相关系数。但是在因子分析公式中的因子载荷位置和主成分分析不同。 因子分析也给出了二维图;其解释和主成分分析的载荷图类似。 因子分析的数学 因子分析需要许多假定才能够解. 具体公式. 计算因子得分 可以根据输出 10.3因子分析和主成分分析的一些注意事项 ?可以看出,因子分析和主成分分析都依赖于原始变量,也只能反映原始变量的信息。所以原始变量的选择很重要。 另外,如果原始变量都本质上独立,那么降维就可能失败,这是因为很难把很多独立变量用少数综合的变量概括。数据越相关,降维效果就越好。 10.3因子分析和主成分分析的一些注意事项 在得到分析的结果时,并不一定

文档评论(0)

wu12youli + 关注
实名认证
内容提供者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档