SQL数据挖掘知识讲解.pdfVIP

  1. 1、本文档共10页,可阅读全部内容。
  2. 2、有哪些信誉好的足球投注网站(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
  5. 5、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
  6. 6、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们
  7. 7、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
  8. 8、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多

SQL数据挖掘知识讲解--第1页

数据挖掘知识要点

一.名词解释(4’*5=20’)

1.数据仓库:是一种新的数据处理体系结构,是面向主题的、集成的、不可更新的(稳

定性)、随时间不断变化(不同时间)的数据集合,为企业决策支持系统提供所需的集

成信息。

2.孤立点:指数据库中包含的一些与数据的一般行为或模型不一致的异常数据。

3.OLAP:OLAP是在OLTP的基础上发展起来的,以数据仓库为基础的数据分析处理,

是共享多维信息的快速分析,是被专门设计用于支持复杂的分析操作,侧重对分析人

员和高层管理人员的决策支持。

4.粒度:指数据仓库的数据单位中保存数据细化或综合程度的级别。粒度影响存放在

数据仓库中的数据量的大小,同时影响数据仓库所能回答查询问题的细节程度。

5.数据规范化:指将数据按比例缩放(如更换大单位),使之落入一个特定的区域(如

0-1)以提高数据挖掘效率的方法。规范化的常用方法有:最大-最小规范化、零-

均值规范化、小数定标规范化。

6.关联知识:是反映一个事件和其他事件之间依赖或相互关联的知识。如果两项或多

项属性之间存在关联,那么其中一项的属性值就可以依据其他属性值进行预测。

7.数据挖掘:从大量的、不完全的、有噪声的、模糊的、随机的数据中,提取隐含在

其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。

8.OLTP:OLTP为联机事务处理的缩写,OLAP是联机分析处理的缩写。前者是以数据

库为基础的,面对的是操作人员和低层管理人员,对基本数据进行查询和增、删、改

等处理。

9.ROLAP:是基于关系数据库存储方式的,在这种结构中,多维数据被映像成二维关

系表,通常采用星型或雪花型架构,由一个事实表和多个维度表构成。

10.MOLAP:是基于类似于“超立方”块的OLAP存储结构,由许多经压缩的、类似于

多维数组的对象构成,并带有高度压缩的索引及指针结构,通过直接偏移计算进行存

取。

11.数据归约:缩小数据的取值范围,使其更适合于数据挖掘算法的需要,并且能够

得到和原始数据相同的分析结果。

12.遗传算法:是一种优化有哪些信誉好的足球投注网站算法,它首先产生一个初始可行解群体,然后对这个

群体通过模拟生物进化的选择、交叉、变异等遗传操作遗传到下一代群体,并最终达

到全局最优。

13.聚类:是将物理或抽象对象的集合分组成为多个类或簇(cluster)的过程,使得在

同一个簇中的对象之间具有较高的相似度,而不同簇中的对象差别较大。

14.决策树:是用样本的属性作为结点,用属性的取值作为分支的树结构。它是分类

规则挖掘的典型方法,可用于对新样本进行分类。

15.频繁项集:指满足最小支持度的项集,是挖掘关联规则的基本条件之一。

16.支持度:规则A→B的支持度指的是所有事件中A与B同地发生的的概率,即P(A

∪B),是AB同时发生的次数与事件总次数之比。支持度是对关联规则重要性的衡量。

17.可信度:规则A→B的可信度指的是包含A项集的同时也包含B项集的条件概率

SQL数据挖掘知识讲解--第1页

SQL数据挖掘知识讲解--第2页

P(B|A),是AB同时发生的次数与A发生的所有次数之比。可信度是对关联规则的准

确度的衡量。

18.关联规则:同时满足最小支持度阈值和最小可信度阈值的规则称之为关联规则。

二.填空题(1’*20=20’)

1、数据仓库就是一个面向主题的、集成的、相对稳定的、反映历史变化的数据集合。

2、元数据是描述数据仓库内数据的结构和建立方法的数据,它为访问数据仓库提供

了一个信息目录,根据数据用途的不同可将数据仓库的元数据分为技术元数据和业务

元数据两类。

文档评论(0)

150****7954 + 关注
实名认证
文档贡献者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档