- 1、本文档共11页,可阅读全部内容。
- 2、有哪些信誉好的足球投注网站(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
大数据技术架构解析教程
大数据 技术架构解析
作者:匿名出处:论坛2016-01-22 20:46
大数据数量庞大,格式多样化。大量数据由家庭、制造工厂和办公场所的各种设备、互联网事务交易、社交网络的活动、自动化传感器、移动设备以及科研仪器等生成。它的爆炸式增长已超出了传统IT基础架构的处理能力,给企业和社会带来严峻的数据管理问题。因此必须开发新的数据架构,围绕“数据收集、数据管理、数据分析、知识形成、智慧行动”的全过程,开发使用这些数据,释放出更多数据的隐藏价值。
一、大数据建设思路
1)数据的获得
INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/JI3Y81Q91MJN.jpg \* MERGEFORMATINET INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/931X5461256A.jpg \* MERGEFORMATINET
大数据产生的根本原因在于感知式系统的广泛使用。随着技术的发展,人们已经有能力制造极其微小的带有处理功能的传感器,并开始将这些设备广泛的布置于社会的各个角落,通过这些设备来对整个社会的运转进行监控。这些设备会源源不断的产生新数据,这种数据的产生方式是自动的。因此在数据收集方面,要对来自网络包括物联网、社交网络和机构信息系统的数据附上时空标志,去伪存真,尽可能收集异源甚至是异构的数据,必要时还可与历史数据对照,多角度验证数据的全面性和可信性。
2)数据的汇集和存储
INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/ONX7VBOQCW4M.jpg \* MERGEFORMATINET INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/931X5461256A.jpg \* MERGEFORMATINET
数据只有不断流动和充分共享,才有生命力。应在各专用数据库建设的基础上,通过数据集成,实现各级各类信息系统的数据交换和数据共享。 数据存储要达到低成本、低能耗、高可靠性目标,通常要用到冗余配置、分布化和云计算技术,在存储时要按照一定规则对数据进行分类,通过过滤和去重,减少存储量,同时加入便于日后检索的标签。
3)数据的管理
INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/PRJ3J8S0GWZ7.jpg \* MERGEFORMATINET INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/931X5461256A.jpg \* MERGEFORMATINET
大数据管理的技术也层出不穷。在众多技术中,有6种数据管理技术普遍被关注,即分布式存储与计算、内存数据库技术、列式数据库技术、云数据库、非关系型的数据库、移动数据库技术。其中分布式存储与计算受关注度最高。上图是一个图书数据管理系统。
4)数据的分析
INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/2LE358KY2QI5.jpg \* MERGEFORMATINET INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/931X5461256A.jpg \* MERGEFORMATINET
数据分析处理:有些行业的数据涉及上百个参数,其复杂性不仅体现在数据样本本身,更体现在多源异构、多实体和多空间之间的交互动态性,难以用传统的方法描述与度量,处理的复杂度很大,需要将高维图像等多媒体数据降维后度量与处理,利用上下文关联进行语义分析,从大量动态而且可能是模棱两可的数据中综合信息,并导出可理解的内容。大数据的处理类型很多,主要的处理模式可以分为流处理和批处理两种。批处理是先存储后处理,而流处理则是直接处理数据。挖掘的任务主要是关联分析、聚类分析、分类、预测、时序模式和偏差分析等。
5)大数据的价值:决策支持系统
INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/9CL6G5BBUB9W.jpg \* MERGEFORMATINET INCLUDEPICTURE \d /uploadImages/thirdImages/2016/052/931X5461256A.jpg \* MERGEFORMATINET
大数据的神奇之处就是通过对过去和现在的数据进行分析,它
您可能关注的文档
- 大学思修期末考试复习资料教程.doc
- 大学四级英语必背1000个词组(打印版)教程.doc
- 17班高考冲刺137天寒假家长会主题班会课件要点.ppt
- 18她是我的朋友要点.ppt
- 大学数学史题库22教程.doc
- 大学机械设计考试试题及答案教程.doc
- 18班第一次家长会课件要点.ppt
- 18、雷雨a要点.ppt
- 大学毛概期末考试教程.doc
- 大学概率论与数理统计复习资料教程.doc
- 2025年宏观经济、政策与大类资产配置展望:地中生木,中国修复式增长出新芽.pdf
- 定期报告:行情延续,风格不变.pdf
- 2025年A股年度策略:2025,资本市场改革牛.pdf
- 固定收益月度报告:抢跑行情中,12月债市怎么看?.pdf
- 房地产(地产开发)行业百强房企销售跟踪(2024年11月):11月百强房企权益销售额单月同比.pdf
- 机械设备行业跟踪报告.pdf
- 低空经济发展驶入快车道,重点关注产业链的投资机会.pdf
- 房地产行业特朗普1.0时期下的地产复盘与2.0时期展望.pdf
- 并购重组系列专题(二):如何参与本轮并购重组行情的交易.pdf
- 2023年国家公务员录用考试《行测》真题卷(副省级)及答案解析.pdf
文档评论(0)