- 1、本文档共17页,可阅读全部内容。
- 2、有哪些信誉好的足球投注网站(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
HYPERLINK /sso/bmregistration?lang=zh_CNca=dwchina-_-bluemix-_-os-cn-crawler-_-sidebar开始您的试用
使用 HttpClient 和 HtmlParser 实现简易爬虫
这篇文章介绍了 HtmlParser 开源包和 HttpClient 开源包的使用,在此基础上实现了一个简易的网络爬虫 (Crawler),来说明如何使用 HtmlParser 根据需要处理 Internet 上的网页,以及如何使用 HttpClient 来简化 Get 和 Post 请求操作,构建强大的网络应用程序。
HYPERLINK /developerworks/cn/opensource/os-cn-crawler/ \l ibm-pcon 回页首
HttpClient 与 HtmlParser 简介
本小结简单的介绍一下 HttpClinet 和 HtmlParser 两个开源的项目,以及他们的网站和提供下载的地址。
HttpClient 简介
HTTP 协议是现在的因特网最重要的协议之一。除了 WEB 浏览器之外, WEB 服务,基于网络的应用程序以及日益增长的网络计算不断扩展着 HTTP 协议的角色,使得越来越多的应用???序需要 HTTP 协议的支持。虽然 JAVA 类库 .net 包提供了基本功能,来使用 HTTP 协议访问网络资源,但是其灵活性和功能远不能满足很多应用程序的需要。而 Jakarta Commons HttpClient 组件寻求提供更为灵活,更加高效的 HTTP 协议支持,简化基于 HTTP 协议的应用程序的创建。 HttpClient 提供了很多的特性,支持必威体育精装版的 HTTP 标准,可以访问HYPERLINK /httpclient-3.x/这里了解更多关于 HttpClinet 的详细信息。目前有很多的开源项目都用到了 HttpClient 提供的 HTTP功能,登陆HYPERLINK /jakarta-httpclient/HttpClientPowered网址可以查看这些项目。本文中使用 HttpClinet 提供的类库来访问和下载 Internet上面的网页,在后续部分会详细介绍到其提供的两种请求网络资源的方法: Get 请求和 Post 请求。Apatche 提供免费的 HTTPClien t源码和 JAR 包下载,可以登陆HYPERLINK /downloads.cgi这里?下载必威体育精装版的HttpClient 组件。笔者使用的是 HttpClient3.1。
HtmlParser 简介
当今的 Internet 上面有数亿记的网页,越来越多应用程序将这些网页作为分析和处理的数据对象。这些网页多为半结构化的文本,有着大量的标签和嵌套的结构。当我们自己开发一些处理网页的应用程序时,会想到要开发一个单独的网页解析器,这一部分的工作必定需要付出相当的精力和时间。事实上,做为 JAVA 应用程序开发者, HtmlParser 为其提供了强大而灵活易用的开源类库,大大节省了写一个网页解析器的开销。 HtmlParser 是? HYPERLINK / ?上活跃的一个开源项目,它提供了线性和嵌套两种方式来解析网页,主要用于 html 网页的转换(Transformation) 以及网页内容的抽取 (Extraction)。HtmlParser 有如下一些易于使用的特性:过滤器 (Filters),访问者模式 (Visitors),处理自定义标签以及易于使用的 JavaBeans。正如 HtmlParser 首页所说:它是一个快速,健壮以及严格测试过的组件;以它设计的简洁,程序运行的速度以及处理 Internet 上真实网页的能力吸引着越来越多的开发者。 本文中就是利用HtmlParser 里提取网页里的链接,实现简易爬虫里的关键部分。HtmlParser 必威体育精装版的版本是HtmlParser1.6,可以登陆HYPERLINK /project/showfiles.php?group_id=24399这里下载其源码、 API 参考文档以及 JAR 包。
HYPERLINK /developerworks/cn/opensource/os-cn-crawler/ \l ibm-pcon 回页首
开发环境的搭建
笔者所使用的开发环境是 Eclipse Europa,此开发工具可以在? HYPERLINK / ?免费的下载;JDK是1.6,你也可以在? HYPERLINK / ?站点下载,并且在操作系统中配置好环境变量。在 Eclipse 中创建一个 JAVA 工程,在工程的 Build Path
您可能关注的文档
最近下载
- 人教版(新插图)一年级下册数学全册教学课件.pptx
- 《小学数学教学法》课程教学大纲.docx
- 2024多元储能构网技术在新型电力系统中的应用报告.pdf VIP
- 江苏省某中学建设项目可行性研究报告.doc VIP
- (完整版)肾脏疾病知识讲座PPT课件.ppt
- 浙江省温州市教研院附属教育集团校2023-2024学年九年级下学期百基作业反馈数学试题(开学考试)(原卷版).docx VIP
- 骨科中医护理健康教育.pptx
- 浙江省年温州市第十二中学2024—2025学年上学期九年级数学第二次月考(第一二单元)(含答案).pdf VIP
- Dell戴尔Latitude 5285 二合一笔记本 现场服务手册.pdf
- 云南省2024年度医师定期考核临床练习题库附答案解析临床练习 .pdf VIP
文档评论(0)