1. 首页
  2. 课程学习
  3. Java
  4. java网络爬虫,网络检索作业

java网络爬虫,网络检索作业

上传者: 2018-12-09 19:18:22上传 ZIP文件 819.29KB 热度 100次
实现了一下功能: (1) 能够搜集本站内的所有网页,能提取出其中的URL并加入到待搜集的URL队列中,对非本网站域名的URL,只允许搜集首页,记录发现的URL即可;对搜集的结果,产生2个URL列表:站内搜集URL、非站内(站外)发现URL; (2)使用User-agent向服务器表明自己的身份; (3)能对HTML网页进行解析,提取出链接URL,能判别提取的URL是否已处理过,不重复下载和解析已搜集过的网页; (4)能够对crawler的一些基本参数进行设置,包括:搜集深度(depth)、文件类型、文件大小等。 (5)对搜集的过程生成日志文本文件,日志文件的格式定义,请在实验报告中详细说明。 (6)遵循礼貌规则。必须分析robots.txt文件和meta tag有无限制;一个线程抓完一个网页后要适当停顿(sleep);最多允许与被搜集站点同时建立2个连接(本地做网页解析的线程数则不限)。 (7)采用多线程并行编程技术,提高搜集速度。
下载地址
用户评论
码姐姐匿名网友 2018-12-09 19:18:22

不错不错,很棒的资源

码姐姐匿名网友 2018-12-09 19:18:22

可以运行的

码姐姐匿名网友 2018-12-09 19:18:22

可以作为我这样的初学者参考源码的资料

qq_63446478 2025-01-10 21:12:57

优秀,大佬学长,顶!

auntie6982 2025-01-03 00:30:16

不会用啊。。。!!

actually85863 2024-12-27 08:37:06

这个爬虫比较简单 ,可以看一下

Caroline_Yang 2025-01-02 10:16:16

成功运行了,基本功能做得不错,就是界面简单了点

中科天玑大数据 2024-12-30 20:22:24

完全可用阿,不知是哪位学长大神留下的~~~~

weixin_96320118 2024-12-27 18:39:05

我是个初学者,感觉这个挺不错的