基于特征码的网页去重算法研究 上传者:ZwRiven 2020-12-18 07:19:57上传 PDF文件 196.22KB 热度 33次 本文探讨了数据挖掘和搜索引擎的理论框架,以去除内容重复的冗余网页为研究目标, 分析了搜索引擎工作原理, 讨论了现有的去重算法。给出了一种基于特征码的网页去重算法, 并采用二叉排序树实现了算法。实验证明算法有着较高的去重准确率、召回率, 达到了对算法的预期。 下载地址 用户评论 更多下载 下载地址 立即下载 用户评论 发表评论