1. 首页
  2. 信息化
  3. 项目管理
  4. 基于特征码的网页去重算法研究

基于特征码的网页去重算法研究

上传者: 2020-12-18 07:19:57上传 PDF文件 196.22KB 热度 14次
本文探讨了数据挖掘和搜索引擎的理论框架,以去除内容重复的冗余网页为研究目标, 分析了搜索引擎工作原理, 讨论了现有的去重算法。给出了一种基于特征码的网页去重算法, 并采用二叉排序树实现了算法。实验证明算法有着较高的去重准确率、召回率, 达到了对算法的预期。
下载地址
用户评论