论文研究一种基于模板的快速网页文本自动抽取算法.pdf 上传者:Xieminsen 2020-04-14 04:53:36上传 PDF文件 704.21KB 热度 49次 针对网页噪声和网页非结构化信息抽取模板生成复杂度高的问题,提出了一种快速获取非结构信息抽取模板的算法。该算法先对网页噪声进行预处理,将其DOM树结构进行标签hash映射,通过自动训练的阈值快速判定网页的主要部分,根据数据块中的嵌套结构获取网页文本抽取模板。对不同类型网站的实验表明,该方法快速且具有较高的准确度。 下载地址 用户评论 更多下载 下载地址 立即下载 用户评论 发表评论