1. 首页
  2. 编程语言
  3. 其他
  4. 论文研究一种基于模板的快速网页文本自动抽取算法.pdf

论文研究一种基于模板的快速网页文本自动抽取算法.pdf

上传者: 2020-04-14 04:53:36上传 PDF文件 704.21KB 热度 22次
针对网页噪声和网页非结构化信息抽取模板生成复杂度高的问题,提出了一种快速获取非结构信息抽取模板的算法。该算法先对网页噪声进行预处理,将其DOM树结构进行标签hash映射,通过自动训练的阈值快速判定网页的主要部分,根据数据块中的嵌套结构获取网页文本抽取模板。对不同类型网站的实验表明,该方法快速且具有较高的准确度。
用户评论