论文研究 中文短文本去重方法研究.pdf 上传者:sjzbxyz 2020-07-18 13:14:52上传 PDF文件 619.29KB 热度 42次 针对中文短文本冗余问题,提出了有效的去重算法框架。考虑到短文本海量性和简短性的特点,以及中文与英文之间的区别,引入了Bloom Filter、Trie树以及SimHash算法。算法框架的第一阶段由Bloom Filter或Trie树进行完全去重,第二阶段由SimHash算法进行相似去重。设计了该算法框架的各项参数,并通过仿真实验证实了该算法框架的可行性及合理性。 下载地址 用户评论 更多下载 下载地址 立即下载 用户评论 发表评论