面向社交媒体的高质量文章内容识别模型
如何从海量多媒体文章中自动识别高质量内容是信息推荐、搜索引擎等系统的核心功能之一。现有的方法在训练中依赖大量的人工标注数据。针对其未考虑社交媒体中的社交信息和视觉内容的问题,提出一种基于正无标记( posiTIve and unlabeled,PU学习的图卷积高质量文章内容识别模型——基于PU学习的图卷积网络( graph convoluTIonal network based on posiTIve and unlabeled learnin,GCN-PU,在统一的框架中使用一个异构网络同时建模社交媒体文章的文本和社交信息,并在该网络上使用图卷积网络来融合这些信息得到高阶特征。另外,使用多媒体文章的全局视觉布局信息来捕捉文章的综合视觉质量特征,用于补充图卷积网络输出的高阶特征。最后,在训练机制和损失函数中引入了PU学习来充分利用社交媒体中大量未标注的文章信息。在真实社交媒体数据集上的实验结果表明相比于现有的方法,GCN-PU方法的F值提升了3%以上。
用户评论