1. 首页
  2. 编程语言
  3. Python
  4. python TF-IDF算法实现文本关键词提取

python TF-IDF算法实现文本关键词提取

上传者: 2022-03-07 07:25:47上传 PDF文件 68.76 KB 热度 15次

TF词频,在文章中出现次数最多的词,然而文章中出现次数较多的词并不一定就是关键词,比如常见的对文章本身并没有多大意义的停用词。该权重为IDF逆文档频率,它的大小与一个词的常见程度成反比。在我们得到词频和逆文档频率以后,将两个值相乘,即可得到一个词的TF-IDF值,某个词对文章的重要性越高,其TF-IDF值就越大,所以排在最前面的几个词就是文章的关键词。逆文档频率 = logTF-IDF = 词频* 逆文档频率详细代码如下:

用户评论