1. 首页
  2. 数据库
  3. 其它
  4. 【爬虫+文本分类】–新浪各类新闻标题并用各类算法进行文本分类

【爬虫+文本分类】–新浪各类新闻标题并用各类算法进行文本分类

上传者: 2021-01-10 11:21:48上传 PDF文件 747.02KB 热度 21次
自己设计的小项目,初始想法很简单,检验自己爬虫和nlp基本技能(分词、词向量(tokenize\onehot\tfidf\word2vec))和各类算法(朴素贝叶斯、svm、CNN、LSTM)掌握情况,进一步查漏补缺,提升工程能力和算法应用能力:) ** 第一部分:爬虫 ** 分析新浪网各类新闻网页结构,应用requests库,爬取并解析新浪各类新闻,包括汽车、教育、金融、娱乐、体育、科技共六类, 对于有“滚动”新闻链接的板块(如sport、tech、entertaimment),通过滚动新闻爬取数据:此类数据多为动态链接,需要异步加载,即自行分析json格式获取其中新闻url 对于没有“滚
用户评论