【R语言爬虫实战】抓取省市级城市常务会议内容

🍉CSDN小墨&晓末:https://blog.csdn.net/jd1813346972

个人介绍: 研一｜统计学｜干货分享
擅长Python、Matlab、R等主流编程软件
累计十余项国家级比赛奖项，参与研究经费10w、40w级横向

文章目录

1 设置内容存储位置及加载包
2 首页网页文本内容爬取
3 循环抓取后续网页
4 数据存储

实现基于R语言的省级常务会议内容的网页爬虫，包括htlm页面解析，由于首页与其它页网页url格式不同的循环读取方式，以及数据存储功能，代码块内附完整编码解析。

实现效果：

在这里插入图片描述

1 设置内容存储位置及加载包

setwd("F:\\地级城市政策")#设置文件保存路径library(rvest)
library(stringr)
library(rlist)

2 首页网页文本内容爬取

#读取第一页文件内容
url1 <-("http://www.lijiang.gov.cn/html/zhengwugongkai/zhengfuxinxigongkai/fadingzhudonggongkaineirong/zhengfuhuiyi/changwuhuiyi/index.html")
httr_web <-read_html(url1,encoding ='utf-8')  #抓取网页#具体时间
time<-httr_web%>%html_nodes('ul.wjer_list li span')%>%html_text(trim = T)#抓取具体时间
######
timel<-data.frame()
for (i in 1:length(time)){if(i/2==2){timel[i]<-time[i]}
}
time<-strsplit(time,split = "-") # strsplit函数将数据拆分成列表(年月日)time<-strsplit(time,split = "：") # strsplit函数将数据拆分成列表(年月日)
for(i in 1:length(time)) #定义语句循环次数，直至所有链接提取完成
{time[i]<-time[[i]][2] #提取列表中位置2的信息，填充websites1
}for(i in 1:length(time)) #定义语句循环次数，直至所有链接提取完成
{time[i]<-strsplit(time[[i]],split = "-") #提取列表中位置2的信息，填充websites1
}###########
time<-do.call(rbind,time)[,1:2]# 将列表转换为矩阵，提取第第一列和第二列（年、月）
time<-data.frame(time) #转化为数据框形式
po<-data.frame(time)#列合并数据框，格式为次数、年份、月份

3 循环抓取后续网页

po<-data.frame()
index <-seq(1,8,1)
for (i in index){# 读取网址url = paste("http://www.cxz.gov.cn/xxgk/xxgkzhlistpage.jsp?totalpage=8&PAGENUM=",i,"&urltype=tree.TreeTempUrl&wbtreeid=1977")url2<-str_replace_all(url," ","")  #合并网页去掉空格url <-(url2)#由于直接使用url2抓取内容为空：原因未知，故重新读取一次httr_web <-read_html(url,encoding ='utf-8')  #抓取网页#具体时间time<-httr_web%>%html_nodes('ul li span')%>%html_text()#抓取链接#具体时间time<-strsplit(time,split = "-") # strsplit函数将数据拆分成列表(年月日)time<-do.call(rbind,time)[,1:2]# 将列表转换为矩阵，提取第第一列和第二列（年、月）time<-data.frame(time) #转化为数据框形式timek<-data.frame(time)po<-data.frame(rbind(po,timek))
}
po1<-po
po1$X1<-as.numeric(as.character(po1$X1))
po1$X2<-as.numeric(as.character(po1$X2))
time3<-data.frame(2018,7)
names(time3)<-c("X1","X2")
po1<-data.frame(rbind(po1,time3))

4 数据存储

#将因子型转化为数值型
po1<-po
po1$X1<-as.numeric(as.character(po1$X1))
po1$X2<-as.numeric(as.character(po1$X2))##已获得每个常务会网页的网址及命名需要数据（年份、月份，第k次），现循环存储每个网页文本内容comments1<-as.character(comments$websites2)#将因子型转化为字符串，即网页形式
p=length(comments1)
for(k in 1:length(comments1)) #定义语句循环次数，直至所有链接提取完成
{ur2 <-comments1[k]httr_web2 <-read_html(ur2,encoding ='utf-8')  #抓取网页text<-httr_web2%>%html_nodes('div.xw-txt p')%>%html_text(trim =T)name<-paste("天津市\\","天津",po1[1:p,1][k],po1[1:p,2][k],68-k+1,".txt")#文件命名write.table(text, file = name, sep = "\n",row.names = F, col.names = F)
}ur2 <-comments1[1]
httr_web2 <-read_html(ur2,encoding ='utf-8')  #抓取网页
text<-httr_web2%>%html_nodes('div.xw-txt p')%>%html_text(trim =T)

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.rhkb.cn/news/272892.html

如若内容造成侵权/违法违规/事实不符，请联系长河编程网进行投诉反馈email:809451989@qq.com，一经查实，立即删除！