爬虫-实战爬取虎扑ACG帖子

打印 上一主题 下一主题

主题 1017|帖子 1017|积分 3051

要求如下:
爬取虎扑步行街 ACG 版面的数据,要求使用多线程来并发爬取。范围是第一页的所有帖子,每个帖子包含标题、主题内容和第一页的所有回复内容。末了打印出爬到的所有帖子的标题。
网址是:ACG圈 - 虎扑社区。
针对上面的要求,我们进行分析:

  • 首先是要使用多线程
  • 范围是第一页的所有的帖子
  • 每个帖子的标题,重要内容以及所有回复内容
那我们分析下页面:
解析所有帖子的链接


我们找到第一条,鼠标放到上面邮件检查,然后我们看到这条贴子的链接在 bbs-sl-web-post下面,然后我们看到元素a的属性是627322160.html,看着不像是一个链接,点击进去我们发下他是后缀

经过前面的分析我们可以写一个获取所有帖子链接的方法
  1. # 解析列表页,得到内容页链接
  2. def parse_list_page(text):
  3.     soup = BeautifulSoup(text, &#
复制代码
免责声明:如果侵犯了您的权益,请联系站长,我们会及时删除侵权内容,谢谢合作!更多信息从访问主页:qidao123.com:ToB企服之家,中国第一个企服评测及商务社交产业平台。
回复

使用道具 举报

0 个回复

倒序浏览

快速回复

您需要登录后才可以回帖 登录 or 立即注册

本版积分规则

美食家大橙子

论坛元老
这个人很懒什么都没写!
快速回复 返回顶部 返回列表