IT评测·应用市场-qidao123.com

标题: 爬虫-实战爬取虎扑ACG帖子 [打印本页]

作者: 美食家大橙子 时间: 2024-7-29 23:01
标题: 爬虫-实战爬取虎扑ACG帖子
要求如下：
爬取虎扑步行街 ACG 版面的数据，要求使用多线程来并发爬取。范围是第一页的所有帖子，每个帖子包含标题、主题内容和第一页的所有回复内容。末了打印出爬到的所有帖子的标题。
网址是：ACG圈 - 虎扑社区。
针对上面的要求，我们进行分析：

首先是要使用多线程
范围是第一页的所有的帖子
每个帖子的标题，重要内容以及所有回复内容

那我们分析下页面：
解析所有帖子的链接

我们找到第一条，鼠标放到上面邮件检查，然后我们看到这条贴子的链接在 bbs-sl-web-post下面，然后我们看到元素a的属性是627322160.html，看着不像是一个链接，点击进去我们发下他是后缀

经过前面的分析我们可以写一个获取所有帖子链接的方法

# 解析列表页，得到内容页链接
def parse_list_page(text):
soup = BeautifulSoup(text, &#

复制代码

免责声明：如果侵犯了您的权益，请联系站长，我们会及时删除侵权内容，谢谢合作！更多信息从访问主页：qidao123.com:ToB企服之家，中国第一个企服评测及商务社交产业平台。

欢迎光临 IT评测·应用市场-qidao123.com (https://dis.qidao123.com/)