Python采集B站最新周杰伦MV内容, 粉丝评论 并实现词云分析 ...

打印 上一主题 下一主题

主题 866|帖子 866|积分 2600

前言

大家早好、午好、晚好吖~

环境使用:


  • Python 3.8
  • Pycharm 2021.2版本
  • ffmpeg
模块使用:


  • import requests >>> pip install requests
内置模块 你安装好python环境就可以了

  • import re
  • import json
  • import subprocess
如果安装python第三方模块:


  • win + R 输入 cmd 点击确定, 输入安装命令 pip install 模块名 (pip install requests) 回车
  • 在pycharm中点击Terminal(终端) 输入安装命令
基本思路流程:

采集视频数据.... 1. 视频标题 2. 视频内容
1、对着网页 鼠标右键点击查看网页源代码 ctrl + F 搜索 playinfo
代码实现步骤:

  • 发送请求, 模拟浏览器对于url地址发送请求
  • 获取数据, 获取网页源代码
  • 解析数据, 提取我们想要数据内容
  • 保存数据, 把视频内容完整的保存到本地文件夹
代码

采集视频
  1. # 导入数据请求模块
  2. import requests
  3. # 导入正则
  4. import re
  5. # 导入json
  6. import json
  7. # 导入格式化输出模块
  8. import pprint
  9. # 导入进程模块
  10. import subprocess
复制代码
 
"""
发送请求

模拟浏览器对于url地址发送请求
"""
  1. # 确定网址
  2. url = 'https://www.bilibili.com/video/BV1ua411p7iA?vd_source=b2da3931eefc454d41eb6bb5b34749d1'
  3. # python代码如何模拟浏览器? 请求头 ---> 用伪装python代码
  4. headers = {
  5.     # referer 防盗链 告诉服务器请求url地址是从哪里跳过过来
  6.     'referer': 'https://www.bilibili.com/',
  7.     # user-agent 用户代理 表示浏览器基本身份标识
  8.     'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.0.0 Safari/537.36'
  9. }
  10. # 发送请求  ---> 得到响应对象 200 状态码表示请求成功
  11. response = requests.get(url=url, headers=headers)
  12. # <Response [200]>
  13. print(response)
复制代码
 
获取数据
  1. # 获取数据 得到响应对象文本数据 ---> 字符串数据类型
  2. # print(response.text)
复制代码
 
"""
解析数据

提取我们想要数据内容
正则表达式 re ---> 对于字符串数据进行提取
---> 0 1 2 开始计数 -3 -2 -1 匹配数据返回 列表数据类型 列表取值: 根据索引位置提取内容
re 模块名
.findall() 调用re模块里面findall()方法 --> 找到所有
从什么地方去找什么数据
从 response.text 里面 去找 "title":"(.?)","pubdate" 其中 (.?) 这段是我们想要的
"""
  1. 源码、解答、教程可加Q裙:832157862
  2. # 获取标题
  3. title = re.findall('"title":"(.*?)","pubdate"', response.text)[0].replace(' ', '')
  4. # 正则替换特殊字符
  5. title = re.sub(r'[\/:*?"<>|]', '', title)
  6. # 获取shipin数据信息
  7. html_data = re.findall('', response.text)[0]
  8. # 转成json字典数据类型
  9. json_data = json.loads(html_data)
  10. # 字典取值 --> 键值对取值, 根据冒号左边内容[键]  提取冒号右边的内容[值]
  11. audio_url = json_data['data']['dash']['audio'][0]['baseUrl']
  12. video_url = json_data['data']['dash']['video'][0]['baseUrl']
  13. print(audio_url)
  14. print(video_url)
  15. print(title)
复制代码
 
保存数据

--> 403 Forbidden 没有访问权限 --> 防盗链 加headers请求头
  1. # 发送请求 获取音频二进制数据
  2. audio_content = requests.get(url=audio_url, headers=headers).content
  3. # 发送请求 获取视频二进制数据
  4. # video__content = requests.get(url=video_url, headers=headers).content
  5. # with open('video\\' + title + '.mp3', mode='wb') as a:
  6. #     a.write(audio_content)
  7. # with open('video\\' + title + '.mp4', mode='wb') as v:  # 丨
  8. #     v.write(video__content)
  9. # 通过ffmpeg 这个软件命令 进行视频合成
  10. cmd = f"ffmpeg -i video\\{title}.mp4 -i video\\{title}.mp3 -c:v copy -c:a aac -strict experimental video\\{title}output.mp4"
  11. subprocess.run(cmd, shell=True)
复制代码
 
采集评论
  1. 源码、解答、教程可加Q裙:832157862
  2. # 导入数据请求模块
  3. import time
  4. import requests
  5. for page in range(1, 11):
  6.     # 请求网址
  7.     time.sleep(1)
  8.     url = f'https://api.bilibili.com/x/v2/reply/main?csrf=9b972b9803693b4f5c0d6a042b2d0c0e&mode=3&next={page}&oid=215631694&plat=1&type=1'
  9.     # 请求头
  10.     headers = {
  11.         # 'origin': 'https://www.bilibili.com',
  12.         'referer': 'https://www.bilibili.com/video/',
  13.         'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.0.0 Safari/537.36',
  14.     }
  15.     # 发送请求
  16.     response = requests.get(url=url, headers=headers)
  17.     # 获取数据
  18.     content_list = [i['content']['message'] for i in response.json()['data']['replies']]
  19.     print(content_list)
  20.     # for 遍历输出内容
  21.     for content in content_list:
  22.         with open('评论.txt', mode='a', encoding='utf-8') as f:
  23.             f.write(content)
  24.             f.write('\n')
  25.         print(content)
复制代码
 
制作词云
  1. # 导入结巴分词模块
  2. import jieba
  3. # 导入词云模块
  4. import wordcloud
  5. # 读取文件内容
  6. f = open('评论.txt', encoding='utf-8')
  7. txt = f.read()
  8. print(txt)
  9. string = ' '.join(jieba.lcut(txt))
  10. print(string)
  11. wc = wordcloud.WordCloud(
  12.     width=700,   # 宽
  13.     height=700,  # 高
  14.     background_color='white',  # 背景颜色
  15.     font_path='msyh.ttc',  # 设置字体
  16.     scale=15,  # 规模
  17. )
  18. wc.generate(string)
  19. wc.to_file('评论词云.png')
复制代码
 
尾语

好了,我的这篇文章写到这里就结束啦!
有更多建议或问题可以评论区或私信我哦!一起加油努力叭(ง •_•)ง
喜欢就关注一下博主,或点赞收藏评论一下我的文章叭!!!
 

免责声明:如果侵犯了您的权益,请联系站长,我们会及时删除侵权内容,谢谢合作!

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
回复

使用道具 举报

0 个回复

倒序浏览

快速回复

您需要登录后才可以回帖 登录 or 立即注册

本版积分规则

用多少眼泪才能让你相信

金牌会员
这个人很懒什么都没写!
快速回复 返回顶部 返回列表