首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >爬虫学习(10):xpath爬取包图网高清模板视频

爬虫学习(10):xpath爬取包图网高清模板视频

作者头像
川川菜鸟
发布2021-10-18 14:33:47
发布2021-10-18 14:33:47
5740
举报

暂时我就没有发xpath基础知识了,编辑太浪费时间了,需要了解或者有问题的可以加我群问我就好了,我也正在努力学习中,不废话了,上代码,解释都在注释. 先看效果:

开始的时候下载的还不是那么高清,后来我琢磨半天才下载到高清的模板视频:

代码语言:javascript
复制
import requests#发送请求
from lxml import etree#处理数据
header={
    'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_3) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.162 Safari/537.36'
}#请求头

url='https://ibaotu.com/shipin/7-0-0-0-0-1.html'#网址

response=requests.get(url=url,headers=header)#发送请求

html_text=response.content.decode('utf-8')#编译

html=etree.HTML(html_text)#自动修正html文档

video_url=html.xpath('//div[@class="video-play"]/video/@src')#视频网址

video_names=html.xpath('//span[@class="video-title"]/text()')#视频名称
# print(video_url,video_names)
path='D://code//my python code//爬虫//shipin//'#视频存放地址
for src,title in zip(video_url,video_names):
    video_url = "https:" + src#视频url
    url=video_url.replace(".mp4_10s","")#增加画质url
    file_name = (title + ".mp4")#文件名
    response=requests.get(url=url,headers=header)#在此发送新的请求
    with open(path+file_name,'wb') as f:    #把文件写入path地址
        f.write(response.content)
        print("%s下载成功"%file_name)

还有问题就自己加我群问我吧,其实我觉得解释挺详细了,加油吧。

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2021/02/03 ,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档