
本文通过试试用Python中xml + xpath库, 实现图克巴巴配乐mp3的提取。
直接上代码:
# 爬取tuke88的配乐mp3文件
2
3 import os
4 import random
5 import time
6 import requests
7 import lxml.etree
8
9 page_n = int(input("请输入你想爬取的网页数量"))
10
11 for i in range(page_n):
12 url = f'http://www.tuke88.com/peiyue/zonghe_0_{i}.html'
13 response = requests.get(url)
14 html_parser = lxml.etree.HTMLParser()
15 html = lxml.etree.fromstring(response.text, parser=html_parser)
titles = html.xpath("//div[@class='lmt']//div[@class='audiolist']//a[@class='title']/text()")
16
mp3_urls = html.xpath("//div[@class='lmt']//div[@class='audiolist']//source/@src")
17
18
if not os.path.exists("pymp3"):
19 os.mkdir('pymp3')
20 for title, mp3_url in zip(titles, mp3_urls):
21 mp3_stream = requests.get(mp3_url, stream=True)
22 with open(os.path.join('pymp3', title + '.mp3'), 'wb+') as writer:
23 writer.write(mp3_stream.raw.read())
24 print(f"【INFO】{title}.mp3下载成功")
25 time.sleep(random.uniform(0.1, 0.4)) 爬取结果如下:

保存到的文件如下:

【小结】以上是通过Python实现的简单的爬虫案例。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。