CSV(Comma-Separated Values,逗号分隔值)是一种常见的数据交换格式,用于存储表格数据。每行代表一条记录,每条记录由字段组成,字段之间用逗号分隔。CSV文件易于阅读和编辑,且大多数数据处理软件都支持CSV格式。
CSV文件通常有以下几种类型:
以下是一个使用Python将抓取的数据写入CSV文件的示例代码,使用线程来提高效率:
import csv
import threading
import requests
from bs4 import BeautifulSoup
# 假设我们要抓取的数据是一个网页上的表格
def fetch_data(url):
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
table = soup.find('table')
rows = table.find_all('tr')
data = []
for row in rows:
cols = row.find_all('td')
cols = [ele.text.strip() for ele in cols]
data.append([ele for ele in cols if ele]) # 去掉空值
return data
# 写入CSV文件的函数
def write_to_csv(data, filename):
with open(filename, mode='w', newline='', encoding='utf-8') as file:
writer = csv.writer(file)
writer.writerows(data)
# 线程函数
def thread_task(url, filename):
data = fetch_data(url)
write_to_csv(data, filename)
# 主程序
if __name__ == "__main__":
url = 'http://example.com/data' # 替换为实际的URL
filename = 'output.csv'
# 创建线程
thread = threading.Thread(target=thread_task, args=(url, filename))
thread.start()
thread.join()
utf-8
)。utf-8
)。通过以上方法,可以有效地将抓取的数据写入CSV文件,并处理常见的问题。
领取专属 10元无门槛券
手把手带您无忧上云