时间:2021-05-22
实现效果:通过url所绑定的关键名创建目录名,每次访问一个网页url后把文件下载下来
代码:
其中 data[i][0]、data[i][1] 是代表 关键词(文件保存目录)、网站链接(要下载文件的网站)
def getDriverHttp(): for i in range(reCount): # 创建Chrome浏览器配置对象实例 chromeOptions = webdriver.ChromeOptions() # 设定下载文件的保存目录为d盘的tudi目录, # 如果该目录不存在,将会自动创建 prefs = {"download.default_directory": "e:\\tudi\\{0}".format(data[i][0]), "profile.default_content_setting_values.automatic_downloads":1} # 将自定义设置添加到Chrome配置对象实例中 chromeOptions.add_experimental_option("prefs", prefs) # 启动带有自定义设置的Chrome浏览器 # driver = webdriver.Chrome(executable_path="e:\\chromedriver", chrome_options=chromeOptions) driver = webdriver.Chrome(chrome_options=chromeOptions) driver.get(data[i][1]) info2 = re.findall(r'<a href="#" rel="external nofollow" onclick="(.*?)" cssclass="xz_pic">', driver.page_source, re.S) print(len(info2)) for js in info2: driver.execute_script(js) def main(): getDriverHttp()注意:python 使用selenium下载文件时,chrome会提示是否下载多个文件(Download multiple files)
prefs = {"download.default_directory": "e:\\tudi\\{0}".format(data[i][0]), "profile.default_content_setting_values.automatic_downloads":1}
设置允许多个文件下载。
补充知识:python项目实现配置统一管理的操作
一个比较大的项目总是会涉及到很多的参数,最好的方法就是在一个地方统一管理这些参数。最近看了不少的python项目,总结了两种很有意思的配置管理方法。
第一种 基于easydict实现的配置管理
首先需要安装numpy、easydict以及yaml:
pip install numpy
pip install easydict
pip install yaml
就可以了。
然后定义配置类config.py:
import numpy as npfrom easydict import EasyDict as edictimport yaml # 创建dict__C = edict()cfg = __C # 定义配置dict__C.dev = edict()__C.dev.name = 'dev-xingoo'__C.dev.age = 20 __C.test = edict()__C.test.name = 'test-xingoo'__C.test.age = 30 # 内部方法,实现yaml配置文件到dict的合并def _merge_a_into_b(a, b): """Merge config dictionary a into config dictionary b, clobbering the options in b whenever they are also specified in a. """ if type(a) is not edict: return for k, v in a.items(): # a must specify keys that are in b if k not in b: raise KeyError('{} is not a valid config key'.format(k)) # the types must match, too old_type = type(b[k]) if old_type is not type(v): if isinstance(b[k], np.ndarray): v = np.array(v, dtype=b[k].dtype) else: raise ValueError(('Type mismatch ({} vs. {}) ' 'for config key: {}').format(type(b[k]), type(v), k)) # recursively merge dicts if type(v) is edict: try: _merge_a_into_b(a[k], b[k]) except: print(('Error under config key: {}'.format(k))) raise else: b[k] = v# 自动加载yaml文件def cfg_from_file(filename): """Load a config file and merge it into the default options.""" with open(filename, 'r', encoding='utf-8') as f: yaml_cfg = edict(yaml.load(f)) _merge_a_into_b(yaml_cfg, __C)使用的时候很简单,main.py:
from config import cfg_from_filefrom config import cfg cfg_from_file('config.yml')print(cfg.dev.name)print(cfg.test.name)同级目录下创建配置文件config.yaml
dev:
name: xingoo-from-yml
输出:
xingoo-from-yml
test-xingoo
总结
这样的好处就是在任何的Python文件中只要from config import cfg就可以使用配置文件。
第二种 基于Class实现
这种基于普通的python对象实现的,创建config2.py:
class Config: def __init__(self): self.name = 'xingoo-config2' self.age = 100使用的时候直接创建一个新的对象,如何python模块之间需要引用这个变量,那么需要把配置对象传过去:
import config2 as config2 cfg2 = config2.Config()print(cfg2.name)print(cfg2.age)输出为:
xingoo-config2
100
总结
第二种方法简单粗暴...不过每次传递参数也是很蛋疼。还是喜欢第一种方式。
以上这篇python+selenium+chrome批量文件下载并自动创建文件夹实例就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持。
声明:本页内容来源网络,仅供用户参考;我单位不保证亦不表示资料全面及准确无误,也不保证亦不表示这些资料为最新信息,如因任何原因,本网内容或者用户因倚赖本网内容造成任何损失或损害,我单位将不会负任何法律责任。如涉及版权问题,请提交至online#300.cn邮箱联系删除。
folder.htm闪亮日子之在线创建文件夹春风精彩在线创建文件夹新建文件夹:creatfolder.asp恭喜,文件夹创建成功!命名为:出错啦!请返回重试.
本文实例讲述了php文件夹的创建与删除方法。分享给大家供大家参考。具体如下:1、创建文件夹复制代码代码如下:2、创建文件夹,递归式创建复制代码代码如下:3、删除
创建文件或文件夹您可通过编程方式在您的计算机上创建文件夹、子文件夹和子文件夹中的文件,并将数据写入文件。publicclassCreateFileOrFolde
本文实例讲述了C#实现判断文件夹存在与否并创建文件夹的方法。分享给大家供大家参考,具体如下:protectedvoidButton1_Click(objects
本文实例讲述了PHP实现读取文件夹及批量重命名文件操作。分享给大家供大家参考,具体如下:以读取从网上下载的评书解压后的文件夹为例,并批量重命名文件夹内容如下,现