时间:2021-05-22
如下所示:
# -*- coding:utf-8 -*- from datetime import datetimeimport re def Main(): sourcr_dir = '/data/u_lx_data/fudan/muying/muying_11yue_all.txt' target_dir = '/data/u_lx_data/fudan/muying/python/uid_regular_get.txt' uset = set() #去重 print("开始。。。。。") print(datetime.now().strftime('%Y-%m-%d %H:%M:%S')) with open(target_dir, 'w+') as f_write: with open(sourcr_dir, 'r') as f_scorce: for line in f_scorce: line = line.strip().split("\t") # 宝宝树 if line[2] == 'babytree.com': uidList = re.findall(r'.*NL=u%02(u\d+)', line[3], re.I) if uidList: # 去重代码 if uidList[0] not in uset: f_write.write(uidList[0] + "\n") uset.add(uidList[0]) print("宝宝树已完成") # 柚宝宝 elif line[2] == 'youzibuy.com': if line[4].find("yunqi.youzibuy.com/tae_top_notify") != -1: uidList = re.findall(r'.*myuid=(\d+)', line[4], re.I) if uidList: if uidList[0] not in uset: f_write.write(uidList[0] + "\n") uset.add(uidList[0]) print("柚宝宝已完成") # 妈妈帮 elif line[2] == 'mmbang.com': uidList = re.findall(r'.*uid=(\d+)', line[3], re.I) if uidList: if uidList[0] not in uset: f_write.write(uidList[0] + "\n") uset.add(uidList[0]) print("妈妈帮已完成") # 妈妈网 elif line[2] == 'mama.cn': if line[4].find("mapi.mama.cn/feed/users/show") != -1: uidList = re.findall(r'.*friend_uid=(\d+)', line[4], re.I) if uidList: if uidList[0] not in uset: f_write.write(uidList[0] + "\n") uset.add(uidList[0]) if line[4].find("mamaquan/mmq_thread") != -1: uidList = re.findall(r'.*uid=(\d+)', line[4], re.I) if uidList: if uidList[0] not in uset: f_write.write(uidList[0] + "\n") uset.add(uidList[0]) print("妈妈网已完成") # 育儿网 elif line[2] == 'ci123.com': uidList = re.findall(r'.*ci123js=([a-zA-Z]+\d+)', line[3], re.I) if uidList: if uidList[0] not in uset: f_write.write(uidList[0] + "\n") uset.add(uidList[0]) print("育儿网已完成") print("完成。。。。。") print(datetime.now().strftime('%Y-%m-%d %H:%M:%S'))if __name__ == "__main__": Main()以上这篇对python读写文件去重、RE、set的使用详解就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持。
声明:本页内容来源网络,仅供用户参考;我单位不保证亦不表示资料全面及准确无误,也不保证亦不表示这些资料为最新信息,如因任何原因,本网内容或者用户因倚赖本网内容造成任何损失或损害,我单位将不会负任何法律责任。如涉及版权问题,请提交至online#300.cn邮箱联系删除。
python列表元素去重后如何保持原来的顺序不变原列表:list1=[1,2,1,4,9,3,5,2,6,7,3,1,6,8,4,0]去重,使用集合set来去重
python读写excel文件有很多种方法:用xlrd和xlwt进行excel读写用openpyxl进行excel读写用pandas进行excel读写本文使用x
Python的多线程在io方面比单线程还是有优势,但是在多线程开发时,少不了对文件的读写操作。在管理多个线程对同一文件的读写操作时,就少不了文件锁了。使用fcn
本文实例讲述了Python利用正则表达式匹配并截取指定子串及去重的方法。分享给大家供大家参考。具体如下:importrepattern=re.compile(r
Python具有基本的文本文件读写功能。Python的标准库提供有更丰富的读写功能。文本文件的读写主要通过open()所构建的文件对象来实现。创建文件对象我们打