时间:2021-05-22
设计一个算法,将URL转换成5部分,分别是:schema、netloc、path、query_params、fragment。
问题
URL的中文名叫统一资源定位符,就是咱们常说的网址,设计一个算法,将URL转换成5部分,分别是:schema、netloc、path、query_params、fragment。
<scheme>://<netloc>/<path>?<query_params>#<fragment>一图胜千言:
应用场景
在实际应用场景中,有些聚合网站会把URL里面netloc提取出来。
分析
这里没有什么特别复杂的算法,因为每部分都有一个特别的字符,所以,如果你熟练Python的字符串操作和正则表达式使用的话那么就很简单。
知识点
字符串的常用方法split、find、join、lower、切片的使用,re模块下面的常用方法。另外还有关于如何使用 namedtuple 定义一个简单类的操作
实现
第一种方式使用字符串提供的方法,就是根据关键字符进行切分。整体思路是利用字符串的切片功能不断进行切分,代码稍显复杂。
URL = namedtuple("URL", ["schema", "netloc", "path", "params", "fragment"])def url_parse1(url):assert url.startswith("http")# 初始化每部分为空schema = netloc = params = fragment = path = None# 从 :// 切分 url,前面部分是shemai = url.find('://')if i > 0:schema = url[:i]url = url[i + 3:]# 获取netlocfor c in "/?#": # 三个分隔符的顺利很重要a = url.find(c)if a > 0: # 只要有三个字符中的任意字符,立即切分,前部分就是netloc,剩下的部分进行后续处理netloc, url = url[0:a], url[a:]breakelse:netloc, url = url, '' # 如果三个分隔符都不在url中,那么这是一个只包含# 同样的方式获取pathfor c in "?#":a = url.find(c)if a > 0:path, url = url[0:a], url[a:]breakelse:path, url = url or None, ''if "#" in url:url, fragment = url.split("#", 1)if '?' in url:url, params = url.split('?', 1)return URL(schema=schema, netloc=netloc, path=path, params=_params_parse(params), fragment=fragment)def _params_parse(params):if not params:return Nonepairs = [s for s in params.split('&')]param_dict = dict()for pair in pairs:k, v = pair.split('=', 1)param_dict[k] = vreturn param_dict第二种方式就是用正则表达式,主要考验你写正则的能力
def url_parse2(url):rex = r'^(http[s]?):\/\/([^\/\s]+)([\/\w\-\.]+[^#?\s]*)?(\?([^#]*))?(#(.*))?$'schema = netloc = params = fragment = path = ''pattern = re.compile(rex)match = pattern.match(url)if match:schema = match.group(1)netloc = match.group(2)path = match.group(3)params = match.group(5)fragment = match.group(7)return URL(schema=schema, netloc=netloc, path=path, params=_params_parse(params), fragment=fragment)通过正则表达式的分组功能提取每部分,关于正则表达式推荐两个资源
在线调试正则表达式
Python中正则表达式介绍, 这是一篇比较完整介绍Python中正则表达式的文章,如果你能读懂里面的每句话,并且实践后,你一定能写出上面这样的表达式出来。
当然,你也可以直接使用urlparse模块中现成的方式来实现。
以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持。
声明:本页内容来源网络,仅供用户参考;我单位不保证亦不表示资料全面及准确无误,也不保证亦不表示这些资料为最新信息,如因任何原因,本网内容或者用户因倚赖本网内容造成任何损失或损害,我单位将不会负任何法律责任。如涉及版权问题,请提交至online#300.cn邮箱联系删除。
本文实例讲述了python实现文件路径和url相互转换的方法。分享给大家供大家参考。具体实现方法如下:importurllibpathname='path/to
java中Excel转shapefile的实例详解概述:本文讲述如何结合geotools和POI实现Excel到shp的转换,再结合前文shp到geojson数
本文实例讲述了python实现对一个完整url进行分割的方法。分享给大家供大家参考。具体分析如下:python对一个完整的url进行分割,将url分割成单独的部
其实我在《把文本中的URL地址转换为可点击链接的JavaScript、PHP自定义函数》一文中介绍过PHP代码如何实现将URL地址转化成链接的方法,今天给大家介
Python类的继承详解Python既然是面向对象的,当然支持类的继承,Python实现类的继承比JavaScript简单。Parent类:classParen