零基础写python爬虫之urllib2中的两个重要概念：Openers和Handlers

时间：2021-05-22

在开始后面的内容之前，先来解释一下urllib2中的两个个方法：info/ geturl
urlopen返回的应答对象response(或者HTTPError实例)有两个很有用的方法info()和geturl()

1.geturl()：

这个返回获取的真实的URL，这个很有用，因为urlopen(或者opener对象使用的)或许会有重定向。获取的URL或许跟请求URL不同。
以人人中的一个超级链接为例,
我们建一个urllib2_test10.py来比较一下原始URL和重定向的链接：

复制代码代码如下:
from urllib2 import Request, urlopen, URLError, HTTPError
old_url = 'http://rrurl.cn/b1UZuP'
req = Request(old_url)
response = urlopen(req)
print 'Old url :' + old_url
print 'Real url :' + response.geturl()

运行之后可以看到真正的链接指向的网址：

2.info()：

这个返回对象的字典对象，该字典描述了获取的页面情况。通常是服务器发送的特定头headers。目前是httplib.HTTPMessage 实例。
经典的headers包含"Content-length"，"Content-type"，和其他内容。
我们建一个urllib2_test11.py来测试一下info的应用：

复制代码代码如下:
from urllib2 import Request, urlopen, URLError, HTTPError
old_url = 'http://:8080”。
后者包含了端口号。

声明：本页内容来源网络，仅供用户参考；我单位不保证亦不表示资料全面及准确无误，也不保证亦不表示这些资料为最新信息，如因任何原因，本网内容或者用户因倚赖本网内容造成任何损失或损害，我单位将不会负任何法律责任。如涉及版权问题，请提交至online#300.cn邮箱联系删除。

零基础写python爬虫之urllib2中的两个重要概念：Openers和Handlers

相关文章

Python中使用urllib2模块编写爬虫的简单上手示例

python爬虫基础之urllib的使用

python 网络爬虫初级实现代码

python网络编程学习笔记(六)：Web客户端访问

Python库urllib与urllib2主要区别分析