时间:2021-05-22
用python实现的抓取腾讯视频所有电影的爬虫
# -*- coding: utf-8 -*-import reimport urllib2from bs4import BeautifulSoupimport string, timeimport pymongoNUM =0 #全局变量,电影数量m_type = u'' #全局变量,电影类型m_site = u'qq' #全局变量,电影网站#根据指定的URL获取网页内容def gethtml(url): req = urllib2.Request(url) response = urllib2.urlopen(req) html = response.read() return html#从电影分类列表页面获取电影分类def gettags(html): global m_type soup = BeautifulSoup(html) #过滤出分类内容 #print soup #<ulclass="clearfix _group" gname="mi_type" gtype="1"> tags_all = soup.find_all('ul', {'class' :'clearfix _group' ,'gname' :'mi_type'}) #print len(tags_all), tags_all #print str(tags_all[1]).replace('\n','') #<a _hot="tag.sub" class="_gtag _hotkey" href="http://v.qq.com/list/1_0_-1_-1_1_0_0_20_0_-1_0.html" title="动作" tvalue="0">动作</a> re_tags = r'<a _hot=\"tag\.sub\" class=\"_gtag _hotkey\" href=\"(.+?)\" title=\"(.+?)\" tvalue=\"(.+?)\">.+?</a>' p = re.compile(re_tags, re.DOTALL) tags = p.findall(str(tags_all[0])) if tags: tags_url = {} #print tags for tagin tags: tag_url = tag[0].decode('utf-8') #print tag_url m_type = tag[1].decode('utf-8') tags_url[m_type] = tag_url else: print"Not Find" return tags_url#获取每个分类的页数def get_pages(tag_url): tag_html = gethtml(tag_url) #divclass="paginator soup = BeautifulSoup(tag_html) #过滤出标记页面的html #print soup #<divclass="mod_pagenav" id="pager"> div_page = soup.find_all('div', {'class' :'mod_pagenav','id' :'pager'}) #print div_page #len(div_page), div_page[0] #<aclass="c_txt6" href="http://v.qq.com/list/1_2_-1_-1_1_0_24_20_0_-1_0.html" title="25"><span>25</span></a> re_pages = r'<a class=.+?><span>(.+?)</span></a>' p = re.compile(re_pages, re.DOTALL) pages = p.findall(str(div_page[0])) #print pages if len(pages) >1: return pages[-2] else: return 1def getmovielist(html): soup = BeautifulSoup(html) #<ulclass="mod_list_pic_130"> divs = soup.find_all('ul', {'class' :'mod_list_pic_130'}) #print divs for div_htmlin divs: div_html = str(div_html).replace('\n','') #print div_html getmovie(div_html)def getmovie(html): global NUM global m_type global m_site re_movie = r'<li><a class=\"mod_poster_130\" href=\"(.+?)\" target=\"_blank\" title=\"(.+?)\"><img.+?</li>' p = re.compile(re_movie, re.DOTALL) movies = p.findall(html) if movies: conn = pymongo.Connection('localhost',27017) movie_db = conn.dianying playlinks = movie_db.playlinks #print movies for moviein movies: #print movie NUM +=1 print"%s : %d" % ("=" *70, NUM) values = dict( movie_title = movie[1], movie_url = movie[0], movie_site = m_site, movie_type = m_type ) print values playlinks.insert(values) print"_" *70 NUM +=1 print"%s : %d" % ("=" *70, NUM) #else: # print"Not Find"def getmovieinfo(url): html = gethtml(url) soup = BeautifulSoup(html) #pack pack_album album_cover divs = soup.find_all('div', {'class' :'pack pack_album album_cover'}) #print divs[0] #<a href="http:///list/1_0_-1_-1_1_0_0_20_0_-1_0.html m_url = str(url[1]).replace('0_20_0_-1_0.html','') movie_url ="%s%d_20_0_-1_0.html" % (m_url, x) print movie_url movie_html = gethtml(movie_url.encode('utf-8')) #print movie_html getmovielist(movie_html) time.sleep(0.1)总结
以上所述是小编给大家介绍的使用python实现抓取腾讯视频所有电影的爬虫,希望对大家有所帮助,如果大家有任何疑问欢迎给我留言,小编会及时回复大家的!
声明:本页内容来源网络,仅供用户参考;我单位不保证亦不表示资料全面及准确无误,也不保证亦不表示这些资料为最新信息,如因任何原因,本网内容或者用户因倚赖本网内容造成任何损失或损害,我单位将不会负任何法律责任。如涉及版权问题,请提交至online#300.cn邮箱联系删除。
使用Python爬虫库requests多线程抓取猫眼电影TOP100思路:查看网页源代码抓取单页内容正则表达式提取信息猫眼TOP100所有信息写入文件多线程抓取
本文为大家分享了Python爬虫包BeautifulSoup学习实例,具体内容如下BeautifulSoup使用BeautifulSoup抓取豆瓣电影的一些信息
这里向大家分享一下python爬虫的一些应用,主要是用爬虫配合简单的GUI界面实现视频,音乐和小说的下载器。今天就先介绍如何实现一个动态视频下载器。爬取电影天堂
本文实例讲述了Python视频爬虫实现下载头条视频功能。分享给大家供大家参考,具体如下:一、需求分析抓取头条短视频思路:分析网页源码,查找解析出视频资源url(
在之前写过一篇使用python爬虫爬取电影天堂资源的文章,重点是如何解析页面和提高爬虫的效率。由于电影天堂上的资源获取权限是所有人都一样的,所以不需要进行登录验