时间:2021-05-22
作为初学爬虫的我,无论是爬取文字还是图片,都可以游刃有余的做到,但是爬虫所爬取的内容往往不是单独的图片或者文字,于是我就想是否可以将图文保存至world文档里,一开始使用了如下方法保存图片:
with open('123.doc','wb')as file: file.write(response.content) file.close()结果就是,world文档里出现了一堆乱码,此法不同,我就开始另寻他法,找了很久也没有找到,只找到了关于Python操作world的方法。
于是我就开始了新的思路:使用原来的方法将图片保存下来,再将图片添加到world文档里,最后将图片删除。这里使用的是python-dox库,代码如下:
import requestsfrom bs4 import BeautifulSoupimport osimport docxfrom docx import Documentfrom docx.shared import Inchesurl = 'https:///article/119757360'html = requests.get(url).contentsoup = BeautifulSoup(html,'html.parser')wen = soup.find('div',{"class":"content"}).textimg = str(soup.find('div',{"class":"thumb"})).split('src="')[1].split('"/')[0]tu = 'https:' + imgimg_name = img.split('/')[-1]#保存图片至本地with open(img_name,'wb')as f: response = requests.get(tu).content f.write(response) f.close()document = Document()document.add_paragraph(wen)#向文档里添加文字document.add_picture(img_name)#向文档里添加图片document.save('tuwen.doc')#保存文档os.remove(img_name)#删除保存在本地的图片最后,还是实现了将图文保存在了world文档里,尽管方法有些笨……
以上这篇Python爬虫将爬取的图片写入world文档的方法就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持。
声明:本页内容来源网络,仅供用户参考;我单位不保证亦不表示资料全面及准确无误,也不保证亦不表示这些资料为最新信息,如因任何原因,本网内容或者用户因倚赖本网内容造成任何损失或损害,我单位将不会负任何法律责任。如涉及版权问题,请提交至online#300.cn邮箱联系删除。
本文实例讲述了python爬虫模拟浏览器的两种方法。分享给大家供大家参考,具体如下:爬虫爬取网站出现403,因为站点做了防爬虫的设置一、Herders属性爬取C
本文实例讲述了Python使用爬虫爬取静态网页图片的方法。分享给大家供大家参考,具体如下:爬虫理论基础其实爬虫没有大家想象的那么复杂,有时候也就是几行代码的事儿
Python是很好的爬虫工具不用再说了,它可以满足我们爬取网络内容的需求,那最简单的爬取网络上的图片,可以通过很简单的方法实现。只需导入正则表达式模块,并利用s
python爬虫是程序员们一定会掌握的知识,练习python爬虫时,很多人会选择爬取微博练手。python爬虫微博根据微博存在于不同媒介上,所爬取的难度有差异,
前言之前的一篇文章已经讲过怎样获取链接,怎样获得参数了,详情请看python爬取京东商城普通篇,本文将详细介绍利用python爬虫框架scrapy如何爬取京东商