python爬取各类文档方法归类汇总

时间：2021-05-22

HTML文档是互联网上的主要文档类型，但还存在如TXT、WORD、Excel、PDF、csv等多种类型的文档。网络爬虫不仅需要能够抓取HTML中的敏感信息，也需要有抓取其他类型文档的能力。下面简要记录一些个人已知的基于python3的抓取方法，以备查阅。

1.抓取TXT文档

在python3下，常用方法是使用urllib.request.urlopen方法直接获取。之后利用正则表达式等方式进行敏感词检索。

### Reading TXT doc ###from urllib.request import urlopenfrom urllib.error import URLError,HTTPErrorimport retry: textPage = urlopen("http:///pages/AWordDocument.docx").read()wordFile = BytesIO(wordFile)document = ZipFile(wordFile)#xml_content = document.read("word/document.xml")#print(xml_content.decode("utf-8"))wordObj = BeautifulSoup(xml_content.decode("utf-8"),"lxml")textStrings = wordObj.findAll("w:t")for textElem in textStrings: print(textElem.text)

5.抓取EXCEL

6.抓取HTML源文档

7.抓取HTML表单数据

8.抓取Javascript数据

更多内容请参考专题《python爬取功能汇总》进行学习。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

声明：本页内容来源网络，仅供用户参考；我单位不保证亦不表示资料全面及准确无误，也不保证亦不表示这些资料为最新信息，如因任何原因，本网内容或者用户因倚赖本网内容造成任何损失或损害，我单位将不会负任何法律责任。如涉及版权问题，请提交至online#300.cn邮箱联系删除。

python爬取各类文档方法归类汇总

相关文章

Python实现爬虫爬取NBA数据功能示例

Python3爬虫ChromeDriver的安装实例

Python爬虫设置代理IP的方法(爬虫技巧)

Python爬虫UA伪装爬取的实例讲解

python 爬取马蜂窝景点翻页文字评论的实现