时间:2021-05-26
百度爬虫这个词语,一般出现的都是python相关的资料。
py也有很多爬虫框架,比如scrapy,Portia,Crawley等。
之前我个人更喜欢用C#做爬虫。
随着对nodejs的熟悉。发现做这种事情还是用脚本语言适合多了,至少不用写那么多的实体类。而且脚本一般使用比较简单。
在github上搜索node+spider,排名第一的就是node-crawler
github:https://github.com/bda-research/node-crawler
简单使用
npm 安装:
npm install crawlernew一个crawler对象
var c = new Crawler({ // 在每个请求处理完毕后将调用此回调函数 callback : function (error, res, done) { if(error){ console.log(error); }else{ var $ = res.$; // $ 默认为 Cheerio 解析器 // 它是核心jQuery的精简实现,可以按照jQuery选择器语法快速提取DOM元素 console.log($("title").text()); } done(); }});然后往crawler队列里面不停的加url就行了,
// 将一个URL加入请求队列,并使用默认回调函数c.queue('http://']);控制并发速度
爬虫框架一般都是同时去爬多个页面,但是速度过快会触发目标网站的反爬虫机制,也同时影响别人网站的性能。
控制最大的并发数量
var c = new Crawler({ // 最大并发数默认为10 maxConnections : 1, callback : function (error, res, done) { if(error){ console.log(error); }else{ var $ = res.$; console.log($("title").text()); } done(); }});使用慢速模式
使用参数rateLimit启用慢速模式,两次请求之间会闲置rateLimit毫秒,而maxConnections将被强行修改为 1 。
var c = new Crawler({ // `maxConnections` 将被强制修改为 1 maxConnections : 10, // 两次请求之间将闲置1000ms rateLimit: 1000, callback : function (error, res, done) { if(error){ console.log(error); }else{ var $ = res.$; console.log($("title").text()); } done(); }});下载图片等静态文件
var c = new Crawler({ encoding:null, jQuery:false,// set false to suppress warning message. callback:function(err, res, done){ if(err){ console.error(err.stack); }else{ fs.createWriteStream(res.options.filename).write(res.body); } done(); }});c.queue({ uri:"https://nodejs.org/static/images/logos/nodejs-1920x1200.png", filename:"nodejs-1920x1200.png"});以上就是node.js爬虫框架node-crawler初体验的详细内容,更多关于爬虫框架node-crawler的资料请关注其它相关文章!
声明:本页内容来源网络,仅供用户参考;我单位不保证亦不表示资料全面及准确无误,也不保证亦不表示这些资料为最新信息,如因任何原因,本网内容或者用户因倚赖本网内容造成任何损失或损害,我单位将不会负任何法律责任。如涉及版权问题,请提交至online#300.cn邮箱联系删除。
什么是Node.js的模块(Module)?在Node.js中,模块是一个库或框架,也是一个Node.js项目。Node.js项目遵循模块化的架构,当我们创建了
最近在学习node.js,做了一个练手项目,使用node.js+express框架,配合mysql数据库和前端vue框架开发一个多人文档编辑系统。node.js
前言:最近想学习node.js,突然在网上看到基于node的爬虫制作教程,所以简单学习了一下,把这篇文章分享给同样初学node.js的朋友。目标:爬取http:
安装express$npminstallexpress--save在node.js中,我们最常用的框架就是expressExpress是一个基于Node.js平
Node.js是最流行的JavaScript服务端平台,它允许建立可扩展的Web应用程序。Node.js包含不同类型的框架,如MVC框架、全栈框架、RESTAP