nodejs爬虫入门

用户1462769

发布于 2019-08-12 12:04:52

1.4K00

代码可运行

文章被收录于专栏：全栈者全栈者

运行总次数：0

代码可运行

喜欢作者请关注作者的别忘了关注作者哦，期待您的关注！

本篇从零介绍一下爬虫，使用的技术以nodejs为基础。

爬虫是什么？

简单直观的总结一下，把已经在网络上的内容，请求获取后解析，让杂乱的数据变得仅仅有条，挖掘更大的意义。google和百度背后的搜索引擎就是巨大的网络爬虫。

实现爬虫的工具

能发起http请求的工具，在nodejs中你可以选择http模块的request方法或者get方法，或者使用第三方包superagent网页解析数据筛选。网页数据解析工具，在nodejs中，可以通过cherrio或者jsdom两个第三方包完成。

注意完整版本的代码请在github获取：https://github.com/FantasyGao/About_Node/tree/master/clawer

下面用三种方式去实现

1. http.get+cheerio+iconv-lite

这种方式还是比较简单的，容易理解，直接使用http的get方法进行请求url，将得到的内容给cheerio解析，用jquery的方式解析出我们要东西即可。

需要注意的是得到的结果中文乱码，要用iconv-lite模块将得到的内容进行转码即可。

http.get(options,function(result){
  var body = [];
  result.on('data',function(chunk){
     body.push(chunk);
  });
  result.on('end', function () {
     var html = iconv.decode(Buffer.concat(body), 'gb2312');  //注意这里body是数组
     var $ = cheerio.load(html);
     ...
  });
});

2. request+cheerio+iconv-lite

这种方式在获取内容的方式上与上有些不同,可以直接获取到Buffer类型的数据。然后将得到的内容给cheerio解析，用jquery的方式解析出我们要东西即可。

request(options,function(err,res,body){
  if(err)console.log(err);
  if(!err&&res.statusCode==200){
     var html = iconv.decode(body, 'gb2312');     //这里body是直接拿到的是Buffer类型的数据，可以直接解码。
     var $ = cheerio.load(html);
     ...
  }
});

3. superagent+cheerio+superagent-charset

这种方式是比前面两个有较大差别，用了superagent的get方法发起请求，解码的时候用到了superagent-charse，用法还是很简单的，之后再将获取到的内容给cheerio解析，用jquery的方式解析出我们要东西即可。

这里中文乱码可以使用superagent-charset模块进行转码，方式较之上面有点差别。

var charset = require("superagent-charset");
var superagent = charset(require("superagent"));   //将superagent模块传递给superagent-charset
...
superagent.get(url)
  .charset('gb2312')                                //用charset方法达到解码效果。
  .end(function(err,result){
     if(err) console.log(err);
     var $ = cheerio.load(result.text);
     ...
  });