Node爬虫实践

2019-07-04 14:16:39

爬虫的原理很好理解，就是在服务端请求另一个服务器的资源，前端有跨域问题，而服务端没有，这是天然优势。掌握node的前端可以为所欲为了。

Node爬虫实践

1 首先，根据请求资源的协议选择合适的模块，比如csdn是https协议，就用https的方法取请求，之前没有注意到这个问题。

2 用get方法请求需要抓去内容的网页地址，试过用request方法，没有反应。

3 用cheerio模块查找dom元素，抓取需要的内容。cheerio是服务端的dom操作工具，以jquery为内核。

4 把图片的绝对地址改成本地路径，前端页面无法直接访问跨域受保护图片。

5 最后一步，也是最重要的一步：把图片保存在本地文件夹。试过fs.readFile 和fs.writeFile，保存下来的图片受损打不开；试过直接get请求，返回的图片都是0字节。正确的方法是用request方法，至于为什么？我也不清楚啊。可能是binary二进制的优势，毕竟再怎么伪装，所有数据本质还是二进制吧。

到此为止，爬虫的功能就结束了。

Node爬虫实践

Node爬虫实践

继续阅读

Python漫画爬虫开源 66漫画 AJAX，包含数据库连接，图片下载处理

requests模块进行人人网模拟登陆

Python image.show() 出错FSPathMakeRef(/Applications/Preview.app) failed with error -43

2023爬虫学习笔记 -- 多线程操作

M团店铺评价采集不到问题问题展示：解决方案：

Python爬虫学习（1）

Python爬虫学习进阶

Python爬虫（入门+进阶）学习笔记 1-2 初识Python爬虫

Python进阶爬虫——Class1：认识爬虫

python爬虫学习笔记-1

python学习之urllib使用小结

NOIp模拟题之肮脏的牧师（桶排序）

一篇文章教你如何在一个月内学会爬取大规模数据

npm start 启动和webstorm中的绿色箭头启动node服务导致的差异

Pyhton爬虫实战 - 抓取BOSS直聘职位描述和数据清洗Pyhton爬虫实战 - 抓取BOSS直聘职位描述和数据清洗

sort()函数到底是怎样进行数字排序的