必须收藏!23个Python爬⾍开源项⽬代码:、淘宝、等
今天分享的⽂章为⼤家整理了23个Python爬⾍项⽬。
整理的原因是,爬⾍⼊门简单快速,也⾮常适合新⼊门的⼩伙伴培养信⼼,所有链接指向GitHub,不能直接打开,⽼规矩,可以⽤电脑打开。.
当然⼩编这⾥也准备⼀份适合你的学习资料爬⾍,web开发的学习资料视频教程,私信⼩编“01”都可以免费获取!这些书籍都是可以私信⼩编“01”免费领取的!![在这⾥插⼊图⽚描述](img-blog.csdnimg/1f50f0d3258643bfa3d45496ca543898.png?x-oss-process=image/watermark,type_ZmFuZ3poZW5naG VpdGk,shadow_10,text_aHR0cHM6Ly9ibG9nLmNzZG4ubmV0L01DX0tpdHR5,size_16,color_FFFFFF,t_70)
1. WechatSogou – 爬⾍
基于搜狗搜索的爬⾍接⼝,可以扩展成基于搜狗搜索的爬⾍,返回结果是列表,每⼀项均是具体信息字典。
github地址:新浪微博登录不了
2. DouBanSpider – ⾖瓣读书爬⾍
可以爬下⾖瓣读书标签下的所有图书,按评分排名依次存储,存储到Excel中,可⽅便⼤家筛选搜罗,⽐如筛选评价⼈数>1000的⾼分书籍;可依据不同的主题存储到Excel不同的Sheet ,采⽤User Agent伪装为浏览器进⾏爬取,并加⼊随机延时来更好地模仿浏览器⾏为,避免爬⾍被封。
github地址:
3. zhihu_spider – 知乎爬⾍
此项⽬的功能是爬取知乎⽤户信息以及⼈际拓扑关系,爬⾍框架使⽤scrapy,数据存储使⽤mongo
github地址:
4. bilibili-user – Bilibili⽤户爬⾍
总数据数:20119918,抓取字段:⽤户id,昵称,性别,头像,等级,经验值,粉丝数,⽣⽇,地址,注册时间,签名,等级与经验值等。抓取之后⽣成B站⽤户数据报告。
github地址:
5. SinaSpider – 新浪微博爬⾍
主要爬取新浪微博⽤户的个⼈信息、微博信息、粉丝和关注。代码获取新浪微博Cookie进⾏登录,可通过多账号登录来防⽌新浪的反扒。主要使⽤ scrapy 爬⾍框架。所以想学的同学,有必要听⼀下这位⽼师的课、领取python福利奥,想学的同学可以到梦雅⽼师的围鑫(同⾳):前排的是:762,中间⼀排是:459,后排的⼀组是:510 ,把以上三组字母按照顺序组合起来即可,她会安排学习的。
github地址:
6. distribute_crawler – ⼩说下载分布式爬⾍
使⽤scrapy,Redis, MongoDB,graphite实现的⼀个分布式⽹络爬⾍,底层存储MongoDB集,分布式使⽤Redis实现,爬⾍状态显⽰使⽤graphite实现,主要针对⼀个⼩说站点。
github地址:
7. CnkiSpider – 中国知⽹爬⾍。
设置检索条件后,执⾏src/CnkiSpider.py抓取数据,抓取数据存储在/data⽬录下,每个数据⽂件的第⼀⾏为字段名称。
github地址:
8. LianJiaSpider – 链家⽹爬⾍。
爬取北京地区链家历年⼆⼿房成交记录。涵盖链家爬⾍⼀⽂的全部代码,包括链家模拟登录代码。
github地址:
9. scrapy_jingdong – 京东爬⾍。
基于scrapy的京东⽹站爬⾍,保存格式为csv。
github地址:
10. QQ-Groups-Spider – QQ 爬⾍。
批量抓取 QQ 信息,包括名称、号、⼈数、主、简介等内容,最终⽣成 XLS(X) / CSV 结果⽂件。
github地址:
11. wooyun_public -乌云爬⾍。
乌云公开漏洞、知识库爬⾍和搜索。全部公开漏洞的列表和每个漏洞的⽂本内容存在MongoDB中,⼤概约2G内容;如果整站爬全部⽂本和图⽚作为离线查询,⼤概需要10G空间、2⼩时(10M电信带宽);爬取全部知识库,总共约500M空间。漏洞搜索使⽤了Flask作为web server,bootstrap作为前端。
12. spider – hao123⽹站爬⾍。
以hao123为⼊⼝页⾯,滚动爬取外链,收集⽹址,并记录⽹址上的内链和外链数⽬,记录title等信息,windows7 32位上测试,⽬前每24个⼩时,可收集数据为10万左右
13. findtrip – 机票爬⾍(去哪⼉和携程⽹)。
Findtrip是⼀个基于Scrapy的机票爬⾍,⽬前整合了国内两⼤机票⽹站(去哪⼉ + 携程)。
14. 163spider – 基于requests、MySQLdb、torndb的⽹易客户端内容爬⾍
15. doubanspiders – ⾖瓣电影、书籍、⼩组、相册、东西等爬⾍集
16. QQSpider – QQ空间爬⾍,包括⽇志、说说、个⼈信息等,⼀天可抓取 400 万条数据。
17. baidu-music-spider – 百度mp3全站爬⾍,使⽤redis⽀持断点续传。
18. tbcrawler – 淘宝和天猫的爬⾍,可以根据搜索关键词,物品id来抓取页⾯的信息,数据存储在mongodb。
19. stockholm – ⼀个股票数据(沪深)爬⾍和选股策略测试框架。根据选定的⽇期范围抓取所有沪深两市股票的⾏情数据。⽀持使⽤表
达式定义选股策略。⽀持多线程处理。保存数据到JSON⽂件、CSV⽂件。所以想学的同学,有必要听⼀下这位⽼师的课、领取python福利奥,想学的同学可以到梦雅⽼师的围鑫(同⾳):前排的是:762,中间⼀排是:459,后排的⼀组是:510 ,把以上三组字母按照顺序组合起来即可,她会安排学习的。
20. BaiduyunSpider - 百度云盘爬⾍。
21. Spider - 社交数据爬⾍。⽀持微博,知乎,⾖瓣。
22. proxy pool - Python爬⾍代理IP池(proxy pool)。
23. music-163 - 爬取⽹易云⾳乐所有歌曲的评论。
版权声明:本站内容均来自互联网,仅供演示用,请勿用于商业和其他非法用途。如果侵犯了您的权益请与我们联系QQ:729038198,我们将在24小时内删除。
发表评论