爬虫小工具合集 | 不会编制程序也能爬数据

脚下的主流爬虫手段是用Python编制程序,Python的强有力毋庸置疑,但初学者学习Python照旧须求一七个月时间的。有没有一对更简短的爬取数据格局吧?答案是局地,DataCastle为您准备了之类小工具,对于每种小工具你只必要花十几分钟时间,跟着作者的手续走一次就能够控制它啦~

一、Microsoft Excel

首先教大家1个用Excel爬取多少的法门,那里用的Microsoft Excel
二〇一一版本,上边手把手开首教学~

(1)新建Excel,打开它,如下图所示

(2)点击“数据”——“自网站”

(3)在弹出的对话框中输入指标网址,那里以全国实时间和空间气品质网站为例,点击转到,再导入

采纳导入地方,显著

(4)结果如下图所示,怎样,是还是不是极棒?

(5)借使要实时更新数据,可以在“数据”——“全部更新”——“连接属性”中开始展览安装,输入更新频率即可

二、Google Sheet

使用谷歌Sheet爬取多少前,要保障三点:使用Chrome浏览器、拥有谷歌(Google)账号、电脑已翻墙。假设那八个规格抱有了的话,下边大家就从头吧~

(1)打开Google
Sheet
网站:

(2)在首页上点击“转到Google表格”,然后登录本身的账号,能够看来如下界面,再点击“+”创设新的报表

新建的报表如下:

(3)打开要爬取的指标网站,三个全国实时空气品质网站
,目的网站上的表格结构如下图所示

(4)回到谷歌(Google) sheet页面,使用函数=IMPOLANDTHTML(网址, 查询,
索引),“网址”正是要爬取数据的对象网站,“查询”中输入“list”或“table”,那个取决于数量的切实可行协会类型,“索引”填阿拉伯数字,从1初始,对应着网站中定义的哪一份报表或列表

对于大家要爬取的网站,大家在Googlesheet的A1单元格中输入函数=IMPOCRUISERTHTML(“http://www.pm25.in/rank“,”table”,1),回车后就爬得多少啦

(5)将爬取好的报表存到本地

是还是不是感觉拔尖不难?

三、you-get

那是三个程序员基于python
3开发的档次,已经在github上边开源,帮忙六拾玖个网站,包涵优酷、土豆、爱奇艺、b站、酷狗音乐、虾米……总而言之你能体会精晓的网站都有!
还有2个黑科学和技术的地点,固然是名单上尚无的网站,当您输入链接,程序也会猜疑你想要下载什么,然后帮你下载。当然you-get要在python3条件下进展设置,用pip安装好后,在终端输入“you
get+你想下载财富的链接”就足以等着收藏能源了。

此地给3个you-get的中文使用验证,遵照表达上写的按步骤操作就能够啊。

未完待续……以后DataCastle还会延续补充部分不难好用的爬虫小工具的,记得辅助一下呐~

发表评论

电子邮件地址不会被公开。 必填项已用*标注