当前位置:

首页 > 软件教程 > 网页数据抓取入门教程,简单实用人人能学

网页数据抓取入门教程,简单实用人人能学

环境需求这个工具对环境的要求非常简单,只需一台能上网的电脑和一个版本号大于31的Chrome浏览器即可。当然,浏览器版本越新越好,目前Chrome浏览器已更新至60多版本,满足要求并不难。在线安装过程在线安装需要能够翻墙,访问Chrome应用商店在线访问WebScraper插件页面,点击“添加至Chrome”按钮。2.在弹出的对话框中点击“添加扩展程序”。3.安装完成后,WebScraper的图标将显示在浏览器顶部工具栏中。本地安装过程无法翻墙的用户可以使用本地安装方式,在本公众号回复「爬虫」可下

环境需求

这个工具对环境的要求非常简单,只需一台能上网的电脑和一个版本号大于31的Chrome浏览器即可。当然,浏览器版本越新越好,目前Chrome浏览器已更新至60多版本,满足要求并不难。

在线安装过程

在线安装需要能够翻墙,访问Chrome应用商店

  1. 在线访问Web Scraper插件页面,点击“添加至Chrome”按钮。

webscraper 最简单的数据抓取教程,人人都用得上2. 在弹出的对话框中点击“添加扩展程序”。

webscraper 最简单的数据抓取教程,人人都用得上3. 安装完成后,Web Scraper的图标将显示在浏览器顶部工具栏中。

webscraper 最简单的数据抓取教程,人人都用得上

本地安装过程

无法翻墙的用户可以使用本地安装方式,在本公众号回复「爬虫」可下载Chrome和Web Scraper扩展插件

  1. 打开Chrome浏览器,在地址栏输入chrome://extensions/,进入扩展程序管理界面,然后将下载好的扩展插件Web-Scraper_v0.3.7.crx拖拽到此页面,点击“添加到扩展程序”即可完成安装。如图:

webscraper 最简单的数据抓取教程,人人都用得上2. 安装完成后,Web Scraper的图标将显示在浏览器顶部工具栏中。

webscraper 最简单的数据抓取教程,人人都用得上

初识Web Scraper

开发人员可以跳过此部分,直接看后面的内容

在Windows系统下,可以使用快捷键F12(某些笔记本可能需要按Fn+F12);

在Mac系统下,可以使用快捷键Command+Option+I;

也可以直接在Chrome界面上操作,点击设置->更多工具->开发者工具。

webscraper 最简单的数据抓取教程,人人都用得上打开后的效果如下,其中绿色框部分是开发者工具的完整界面,红色框部分是Web Scraper区域,我们将在后续操作中使用。

webscraper 最简单的数据抓取教程,人人都用得上注意:如果开发者工具显示在浏览器的右侧区域,需要将其调整到浏览器底部。

webscraper 最简单的数据抓取教程,人人都用得上

原理及功能说明

我们抓取数据通常是为了批量获取信息,而手动操作过于耗时甚至无法完成。例如,抓取微博热门前100条或知乎某个问题的所有答案。

基于这种需求,数据采集通常有两种方式:“我们程序员的方式”和“你们普通人的方式”。

“程序员的方式”是指开发人员根据需求编写爬虫或使用爬虫框架,如Scrapy(Python)、WebMagic(Java)、Crawler4j(Java),视需求复杂程度,编写时间从几小时到几天不等。对于复杂需求,普通人的方式可能不适用。

本文主要介绍“普通人的方式”,即使用Web Scraper工具。其界面简洁、操作简单,且支持导出Excel格式,适合非开发人员快速上手。对于简单需求,开发人员也无需自己编写爬虫,几下鼠标操作比编写代码更快捷。

数据爬取的思路可以概括为:

  1. 通过一个或多个入口地址获取初始数据,如文章列表页或带分页的列表页;
  2. 根据入口页面中的链接进入下一级页面,获取必要信息;
  3. 根据上一级的链接继续进入下一层,获取必要信息(可无限循环)。

接下来,我们正式认识Web Scraper工具。打开开发者工具,切换到Web Scraper标签页,界面分为三个部分:

webscraper 最简单的数据抓取教程,人人都用得上Create new sitemap:sitemap即网站地图,可以理解为入口地址,针对一个网站或需求创建一个sitemap。例如,抓取知乎某个问题的所有回答,就创建一个sitemap,将问题地址设置为Start URL,然后点击“Create Sitemap”。

webscraper 最简单的数据抓取教程,人人都用得上Sitemaps:所有创建过的sitemap的集合,可以在这里查看、修改和进行数据抓取。

webscraper 最简单的数据抓取教程,人人都用得上Sitemap:进入具体的sitemap,可以进行一系列操作,如下图:

webscraper 最简单的数据抓取教程,人人都用得上其中红色框部分的Add new selector是必不可少的步骤。selector即选择器,对应网页上包含我们要收集数据的区域。

一个sitemap下可以有多个selector,每个selector可以包含子selector,一个selector可以只对应一个标题,也可以对应包含标题、副标题、作者信息、内容等的整个区域。

Selectors:查看所有选择器。

Selector graph:查看当前sitemap的拓扑结构图,显示根节点和选择器的层级关系。

Edit metadata:修改sitemap信息,包括标题和起始地址。

Scrape:开始数据抓取工作。

Export data as CSV:以CSV格式导出抓取的数据。

案例实践

简单试水hao123

由浅入深,以一个最简单的例子作为入门

webscraper 最简单的数据抓取教程,人人都用得上操作步骤:

  1. 打开hao123页面,并在页面底部打开开发者工具,定位到Web Scraper标签栏;
  2. 点击“Create Sitemap”;

webscraper 最简单的数据抓取教程,人人都用得上3. 输入sitemap名称和start url,名称为hao123(不支持中文),start url为hao123网址,然后点击“Create Sitemap”;

webscraper 最简单的数据抓取教程,人人都用得上4. Web Scraper自动定位到这个sitemap,点击“Add new selector”添加选择器;

webscraper 最简单的数据抓取教程,人人都用得上5. 给selector指定id(如hot),选择Type为Link,Link类型会自动提取名称和链接两个属性;

webscraper 最简单的数据抓取教程,人人都用得上6. 点击“Select”,在网页上移动光标,选中所需区域(如头条新闻),继续选中其他链接,确保所有相关链接变为红色,然后点击“Done selecting!”,勾选Multiple表示采集多条数据;

webscraper 最简单的数据抓取教程,人人都用得上7. 保存选择器,点击“Element preview”预览选择区域,点击“Data preview”在浏览器中预览抓取的数据,文本框中的内容是xpath,可以手动编写xpath;

完整操作过程如下:

webscraper 最简单的数据抓取教程,人人都用得上8. 操作完成后,可以导出数据。查看Sitemap hao123下的Selector graph,了解拓扑结构图,_root是根selector,包含子selector hot;

webscraper 最简单的数据抓取教程,人人都用得上9. 点击“Scrape”开始抓取数据。

  1. 在Sitemap hao123下的Browse中,通过浏览器直接查看抓取结果;

webscraper 最简单的数据抓取教程,人人都用得上11. 最后,使用“Export data as CSV”以CSV格式导出数据,其中hot列是标题,hot-href列是链接;

webscraper 最简单的数据抓取教程,人人都用得上赶紧尝试一下吧!

抓取知乎问题所有回答

知乎的特点是页面向下滚动才会加载后面的回答

  1. 在Chrome中打开链接(https://www.zhihu.com/question/30692237),调出开发者工具,定位到Web Scraper标签栏;
  2. 点击“Create new sitemap”,填写sitemap名称和start url;

webscraper 最简单的数据抓取教程,人人都用得上3. 开始添加选择器,点击“Add new selector”;

  1. 分析知乎问题的结构,每个回答区域包括昵称、赞同数、回答内容和发布时间等。红色框住的部分是我们要抓取的内容。抓取数据的逻辑是:由入口页进入,获取当前页面已加载的回答,找到回答区域,提取昵称、赞同数、回答内容,依次向下执行,模拟向下滚动鼠标,加载后续部分,循环往复,直到全部加载完毕;

webscraper 最简单的数据抓取教程,人人都用得上5. 内容结构的拓扑图如下,_root根节点下包含多个回答区域,每个区域下包含昵称、赞同数、回答内容;

webscraper 最简单的数据抓取教程,人人都用得上6. 根据拓扑图创建选择器,填写selector id为answer,Type选择Element scroll down。Element适用于大范围区域,包含子元素,回答区域对应Element,Element scroll down适用于下拉加载的情况;

webscraper 最简单的数据抓取教程,人人都用得上7. 点击“Select”,鼠标移动到页面,让绿色框框住一个回答区域后点击鼠标,移动到下一个回答,同样框住后点击鼠标,所有回答区域变成红色框后,点击“Done selecting!”,选择Multiple,保存;

webscraper 最简单的数据抓取教程,人人都用得上8. 点击红色区域,进入answer选择器,创建子选择器;

webscraper 最简单的数据抓取教程,人人都用得上9. 创建昵称选择器,设置id为name,Type为Text,选择昵称部分,保存;

webscraper 最简单的数据抓取教程,人人都用得上10. 创建赞同数选择器;

webscraper 最简单的数据抓取教程,人人都用得上11. 创建内容选择器,由于内容较长且有格式,从下方选择会更方便;

webscraper 最简单的数据抓取教程,人人都用得上12. 执行“Scrape”操作,由于内容较多,可能需要几分钟,如果是测试,可以选择回答数较少的问题。

webscraper 最简单的数据抓取教程,人人都用得上

资源获取

在本公众号内回复「爬虫」,获取Chrome和Web Scraper扩展程序的安装包。在本公众号内回复「sitemap」,获取本文中抓取hao123和知乎的sitemap文本。获取的sitemap是一段json文本,通过“Create new Sitemap”下的“Import Sitemap”,输入获取到的sitemap json串,起个名字,点击导入按钮即可。

webscraper 最简单的数据抓取教程,人人都用得上webscraper 最简单的数据抓取教程,人人都用得上

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
软件教程
相关文章 更多
AE基础教程:如何创建合成并制作关键帧动画
AE基础教程:如何创建合成并制作关键帧动画

本文指导After Effects新手完成从打开软件到制作简单动画的完整流程。内容涵盖新建合成、导入素材、添加关键帧及预览验证,适用于AE基础学习。读者可依据步骤快速完成首个可播放的动效项目。

电影剪辑实战:镜头组织、节奏控制与声音衔接技巧
电影剪辑实战:镜头组织、节奏控制与声音衔接技巧

本文详解电影剪辑核心流程,从素材整理、镜头空间组织到叙事节奏压缩,再到J-cut/L-cut声音衔接技巧。通过粗剪保逻辑、精剪压停顿、反应镜头缓冲及电平统一检查,帮助创作者打造空间清晰、情绪连贯且听感自然的成片。

转场剪辑实战指南:硬切、遮挡与运镜的精准选择与操作技巧
转场剪辑实战指南:硬切、遮挡与运镜的精准选择与操作技巧

本文详解硬切、遮挡转场和运镜转场的适用场景与操作逻辑。通过对比三种转场的核心区别,提供基于素材条件和叙事目的的判断标准,帮助剪辑师避免滥用特效,掌握自然衔接画面的实战技巧。

GitLab新手创建项目并推送第一次提交的操作指南
GitLab新手创建项目并推送第一次提交的操作指南

本文指导GitLab新手完成创建项目并推送第一次提交的最小闭环。涵盖远程项目创建、本地仓库初始化、添加远程地址及执行git push。重点说明HTTPS与SSH认证差异、分支名(master/main)核对及提交验证标准,确保远程仓库真正建立。

抖音拍摄剪辑教程:从竖屏运镜到卡点成片
抖音拍摄剪辑教程:从竖屏运镜到卡点成片

本教程针对抖音竖屏视频制作,涵盖拍摄前构思、稳定运镜、粗剪筛选、音乐卡点及导出检查全流程。重点在于拍摄时预留字幕空间、利用动作节点辅助剪辑,以及通过鼓点对齐画面。适用于新手快速完成第一条完整成片,强调素材质量与节奏自然,避免过度特效与版权风险。

饭圈舞台照修图:降噪、调色与人物突出技巧
饭圈舞台照修图:降噪、调色与人物突出技巧

针对饭圈舞台照光线乱、噪点多、背景抢眼的痛点,本文提供“保脸、控光、突出主体”的修图方案。核心步骤包括:利用Lightroom降噪面板处理高ISO颗粒,控制曝光避免高光死白或脸部死黑;通过压低背景色彩、提升人物亮度与对比度来修正舞台灯光导致的肤色偏差;最后通过裁剪去除杂乱元素,确保人物主体清晰且肤色自然。

Photoshop安装失败或启动异常:系统要求、安装流程与故障排查指南
Photoshop安装失败或启动异常:系统要求、安装流程与故障排查指南

本文提供Photoshop完整安装指南,涵盖Windows/macOS系统要求、Creative Cloud客户端部署及常见启动故障排查。通过安装前磁盘与账号检查、安装中网络监控、安装后功能测试三步法,解决安装中断、登录失败及启动卡顿问题,确保软件稳定可用。

创维电视通过U盘安装第三方软件完整教程:权限设置与故障排查
创维电视通过U盘安装第三方软件完整教程:权限设置与故障排查

本文提供创维电视通过U盘安装第三方APK的完整操作指南。核心步骤包括:准备格式化的U盘与正规APK文件,在酷开系统“应用管理”中找到安装入口,临时开启“允许安装未知来源应用”权限,以及安装后的功能测试与权限关闭。适用于解决电视无法识别U盘、提示解析失败或权限受限等问题,确保安装安全且不影响系统稳定。

Excel筛选大于指定数值:操作步骤与结果验证
Excel筛选大于指定数值:操作步骤与结果验证

本教程演示如何在Excel中筛选大于指定数值的数据。核心步骤包括:确保数据连续、选中表头、通过“开始→排序和筛选”开启筛选,并在“数字筛选”中选择“大于”输入阈值。筛选仅隐藏不符合条件的行,不删除数据。完成后需逐行验证可见数据是否均大于阈值,并可通过取消筛选恢复全部数据。

Creo零基础入门:新建零件与第一次拉伸建模完整指南
Creo零基础入门:新建零件与第一次拉伸建模完整指南

本教程指导Creo初学者完成首个拉伸实体建模。通过新建零件、选择mmns_part_solid模板、定义草绘平面及绘制封闭轮廓,生成三维实体。内容涵盖操作路径、参数设置及常见错误排查,帮助新手建立正确的建模逻辑与单位概念。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。