Ruby实现网页图片抓取
作者:小确幸
时间:2026-06-28
来源:互联网
浏览:0
一个Ruby模块封装了网页图片抓取流程:通过Nokogiri解析HTML,遍历141个评论分页,用CSS选择器定位图片并提取src属性,调用download_img方法下载到本地public/meizi/目录,包含异常处理以应对坏链或网络问题,实现了评论区图片的批量自动下载。
在论坛上看到不少人分享爬取图片的脚本,正好有类似的需求,就顺手写了一个。下面这个 Ruby 模块封装了完整的下载流程,核心思路其实很简单:解析页面结构,提取图片链接,然后逐一保存到本地。

module CommonHelper
require 'nokogiri'
require 'open-uri'
def down_load_xmz
site_url = "http://www.xxx.com"
for index_page in 1..141
doc_html = Nokogiri::HTML(open(site_url+'/share/comment-page-'+index_page.to_s))
doc_html.css("#comments p img").each do |item_img|
puts item_img[:src]
download_img(item_img[:src])
end
end
end
########下载图片
def download_img(img_url)
begin
img_file = open(img_url) { |f| f.read }
file_name = img_url.split('/').last
#puts file_name
open("public/meizi/"+file_name, "wb") { |f| f.write(img_file) }
return "/public/meizi/"+file_name
rescue => err
puts err
return ''
end
end
end
从代码结构来看,down_load_xmz 方法负责遍历所有评论分页(一共141页),每页都通过 Nokogiri 解析 HTML,然后用 CSS 选择器定位到评论区域内的图片标签。拿到 src 属性后,直接调用 download_img 方法保存文件。下载部分加了异常处理,遇到坏链或网络问题也不会中断整个流程,这是生产环境中很实用的习惯。注意图片保存路径是 public/meizi/,记得提前建好目录。如果想换其他网站,改一下 site_url 和选择器即可。
作者最新文章
Windows 10
2026-09-16 17:44
Python安装后怎么打开:使用IDLE或命令行启动解释器
2026-09-16 13:54
Windows系统Python安装教程:下载、勾选PATH及环境变量配置
2026-09-16 13:53
“等灯不计时”落地解析:算法善意如何转化为技术能力与生态协同
2026-09-08 18:03
英伟达推出NVHBM:定制HBM带宽提升30%并扩展NVLink Fusion生态
2026-09-08 17:31
热门文章
更多
精品专题
更多
Mac软件
更多
WINDOWS
更多
Windows 10
Windows
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式
Windows/macOS/Linux
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















