Ruby实现网页图片抓取
作者:小确幸
时间:2026-06-28
浏览:0
一个Ruby模块封装了网页图片抓取流程:通过Nokogiri解析HTML,遍历141个评论分页,用CSS选择器定位图片并提取src属性,调用download_img方法下载到本地public/meizi/目录,包含异常处理以应对坏链或网络问题,实现了评论区图片的批量自动下载。
在论坛上看到不少人分享爬取图片的脚本,正好有类似的需求,就顺手写了一个。下面这个 Ruby 模块封装了完整的下载流程,核心思路其实很简单:解析页面结构,提取图片链接,然后逐一保存到本地。

module CommonHelper
require 'nokogiri'
require 'open-uri'
def down_load_xmz
site_url = "http://www.xxx.com"
for index_page in 1..141
doc_html = Nokogiri::HTML(open(site_url+'/share/comment-page-'+index_page.to_s))
doc_html.css("#comments p img").each do |item_img|
puts item_img[:src]
download_img(item_img[:src])
end
end
end
########下载图片
def download_img(img_url)
begin
img_file = open(img_url) { |f| f.read }
file_name = img_url.split('/').last
#puts file_name
open("public/meizi/"+file_name, "wb") { |f| f.write(img_file) }
return "/public/meizi/"+file_name
rescue => err
puts err
return ''
end
end
end
从代码结构来看,down_load_xmz 方法负责遍历所有评论分页(一共141页),每页都通过 Nokogiri 解析 HTML,然后用 CSS 选择器定位到评论区域内的图片标签。拿到 src 属性后,直接调用 download_img 方法保存文件。下载部分加了异常处理,遇到坏链或网络问题也不会中断整个流程,这是生产环境中很实用的习惯。注意图片保存路径是 public/meizi/,记得提前建好目录。如果想换其他网站,改一下 site_url 和选择器即可。
作者最新文章
Photoshop抠图教程详细步骤图解:新手入门常用方法与技巧
2026-09-22 14:38
Windows 10
2026-09-16 17:44
Python安装后怎么打开:使用IDLE或命令行启动解释器
2026-09-16 13:54
Windows系统Python安装教程:下载、勾选PATH及环境变量配置
2026-09-16 13:53
“等灯不计时”落地解析:算法善意如何转化为技术能力与生态协同
2026-09-08 18:03
热门文章
更多
精品专题
更多
Mac软件
更多
WINDOWS
更多


































