跳到主要内容
项目档案插件 / 扩展

LeoYeAI/openclaw-ultra-scraping 插件:用途、安装与配置说明

LeoYeAI/openclaw-ultra-scraping:OpenClaw Ultra Scraping 是为 OpenClaw AI 代理设计的自适应网络爬虫技能,提供反爬虫绕过、动态渲染和并发爬取能本页整理它解决什么问题、适用场景、安装方式和使用方法。

23PythonStar 于 2026年3月10日2026年9月15日 更新

AI 总结

OpenClaw Ultra Scraping 是为 OpenClaw AI 代理设计的自适应网络爬虫技能,提供反爬虫绕过、动态渲染和并发爬取能力,帮助 AI 稳定高效地获取网页数据。

中文项目介绍

OpenClaw Ultra Scraping 是一个专为 OpenClaw AI 代理开发的开源爬虫技能,旨在解决网络数据提取中的常见难题。它通过内置的反爬虫绕过机制(如处理 Cloudflare、Turnstile)和自适应元素跟踪技术,使爬取过程能抵御网站改版带来的选择器失效问题。该技能支持并发爬取、代理轮换、JavaScript 渲染(SPA)以及多种数据提取方式(CSS、XPath、文本搜索),适用于电商产品抓取、链接收集、新闻文章提取等多种场景。用户可通过 ClawHub 一键安装或手动部署,并采用自然语言指令、CLI 工具或 Python API 进行灵活操作。

详细信息与使用说明

1. 项目定位与用途

OpenClaw Ultra Scraping 是 OpenClaw 生态中的一个核心技能插件,定位为 AI 代理的 Web 数据获取增强工具。它并非独立应用,而是作为 OpenClaw 代理的能力扩展,使 AI 助手能直接执行复杂的网络爬取任务。主要用途是让用户通过自然语言或脚本命令,即可完成从静态页面到动态 SPA 的各种数据提取,无需手动处理反爬机制或网站结构变化,从而将爬虫能力无缝集成到 AI 工作流中。

2. 解决的问题

该项目主要解决四大爬虫痛点:一是反爬虫机制阻止,通过 StealthyFetcher 内置指纹伪装和挑战解决(如 Cloudflare Turnstile)实现绕过;二是网站改版导致选择器失效,采用自适应元素跟踪,通过保存和匹配元素特征来维持提取稳定性;三是动态页面内容提取困难,集成 DynamicFetcher 支持无头浏览器渲染 JavaScript;四是大规模爬取效率低下,提供并发控制、暂停/恢复和代理轮转功能,提升爬取吞吐量与鲁棒性。

3. 适用场景

适用场景包括:电商产品信息抓取(如“Scrape the top 10 products from example.com”)、全网链接收集(如“Extract all links from this page”)、新闻媒体文章爬取(如“Crawl this site and grab all article titles”)以及受防护站点数据获取(如“Get the data from this Cloudflare-protected page”)。尤其适合需要长期监控、网站频繁改版或存在严格反爬措施的站点,也适用于需要渲染 JavaScript 的单页应用(SPA)数据提取。

4. 安装方式

安装方式有两种,均基于仓库中明确的步骤:推荐通过 ClawHub 一键安装,在终端执行 `clawhub install openclaw-ultra-scraping` 即可自动完成部署。手动安装需将仓库克隆至 OpenClaw 技能目录 `~/.openclaw/workspace/skills/openclaw-ultra-scraping`,然后运行 `bash ~/.openclaw/workspace/skills/openclaw-ultra-scraping/scripts/setup.sh` 以安装 Python 依赖及配置无头浏览器环境。仓库中未提及 Docker 或 pip 直接安装等其他方式。

5. 使用方式

使用方式涵盖三层:自然语言指令,直接向 OpenClaw 代理下达如“Scrape the top 10 products from example.com”等任务;CLI 工具,通过 `scripts/scrape.py` 执行 fetch/crawl/links 等命令,支持 `--css`、`--stealth`、`--dynamic`、`--solve-cloudflare`、`--depth`、`--concurrency` 等参数,并可输出 json/jsonl/csv/text/markdown/html 格式;Python API,在自定义脚本中导入 `scrapling.fetchers` 的 `Fetcher`、`StealthyFetcher`、`DynamicFetcher` 类进行编程式爬取,并可使用 `adaptive=True` 或 `auto_save=True` 启用自适应跟踪。

6. 补充说明与实现特点

项目核心是分层抓取器架构:`Fetcher` 用于普通站点,`DynamicFetcher` 用于 JS 渲染 SPAs,`StealthyFetcher` 用于反爬保护站点,对应 CLI 的默认/`--dynamic`/`--stealth` 标志。自适应元素跟踪通过保存元素指纹(如类名、属性、文本模式)并在后续运行中匹配来实现,即使 HTML 结构变化也能定位目标。反爬虫引擎集成多种绕过策略,包括请求头伪装、浏览器指纹模拟和挑战自动解决。所有功能均封装在 `scrapling` 包中,CLI 入口为 `scripts/scrape.py`,安装脚本 `scripts/setup.sh` 负责环境准备。仓库中未明确说明支持的 Python 具体版本或浏览器依赖细节,但证据指向 Python 3.10+ 及常见无头浏览器(如 Playwright 或 Selenium)。

思维导图

OpenClaw Ultra Scraping
核心功能
反爬虫绕过
自适应元素跟踪
并发爬取与代理轮换
JavaScript 渲染
多选择器支持(CSS/XPath/文本)
安装部署
ClawHub 一键安装
手动克隆 + setup.sh
使用方式
自然语言指令(OpenClaw 代理)
CLI 工具(scrape.py)
Python API(scrapling.fetchers)
技术架构
分层抓取器(Fetcher/Stealthy/Dynamic)
自适应跟踪引擎
反爬虫绕过引擎
输出格式多样化(json/csv/markdown 等)

常见问题

如何安装 OpenClaw Ultra Scraping?

推荐通过 ClawHub 一键安装:运行 `clawhub install openclaw-ultra-scraping`。或手动克隆仓库至 `~/.openclaw/workspace/skills/openclaw-ultra-scraping` 后执行 `bash scripts/setup.sh` 安装依赖及浏览器。

如何绕过 Cloudflare 等反爬机制?

使用 `StealthyFetcher`,在 CLI 中添加 `--stealth` 和 `--solve-cloudflare` 参数,或在 Python API 中调用 `StealthyFetcher.fetch(url, solve_cloudflare=True)`。该抓取器内置指纹伪装和挑战解决能力。

是否支持 JavaScript 渲染的页面?

支持。使用 `DynamicFetcher`,在 CLI 中添加 `--dynamic` 参数,或在 Python API 中调用 `DynamicFetcher.fetch(url, headless=True)`。它会启动无头浏览器完整渲染 SPA 内容。

网站改版后如何保证选择器依然有效?

启用自适应元素跟踪:首次提取时使用 `auto_save=True` 保存元素指纹,后续使用 `adaptive=True` 即可通过特征匹配定位元素,即使 HTML 结构变化也能稳定提取。

支持哪些数据输出格式?

CLI 工具支持多种输出格式,通过 `-f` 参数指定,包括 json、jsonl、csv、text、markdown、html。Python API 返回结构化对象,可自行序列化为所需格式。