跳到主要内容
使用场景14 个项目合计 ★ 442,932平均 ★ 31,638

适合网页数据采集的开源项目

用于爬虫开发、数据抓取、网页解析、反爬对抗的工具和框架。

语言构成Python · 9JavaScript · 2TypeScript · 1Go · 1Astro · 1

高星代表

这个分组里最值得先看的 3

按 Star 数排序

项目列表按 stars 从高到低

firecrawl
firecrawl

Firecrawl 是一个专为 AI 应用设计的 Web 数据 API 服务,提供搜索、抓取和交互功能,自动处理 JS 渲染、代理轮换和速率限制,输出清洁的 Markdown 或结构化 JSON,帮助开发者高效获取网页数据。

182.2kTypeScript
Panniantong
Agent-Reach

Agent Reach 是一个为 AI Agent 提供免 API 费用互联网访问能力的开源 CLI 工具,支持读取和搜索 Twitter、Reddit、YouTube、GitHub、Bilibili、小红书等十多个平台。

83.3kPython
D4Vinci
Scrapling

Scrapling 是一个自适应 Web Scraping 框架,通过智能解析和反爬虫绕过技术,简化从单页抓取到大规模爬虫的各种任务,显著降低开发与维护成本。

82.3kPython
dgtlmoon
changedetection.io

changedetection.io 是一个开源的网站变化检测与监控平台,可自动跟踪网页内容更新并通过多种渠道发送实时警报,适用于价格追踪、库存监控及内容更新监测等场景。

34.4kPython
ScrapeGraphAI
Scrapegraph-ai

基于 AI 与图逻辑的 Python 网络爬虫库,利用大语言模型自动构建抓取流程,从网站及多种文档格式中提取指定信息,实现“只抓一次”的智能化数据采集。

31.1kPython
jo-inc
camofox-browser

camofox-browser 是基于 Camoufox 引擎的反检测浏览器自动化服务器,专为 AI 代理设计,通过 C++ 级指纹伪装绕过网站检测,提供 REST API 和 OpenClaw 插件支持,具有 token 效率高、内存占用低的特点。

11.1kJavaScript
zubair-trabzada
geo-seo-claude

geo-seo-claude 是一款专为 Claude Code 设计的生成式搜索引擎优化(GEO)插件,通过自动化审计、可引用性评分和结构化数据优化,帮助网站在 AI 驱动搜索引擎(如 ChatGPT、Perplexity)中提升可见度,捕获高转化率的 AI 推荐流量。

10.7kPython
Mathieu2301
TradingView-API

@mathieuc/tradingview 是 TradingView 的非官方 Node.js 库,封装其私有接口能力,可便捷获取实时行情、技术指标、用户绘图等数据,适用于交易机器人、行情告警、策略回测等开发场景。

5.1kJavaScript
sardanioss
httpcloak

httpcloak 是一个多语言 HTTP 客户端库,通过精确模拟 Chrome、Firefox、Safari 等浏览器的 TLS 握手、HTTP/2、HTTP/3 及头部指纹,绕过基于加密和协议层特征的机器人检测。

1.3kGo
ythx-101
x-tweet-fetcher

x-tweet-fetcher 是一个智能路由的 X/Twitter 内容获取 CLI 工具,无需 API 密钥,通过 Nitter 和 Playwright 双后端自动回退,为 AI 代理、自动化监控等场景提供稳定、高效的结构化数据获取方案。

964Python
BrikerMan
skilless.ai

Skilless.ai 是为 AI 代理提供实时数据能力的插件系统,通过一键安装实现网络搜索、网页解析、视频处理等功能,使 AI 能够自主访问和操作真实世界数据。

227Astro
grisuno
LazyOwn

LazyOwn 是一个专业红队框架,集成 333+ 攻击技术,支持 Windows/Linux/macOS 多平台,提供 AI 驱动的 C&C、隐蔽 rootkit 和模块化自动化引擎,适用于红队演练与 APT 模拟。

227Python
LeoYeAI
openclaw-ultra-scraping

OpenClaw Ultra Scraping 是为 OpenClaw AI 代理设计的自适应网络爬虫技能,提供反爬虫绕过、动态渲染和并发爬取能力,帮助 AI 稳定高效地获取网页数据。

23Python
DevBD1
skills

OpenClaw Scrapling MCP 技能是一个专为 web scraping 设计的插件,提供从基础食谱到高级反爬策略的完整指导体系,通过 Scrapling 库的 MCP 服务器实现高效稳定的数据提取,显著降低爬虫开发复杂度。

15Python

同级导航