跳到主要内容
项目档案插件 / 扩展

astonysh/OpenClaw-DeepReeder 插件:用途、安装与配置说明

OpenClaw DeepReader 是 OpenClaw 代理的默认网页内容读取器,支持 X (Twitter)、Reddit、YouTube 及任意网页,自动抓取、清洗并保存为 Markdown 至长期记忆,全程无需 API 密钥或配置。本文详细介绍其安装步骤、使用方法和多平台解析能力。

224PythonStar 于 2026年2月20日2026年9月14日 更新

AI 总结

OpenClaw DeepReader 是 OpenClaw 代理框架的默认网页内容读取插件,支持 X、Reddit、YouTube 及任意网页,零配置自动抓取并转为 Markdown 存入代理长期记忆。

中文项目介绍

OpenClaw DeepReader 是专为 OpenClaw 代理框架设计的默认网页内容读取器。它允许用户通过简单粘贴 URL 的方式,让代理自动获取、解析并保存高质量 Markdown 内容至长期记忆系统,从而无缝扩展代理的知识库。 该项目解决了开发者在为 AI 代理集成网页读取能力时面临的多种挑战:无需手动处理各平台(如 X、Reddit、YouTube)的 API 认证与速率限制,无需编写复杂的网页解析逻辑,也无需担心内容清洗和格式转换。它适用于需要让代理阅读社交媒体帖子、视频转录或网络文章的各类场景,特别适合构建知识密集型或研究辅助型 AI 应用。 从技术实现上看,DeepReader 采用零 API 密钥设计,依赖 FxTwitter API 与 Nitter 回退机制读取 X 内容,利用 Reddit 原生 .json 接口获取帖子与评论,通过 youtube-transcript-api 提取视频转录,并使用 Trafilatura 与 BeautifulSoup 处理通用网页。其模块化架构包含专用解析器、路由协调器和存储管理,还提供 NotebookLM 集成与音频摘要等扩展功能,确保即插即用且易于维护。

详细信息与使用说明

1. 项目定位与用途

OpenClaw DeepReader 是 OpenClaw 代理框架的内置网页内容读取技能,作为默认网关负责将各种 URL 转换为结构化的 Markdown 知识并存入代理的长期记忆。用户只需在对话中粘贴链接,即可触发自动抓取、解析与存储流程,无需任何额外配置或 API 密钥。其核心定位是提供一种无缝、可靠的方式,让 AI 代理能够访问和利用互联网上的公开内容,从而增强其对话上下文和知识储备。

2. 核心功能与支持平台

DeepReader 支持四大类内容来源:X(原 Twitter)包括推文、线程、长文章、引用及媒体,通过 FxTwitter API 结合 Nitter 回退机制实现;Reddit 帖子及评论线程,直接使用 .json 接口获取正文、热门评论及嵌套回复;YouTube 视频转录,依赖 youtube-transcript-api 提取字幕;以及任意网页(博客、文档等),采用 Trafilatura 与 BeautifulSoup 进行内容清洗。所有解析结果统一输出为清洁 Markdown,并附带元数据如互动统计、作者信息等。

3. 安装方式

项目提供两种安装途径。推荐方式是通过 ClawHub 一键安装:执行命令 `npx clawhub@latest install deepreader`,该工具会自动处理依赖并集成至 OpenClaw 环境。手动安装则需克隆仓库 `git clone https://github.com/astonysh/OpenClaw-DeepReeder.git`,进入目录后创建 Python 虚拟环境 `python3 -m venv .venv && source .venv/bin/activate`,最后运行 `pip install -e .` 完成可编辑模式安装。仓库要求 Python 版本不低于 3.10。

4. 使用方式

使用 DeepReader 只需导入 `run` 函数并传入 URL 字符串。例如:`from deepreader_skill import run; result = run("https://x.com/user/status/123")` 将读取推文并保存至记忆。函数支持单条或批量 URL(用换行或空格分隔),并可选传递参数如 `--notebooklm` 上传至 NotebookLM 或 `--audio` 生成音频概述。解析结果会以 Markdown 形式存储,并可通过 OpenClaw 的记忆系统后续检索。

5. 技术架构与实现

项目采用模块化设计,核心包 `deepreader_skill` 包含多个子模块:`parsers` 目录下为各平台专用解析器(twitter.py、reddit.py、youtube.py、generic.py),均继承自基础解析类;`core` 模块提供路由器(router.py)根据域名分发请求,以及存储管理(storage.py)负责 Markdown 持久化;`integrations` 包含外部服务适配如 notebooklm.py。依赖库涵盖内容提取(trafilatura)、网络请求(requests)、HTML 处理(lxml、beautifulsoup4)及 Pydantic 设置管理,确保健壮性与可维护性。

6. 扩展功能与集成

除基础内容读取外,DeepReader 还支持与 Google NotebookLM 集成,通过 `--notebooklm` 标志可将解析后的 Markdown 上传为数据源,便于在 NotebookLM 中进行进一步分析。同时,`--audio` 或 `--podcast` 参数可触发音频概述生成,为内容添加听觉维度。这些扩展功能通过 `integrations/notebooklm.py` 模块实现,依赖 `notebooklm-py` 库,展示了项目在知识管理工具链中的可扩展性。

思维导图

OpenClaw DeepReader
解析器 (parsers)
Twitter/X
Reddit
YouTube
通用网页
核心模块 (core)
路由器
存储管理
工具函数
集成 (integrations)
NotebookLM
配置与清单
manifest.json
SKILL.md

常见问题

DeepReader 是什么?如何工作?

DeepReader 是 OpenClaw 代理的网页内容读取插件,通过解析用户提供的 URL,自动抓取网页内容、清洗为 Markdown 格式,并存入代理的长期记忆系统,整个过程无需人工干预。

支持哪些网站?是否需要 API 密钥?

支持 X (Twitter)、Reddit、YouTube 及任意网页;所有功能均无需 API 密钥,使用公开接口或开源库(如 FxTwitter、Reddit .json API、youtube-transcript-api)实现零认证访问。

如何安装和使用 DeepReader?

安装可通过 `npx clawhub@latest install deepreader` 一键完成,或手动克隆仓库后运行 `pip install -e .`。使用只需 `from deepreader_skill import run` 并传入 URL 字符串,支持批量处理和 `--notebooklm`、`--audio` 等可选参数。

解析的内容如何保存到 OpenClaw 记忆?

DeepReader 解析生成的 Markdown 会通过核心存储模块自动写入 OpenClaw 的长期记忆系统,后续代理可在对话中检索和引用这些内容,形成持续知识积累。

是否支持 NotebookLM 或音频生成?

支持。添加 `--notebooklm` 参数可将内容上传至 Google NotebookLM 作为数据源;使用 `--audio` 或 `--podcast` 参数可生成音频概述,这些功能通过 integrations/notebooklm.py 模块实现。