1. 项目定位与用途
OpenClaw DeepReader 是 OpenClaw 代理框架的内置网页内容读取技能,作为默认网关负责将各种 URL 转换为结构化的 Markdown 知识并存入代理的长期记忆。用户只需在对话中粘贴链接,即可触发自动抓取、解析与存储流程,无需任何额外配置或 API 密钥。其核心定位是提供一种无缝、可靠的方式,让 AI 代理能够访问和利用互联网上的公开内容,从而增强其对话上下文和知识储备。
OpenClaw DeepReader 是 OpenClaw 代理的默认网页内容读取器,支持 X (Twitter)、Reddit、YouTube 及任意网页,自动抓取、清洗并保存为 Markdown 至长期记忆,全程无需 API 密钥或配置。本文详细介绍其安装步骤、使用方法和多平台解析能力。
OpenClaw DeepReader 是 OpenClaw 代理框架的默认网页内容读取插件,支持 X、Reddit、YouTube 及任意网页,零配置自动抓取并转为 Markdown 存入代理长期记忆。
OpenClaw DeepReader 是 OpenClaw 代理框架的内置网页内容读取技能,作为默认网关负责将各种 URL 转换为结构化的 Markdown 知识并存入代理的长期记忆。用户只需在对话中粘贴链接,即可触发自动抓取、解析与存储流程,无需任何额外配置或 API 密钥。其核心定位是提供一种无缝、可靠的方式,让 AI 代理能够访问和利用互联网上的公开内容,从而增强其对话上下文和知识储备。
DeepReader 支持四大类内容来源:X(原 Twitter)包括推文、线程、长文章、引用及媒体,通过 FxTwitter API 结合 Nitter 回退机制实现;Reddit 帖子及评论线程,直接使用 .json 接口获取正文、热门评论及嵌套回复;YouTube 视频转录,依赖 youtube-transcript-api 提取字幕;以及任意网页(博客、文档等),采用 Trafilatura 与 BeautifulSoup 进行内容清洗。所有解析结果统一输出为清洁 Markdown,并附带元数据如互动统计、作者信息等。
项目提供两种安装途径。推荐方式是通过 ClawHub 一键安装:执行命令 `npx clawhub@latest install deepreader`,该工具会自动处理依赖并集成至 OpenClaw 环境。手动安装则需克隆仓库 `git clone https://github.com/astonysh/OpenClaw-DeepReeder.git`,进入目录后创建 Python 虚拟环境 `python3 -m venv .venv && source .venv/bin/activate`,最后运行 `pip install -e .` 完成可编辑模式安装。仓库要求 Python 版本不低于 3.10。
使用 DeepReader 只需导入 `run` 函数并传入 URL 字符串。例如:`from deepreader_skill import run; result = run("https://x.com/user/status/123")` 将读取推文并保存至记忆。函数支持单条或批量 URL(用换行或空格分隔),并可选传递参数如 `--notebooklm` 上传至 NotebookLM 或 `--audio` 生成音频概述。解析结果会以 Markdown 形式存储,并可通过 OpenClaw 的记忆系统后续检索。
项目采用模块化设计,核心包 `deepreader_skill` 包含多个子模块:`parsers` 目录下为各平台专用解析器(twitter.py、reddit.py、youtube.py、generic.py),均继承自基础解析类;`core` 模块提供路由器(router.py)根据域名分发请求,以及存储管理(storage.py)负责 Markdown 持久化;`integrations` 包含外部服务适配如 notebooklm.py。依赖库涵盖内容提取(trafilatura)、网络请求(requests)、HTML 处理(lxml、beautifulsoup4)及 Pydantic 设置管理,确保健壮性与可维护性。
除基础内容读取外,DeepReader 还支持与 Google NotebookLM 集成,通过 `--notebooklm` 标志可将解析后的 Markdown 上传为数据源,便于在 NotebookLM 中进行进一步分析。同时,`--audio` 或 `--podcast` 参数可触发音频概述生成,为内容添加听觉维度。这些扩展功能通过 `integrations/notebooklm.py` 模块实现,依赖 `notebooklm-py` 库,展示了项目在知识管理工具链中的可扩展性。
DeepReader 是 OpenClaw 代理的网页内容读取插件,通过解析用户提供的 URL,自动抓取网页内容、清洗为 Markdown 格式,并存入代理的长期记忆系统,整个过程无需人工干预。
支持 X (Twitter)、Reddit、YouTube 及任意网页;所有功能均无需 API 密钥,使用公开接口或开源库(如 FxTwitter、Reddit .json API、youtube-transcript-api)实现零认证访问。
安装可通过 `npx clawhub@latest install deepreader` 一键完成,或手动克隆仓库后运行 `pip install -e .`。使用只需 `from deepreader_skill import run` 并传入 URL 字符串,支持批量处理和 `--notebooklm`、`--audio` 等可选参数。
DeepReader 解析生成的 Markdown 会通过核心存储模块自动写入 OpenClaw 的长期记忆系统,后续代理可在对话中检索和引用这些内容,形成持续知识积累。
支持。添加 `--notebooklm` 参数可将内容上传至 Google NotebookLM 作为数据源;使用 `--audio` 或 `--podcast` 参数可生成音频概述,这些功能通过 integrations/notebooklm.py 模块实现。