跳到主要内容
项目档案应用项目

ClawWork AI 同事系统:基于 GDPVal 经济基准测试评估 AI 代理真实工作能力与安装使用指南

ClawWork 将 AI 助手转变为能完成 220 个专业任务的 AI 同事,通过经济基准测试衡量工作质量、成本效率和生存能力。支持多模型竞技场对比,提供实时仪表板查看收入、成本和质量指标。本文详解项目定位、安装步骤、使用方法及技术实现。

8,549PythonStar 于 2026年2月16日2026年9月19日 更新

AI 总结

ClawWork 是一个将 AI 助手转变为能完成真实专业任务的 AI 同事系统,基于 GDPVal 经济基准测试衡量工作质量、成本效率与长期生存能力,支持多模型竞技场对比。

中文项目介绍

ClawWork 旨在将传统的 AI 助手升级为能创造真实经济价值的 AI 同事。它通过让 AI 代理完成来自 GDPVal 数据集的 220 个专业任务(覆盖 44 种职业),在受控的经济环境中测试其实际工作能力:代理需赚取收入、支付 API 调用成本,并维持长期偿付能力。这解决了传统 AI 基准测试仅关注技术指标而无法衡量生产环境经济价值的问题。 系统适用于三类场景:一是对比不同 AI 模型(如 GPT、Claude、Qwen、Kimi)在真实任务中的工作质量与成本效率;二是验证 AI 在财务、医疗、法律、工程等具体职业中的实用能力;三是进行经济生存基准测试,评估 AI 代理在给定预算下的长期可行性。技术实现上,项目包含核心代理集成层(ClawMode)、基于 LLM 的评估系统、实时数据仪表板,以及经济跟踪、任务自动分类等关键组件。

详细信息与使用说明

1. 项目定位与用途

ClawWork 是一个将 AI 助手转变为能完成真实工作任务的 AI 同事的系统。其核心定位是提供一个经济基准测试框架,通过让 AI 代理完成来自 GDPVal 数据集的 220 个专业任务(涵盖 44 种经济部门,如技术、金融、医疗、法律等),衡量其在生产环境中创造的真实经济价值。用途包括:作为 AI 代理性能评估与竞赛平台,对比不同模型的实际工作表现;作为 AI coworker 能力验证工具,测试 AI 在多种职业中的实用技能;以及作为经济生存基准,评估 AI 在预算约束下的长期可行性。项目提供实时仪表板展示代理的收入、成本、支付率和质量评分,并支持多模型竞技场排名。

2. 解决的问题

ClawWork 解决了传统 AI 基准测试无法客观评估生产环境经济价值的问题。现有基准通常关注技术指标(如准确率、推理速度),但忽略了工作质量、成本效率和长期生存能力这三个生产关键维度。本系统通过模拟真实经济环境:要求 AI 代理完成专业任务赚取收入、自动扣除 API 调用 token 成本、并维持账户余额不为负,从而全面衡量 AI 作为‘同事’的实际价值。此外,它解决了跨模型公平对比的难题,通过统一任务集和经济规则,让不同 AI 模型在相同条件下竞争,确定‘AI 工人冠军’。

3. 适用场景

ClawWork 主要适用于三类场景:1) AI 代理性能评估与竞赛:研究者和开发者可对比不同基础模型(如 GPT、Claude、Qwen、Kimi、GLM)在相同专业任务上的产出质量、成本效率和收入能力;2) AI coworker 能力验证:企业或团队可测试 AI 在具体职业(如会计师、工程师、律师、客服代表)中的实际工作能力,评估其自动化潜力;3) 经济生存基准测试:学术研究可用于分析 AI 代理在资源约束下的长期经济可行性,探索自主 AI 系统的可持续性。项目还支持通过 nanobot 集成将 AI coworker 部署到 Telegram/Discord 等聊天平台,提供按需付费任务服务。

4. 安装方式

根据仓库信息,安装步骤如下:1) 克隆仓库到本地:git clone https://github.com/HKUDS/ClawWork.git;2) 配置环境变量:复制 .env.example 为 .env,并填写所需 API 密钥,至少包括 OPENAI_API_KEY(代理模型)、EVALUATION_API_KEY(评估模型,推荐 OpenAI)、TAVILY_API_KEY(网页搜索)等;3) 安装 Python 依赖:pip install -r requirements.txt,依赖包括 FastAPI、LangChain、pandas、tavily-python、e2b-code-interpreter 等;4) 启动本地仪表板:运行 ./start_dashboard.sh 脚本(或手动启动前后端),默认访问 http://localhost:3000。注意:项目要求 Python 3.10+,并需确保各 API 服务可用。

5. 使用方式

安装完成后,主要使用方式包括:1) 查看实时仪表板:启动后访问前端(默认 localhost:3000),可查看各 AI 代理的经济表现排行榜,包括余额、总收入、成本、每小时支付率和平均质量评分,数据实时更新;2) 运行自定义代理:使用命令 python -m clawmode_integration.cli agent 启动代理循环,支持集成 Telegram、Discord 或 CLI 接口;3) 触发按需付费任务:若集成 nanobot 网关,可通过 /clawwork <指令> 命令分配任务,系统自动使用 TaskClassifier 识别职业类别并基于 BLS 工资数据估算最大支付额;4) 本地数据同步:代理运行产生的数据(如 task_completions.jsonl)会定期同步至仓库,仪表板直接读取本地文件以即时更新。

6. 补充说明与实现特点

项目实现上具有以下关键特点:经济跟踪机制采用 TrackedProvider 包装器,监控每次 LLM 调用的输入/输出 token 数量,并从代理余额中实时扣费,支持 OpenRouter 报告的成本;任务价值估算由 TaskClassifier 完成,基于 40+ 职业类别和 BLS 工资数据自动分类任务并计算最大支付额;多模型支持允许代理和评估器使用不同 API 提供商(如 OpenAI、SiliconFlow),评估器默认使用 gpt-4o 以保证评分一致性;实时数据流通过 WebSocket 连接实现仪表板对余额、收入、质量指标的即时更新;评估系统基于 LLM 为 44 个任务类别生成 0-10 分的元提示,自动对代理工作成果进行评分。注意:具体代理运行配置和详细集成步骤需参考 clawmode_integration/README.md 等子模块文档。

思维导图

ClawWork
核心集成层
ClawMode 代理循环
TaskClassifier 任务分类
TrackedProvider 成本跟踪
Nanobot 网关集成
评估系统
元提示生成
LLM 工作评分
44 职业类别
前端仪表板
实时排行榜
经济曲线可视化
质量指标监控
基准测试配置
GDPVal 220 任务
经济参数(余额/定价)
多模型竞技场

常见问题

ClawWork 如何评估 AI 代理的经济价值?

通过 GDPVal 数据集的 220 个专业任务,让代理赚取收入、自动扣除 API 调用 token 成本,并维持账户偿付能力,综合衡量工作质量、成本效率和长期生存能力。

项目支持哪些 AI 模型?

支持 GLM、Kimi、Qwen、Gemini、Claude 等多种模型,通过多模型竞技场在相同任务和 economic 规则下对比实际工作表现,排行榜实时更新。

如何安装和运行 ClawWork?

克隆仓库后复制 .env.example 为 .env 并配置 API 密钥(OpenAI、Tavily 等),pip 安装 requirements.txt 依赖,最后运行 ./start_dashboard.sh 启动本地仪表板。

什么是 /clawwork 命令?有什么作用?

/clawwork 是集成 nanobot 网关的按需付费任务命令,用户发送指令后,系统自动使用 TaskClassifier 识别职业类别、基于 BLS 工资估算最大支付额,并分配给 AI 代理执行。

数据更新和仪表板显示机制是怎样的?

代理运行产生的数据(如 task_completions.jsonl)会定期同步至仓库;仪表板直接读取本地数据文件,通过 WebSocket 实现余额、收入、质量指标的实时更新,无需手动刷新。