1. 项目定位与用途
Claw-Eval 是一个专为大语言模型(LLM)自主智能体设计的评测框架(evaluation harness),旨在提供可信、可复现的智能体能力评估。项目包含 300 个人类验证的真实场景任务,覆盖通信、金融、运营、生产力等 9 个领域,通过标准化的评估流程和多维度评分体系,衡量智能体在完成度、安全性和鲁棒性方面的表现。框架以 CLI 工具形式提供,支持批量并行执行,并公开 leaderboard 和数据集,推动智能体评估领域的标准化发展。其核心价值在于消除'幸运跑'偏差,确保评估结果反映模型的真实能力而非随机波动。
2. 解决的问题
Claw-Eval 主要解决 LLM 智能体评估中的三大挑战:一是偶然成功问题,传统单次运行评估可能因运气导致结果不可靠,项目引入 Pass^3 方法,要求模型在三次独立试验中均通过任务才算成功,有效消除随机性;二是评估维度单一问题,框架从完成度、安全性、鲁棒性三个维度进行全轨迹审计,提供全面能力画像;三是可复现性不足问题,通过 Docker 沙盒隔离、标准化任务配置和手动重试机制(应对 API 不稳定),确保所有 leaderboard 结果可被社区验证。此外,人类验证的任务和评分标准(rubrics)避免了自动生成评估标准的偏差。
3. 适用场景
Claw-Eval 适用于多种 AI 智能体评估场景:一是研究机构与公司研发团队需要系统化 benchmark 来比较不同 LLM 或智能体架构在真实个人助理任务上的表现;二是多模态能力测试,框架包含 101 个多模态任务,涵盖网页生成、视频问答、文档提取等感知与创作类任务;三是对话智能体鲁棒性分析,38 个多轮次任务通过模拟用户人格测试智能体在澄清、咨询等交互中的稳定性;四是安全性与合规性验证,通过设计涉及敏感操作的任务评估智能体是否避免有害或未授权行为;五是教学与竞赛场景,标准化任务和清晰评分标准适合用于 AI 课程实验或智能体编程挑战赛。
4. 安装方式
根据仓库信息,Claw-Eval 推荐使用 uv 进行依赖管理和虚拟环境创建。具体步骤为:首先安装 uv(pip install uv),然后创建 Python 3.11 虚拟环境(uv venv --python 3.11),激活环境(source .venv/bin/activate)。接下来需要配置环境变量:设置 OPENROUTER_API_KEY 用于模型调用,若任务需要真实网络搜索则还需设置 SERP_DEV_KEY。最后运行准备脚本 bash scripts/test_sandbox.sh 完成环境检查与沙盒初始化。项目依赖由 pyproject.toml 和 requirements.txt 明确指定,包括核心库(pydantic、pyyaml、openai、httpx)、Mock 服务(fastapi、uvicorn)和 Docker 支持。注意:视频相关任务的文件需从 Hugging Face 单独获取,因 GitHub 仓库受文件大小限制未包含。
5. 使用方式
Claw-Eval 通过命令行工具 claw-eval 执行评估。核心用法为:claw-eval batch --config <模型配置> --sandbox --trials 3 --parallel <并行数>,其中 --config 指定模型配置文件(如 model_configs/claude_opus_46.yaml),--sandbox 启用 Docker 沙盒隔离,--trials 3 对应 Pass^3 方法的三次独立试验,--parallel 控制并行任务数以提高效率。用户可访问 https://claw-eval.github.io 查看完整 leaderboard 和单个任务案例分析。数据集可在 Hugging Face 的 claw-eval/Claw-Eval 下载,包含任务 ID、查询、所需 fixture 文件、语言和类别等信息。框架支持自定义任务扩展,每个任务由 YAML 配置文件和 Python 评分器类定义,便于社区贡献新任务。
6. 补充说明或实现特点
Claw-Eval 在实现上具有几个关键特点:一是严格的评估逻辑,自 2026 年 3 月起采用 Pass^3 作为主要指标,并要求三次运行全部成功才算通过,同时手动重试机制处理网络或 API 错误以确保恰好生成三条轨迹;二是模块化架构,代码组织为 graders(评分逻辑,含 LLM 裁判和视觉评分器)、models(数据模型如任务定义、轨迹消息)、runner(执行协调,管理任务加载、模型调用、沙盒启动)、sandbox(Docker 隔离,管理容器生命周期和文件挂载)和 tasks(具体任务配置)五大模块,关注点分离;三是任务与评分逻辑分离,每个任务独立包含 YAML 配置和 Python grader 类,便于扩展;四是支持多模态和对话任务,通过混入类(MultimodalGraderMixin)和用户模拟器实现;五是强调可复现性,代码库正在审计以确保所有 leaderboard 结果可被社区验证。