跳到主要内容
项目档案命令行工具

Claw-Eval 是什么:LLM 智能体评测框架 | 300 个人类验证任务,Pass^3 评估方法,安装使用指南

Claw-Eval 是一个专为评估大语言模型自主智能体设计的评测框架,包含 300 个人类验证的真实场景任务,采用 Pass^3 三次独立试验方法确保评估可靠。本页提供项目定位、解决的问题、适用场景、详细安装步骤、命令行使用方式以及架构实现特点,帮助开发者快速上手评估 AI 智能体在完成度、安全性、鲁棒性方面的表现。

773PythonStar 于 2026年3月18日2026年9月11日 更新

AI 总结

Claw-Eval 是一个专为评估大语言模型自主智能体而设计的评测框架,包含 300 个人类验证的真实场景任务,采用 Pass^3 三次独立试验方法确保评估结果可靠可信。

中文项目介绍

Claw-Eval 是一个专业的 LLM 智能体评测框架,旨在评估大语言模型作为自主智能体在真实场景中的表现。 它解决了传统智能体评估中偶然成功导致的可靠性问题,通过 300 个人类严格验证的任务和 Pass^3 评估方法(要求模型在三次独立试验中均通过才算成功)确保结果可信。 框架涵盖 9 个任务类别,包括通用、多模态和对话三大 splits,从完成度、安全性、鲁棒性三个维度对智能体进行全面评分。 适用场景包括:评估 AI 智能体在个人助理任务中的表现、测试多模态能力如网页生成和视频问答、分析对话智能体在模拟用户环境中的鲁棒性。 技术实现上,Claw-Eval 采用 CLI 工具形式,基于 Docker 提供沙盒隔离环境,模块化设计包含 graders(评分器)、models(数据模型)、runner(执行协调)、sandbox(沙盒管理)和 tasks(任务配置)五大核心模块,支持端到端可复现的批量并行评估。

详细信息与使用说明

1. 项目定位与用途

Claw-Eval 是一个专为大语言模型(LLM)自主智能体设计的评测框架(evaluation harness),旨在提供可信、可复现的智能体能力评估。项目包含 300 个人类验证的真实场景任务,覆盖通信、金融、运营、生产力等 9 个领域,通过标准化的评估流程和多维度评分体系,衡量智能体在完成度、安全性和鲁棒性方面的表现。框架以 CLI 工具形式提供,支持批量并行执行,并公开 leaderboard 和数据集,推动智能体评估领域的标准化发展。其核心价值在于消除'幸运跑'偏差,确保评估结果反映模型的真实能力而非随机波动。

2. 解决的问题

Claw-Eval 主要解决 LLM 智能体评估中的三大挑战:一是偶然成功问题,传统单次运行评估可能因运气导致结果不可靠,项目引入 Pass^3 方法,要求模型在三次独立试验中均通过任务才算成功,有效消除随机性;二是评估维度单一问题,框架从完成度、安全性、鲁棒性三个维度进行全轨迹审计,提供全面能力画像;三是可复现性不足问题,通过 Docker 沙盒隔离、标准化任务配置和手动重试机制(应对 API 不稳定),确保所有 leaderboard 结果可被社区验证。此外,人类验证的任务和评分标准(rubrics)避免了自动生成评估标准的偏差。

3. 适用场景

Claw-Eval 适用于多种 AI 智能体评估场景:一是研究机构与公司研发团队需要系统化 benchmark 来比较不同 LLM 或智能体架构在真实个人助理任务上的表现;二是多模态能力测试,框架包含 101 个多模态任务,涵盖网页生成、视频问答、文档提取等感知与创作类任务;三是对话智能体鲁棒性分析,38 个多轮次任务通过模拟用户人格测试智能体在澄清、咨询等交互中的稳定性;四是安全性与合规性验证,通过设计涉及敏感操作的任务评估智能体是否避免有害或未授权行为;五是教学与竞赛场景,标准化任务和清晰评分标准适合用于 AI 课程实验或智能体编程挑战赛。

4. 安装方式

根据仓库信息,Claw-Eval 推荐使用 uv 进行依赖管理和虚拟环境创建。具体步骤为:首先安装 uv(pip install uv),然后创建 Python 3.11 虚拟环境(uv venv --python 3.11),激活环境(source .venv/bin/activate)。接下来需要配置环境变量:设置 OPENROUTER_API_KEY 用于模型调用,若任务需要真实网络搜索则还需设置 SERP_DEV_KEY。最后运行准备脚本 bash scripts/test_sandbox.sh 完成环境检查与沙盒初始化。项目依赖由 pyproject.toml 和 requirements.txt 明确指定,包括核心库(pydantic、pyyaml、openai、httpx)、Mock 服务(fastapi、uvicorn)和 Docker 支持。注意:视频相关任务的文件需从 Hugging Face 单独获取,因 GitHub 仓库受文件大小限制未包含。

5. 使用方式

Claw-Eval 通过命令行工具 claw-eval 执行评估。核心用法为:claw-eval batch --config <模型配置> --sandbox --trials 3 --parallel <并行数>,其中 --config 指定模型配置文件(如 model_configs/claude_opus_46.yaml),--sandbox 启用 Docker 沙盒隔离,--trials 3 对应 Pass^3 方法的三次独立试验,--parallel 控制并行任务数以提高效率。用户可访问 https://claw-eval.github.io 查看完整 leaderboard 和单个任务案例分析。数据集可在 Hugging Face 的 claw-eval/Claw-Eval 下载,包含任务 ID、查询、所需 fixture 文件、语言和类别等信息。框架支持自定义任务扩展,每个任务由 YAML 配置文件和 Python 评分器类定义,便于社区贡献新任务。

6. 补充说明或实现特点

Claw-Eval 在实现上具有几个关键特点:一是严格的评估逻辑,自 2026 年 3 月起采用 Pass^3 作为主要指标,并要求三次运行全部成功才算通过,同时手动重试机制处理网络或 API 错误以确保恰好生成三条轨迹;二是模块化架构,代码组织为 graders(评分逻辑,含 LLM 裁判和视觉评分器)、models(数据模型如任务定义、轨迹消息)、runner(执行协调,管理任务加载、模型调用、沙盒启动)、sandbox(Docker 隔离,管理容器生命周期和文件挂载)和 tasks(具体任务配置)五大模块,关注点分离;三是任务与评分逻辑分离,每个任务独立包含 YAML 配置和 Python grader 类,便于扩展;四是支持多模态和对话任务,通过混入类(MultimodalGraderMixin)和用户模拟器实现;五是强调可复现性,代码库正在审计以确保所有 leaderboard 结果可被社区验证。

思维导图

Claw-Eval
CLI 工具
入口点: claw_eval.cli:main
主要命令: claw-eval batch
核心模块
graders: 评分逻辑
models: 数据模型
runner: 执行协调
sandbox: Docker 隔离
tasks: 任务配置
任务系统
三大 splits: general/multimodal/multi_turn
任务定义: YAML 配置文件
评分器: Python 类 + LLM 裁判
评估方法
Pass^3: 三次独立试验均通过
多维度: 完成度/安全性/鲁棒性
全轨迹审计
依赖与环境
Python 3.11+
Docker 沙盒
环境变量: API keys

常见问题

Claw-Eval 是什么?用于什么场景?

Claw-Eval 是一个 LLM 智能体评测框架,包含 300 个人类验证任务,用于评估 AI 智能体在真实个人助理场景中的表现,适用于研究机构、企业研发团队对比不同模型能力,以及多模态和对话任务的鲁棒性测试。

什么是 Pass^3 评估方法?

Pass^3 是 Claw-Eval 的主要评估指标,要求模型在三次独立试验中均成功完成任务才算通过,旨在消除偶然成功('幸运跑')导致的评估偏差,确保结果反映模型真实能力。

如何安装和运行 Claw-Eval?

使用 uv 创建虚拟环境并安装依赖,设置 OPENROUTER_API_KEY 等环境变量,运行 scripts/test_sandbox.sh 准备环境,然后通过 claw-eval batch --config <配置> --sandbox --trials 3 --parallel <数> 执行评估。

任务数据如何获取?视频文件在哪里?

任务数据集可在 Hugging Face (claw-eval/Claw-Eval) 下载,包含任务配置和评分标准。视频文件因大小限制未包含在 GitHub 仓库,需从 Hugging Face 数据集获取完整 fixtures。

Claw-Eval 支持哪些类型的任务?

支持三大类任务:general(161 个通用任务,涵盖通信、金融、运营等)、multimodal(101 个多模态任务,如网页生成、视频问答)、multi_turn(38 个对话任务,模拟用户人格进行交互)。