跳到主要内容
项目档案库 / SDK

OpenPipe/ART 开源库:用途、安装与使用指南

ART 是 OpenPipe 开源的 Agent 强化训练库,支持 GRPO 算法训练 Qwen、Llama 等模型完成真实任务。本文介绍其 Serverless RL 服务、安装依赖、使用示例及适用场景如 2048 游戏和邮件搜索。

10,756PythonStar 于 2026年2月1日2026年9月19日 更新

AI 总结

ART 是 OpenPipe 开发的 Agent 强化训练库,基于 GRPO 算法为 Qwen、Llama 等大模型提供在岗训练(on-the-job training),通过 Serverless RL 服务降低训练成本与运维复杂度。

中文项目介绍

ART(Agent Reinforcement Trainer)是一个开源的强化学习框架,旨在通过 GRPO(Group Relative Policy Optimization)等序列级优化算法,训练多步骤 AI 代理完成真实世界任务。它解决了传统强化学习训练中基础设施复杂、成本高昂、反馈周期长的问题,通过 W&B Training 的 Serverless RL 服务实现自动化的训练与推理资源管理,使开发者能专注于环境、奖励函数与数据的定义。适用场景涵盖游戏(如 2048)、信息检索(如邮件搜索)、决策任务(如 Tic-Tac-Toe)等,支持 Qwen、Llama、GPT-OSS 等多种大模型。技术特征包括模块化架构(轨迹管理、训练配置、CLI 工具)、多后端支持(标准、Megatron、LangGraph)、深度集成 WandB、HuggingFace 与 vLLM,以及 GSPO 算法、additional_histories 特性与检查点自动管理等高级功能。

详细信息与使用说明

1. 项目定位与用途

ART 是 OpenPipe 推出的开源 Agent 强化训练库,核心定位是为大语言模型(如 Qwen、Llama、GPT-OSS)提供在岗训练(on-the-job training)能力。它通过集成 GRPO 等强化学习算法,使代理能够从多步骤交互经验中学习,从而提升在复杂任务中的可靠性。项目提供 ergonomic harness(舒适的工具链),支持将强化学习无缝嵌入任何 Python 应用,并配套 Serverless RL 服务(W&B Training)自动化处理训练与推理基础设施,加速迭代周期。

2. 解决的问题

ART 主要解决传统强化学习训练中的三大痛点:一是基础设施管理复杂,需手动配置 GPU 环境,易出现内存错误;二是训练成本高、速度慢,缺乏资源复用与规模化能力;三是反馈周期长,从代码修改到训练结果获取耗时久。通过 Serverless RL 服务,ART 实现 40% 的成本降低(共享生产级推理集群)和 28% 的训练加速(支持 2000+ 并发请求),并自动维护基础设施健康,让开发者无需担忧 DevOps 问题,专注于算法与任务设计。

3. 适用场景

ART 适用于需要多步骤决策的 AI 代理训练场景。仓库提供的示例笔记本涵盖:游戏类(如 2048 游戏、Tic-Tac-Toe)、信息检索类(如邮件搜索 Agent•E)、以及基于 MCP 工具的金融数据查询(如 alphavantage、balldontlie)。这些场景均要求代理与环境交互、积累轨迹并优化策略。支持的模型包括 Qwen3.5、GPT-OSS、Llama 等开源与闭源大模型,尤其适合需要 on-the-job 微调以适应特定工具或数据分布的实用任务。

4. 安装方式

从当前仓库信息可见,ART 的安装依赖通过 pyproject.toml 定义,要求 Python 3.11 及以上版本。核心依赖包括 litellm、weave、polars、trl 等。可选依赖组分为:backend(训练后端,含 peft、bitsandbytes、vllm 等)、langgraph(LangGraph 集成)、megatron(Megatron 支持)、plotting(可视化)。环境变量需配置 .env.example 中列出的密钥,如 WANDB_API_KEY、HF_TOKEN、OPENPIPE_API_KEY 等以启用完整功能。但仓库中未明确给出具体的 pip 安装命令或分步安装指南,建议参考官方文档。

5. 使用方式

ART 提供命令行工具(art)和 Python API 两种使用方式。Python 层面,开发者可构造 art.TrainableModel 并注册后端(如 ServerlessBackend)开始训练,示例代码展示了对 base_model 的指定与 backend 的初始化。训练配置通过 art.dev.TrainControl 等类管理,并可通过设置 importance_sampling_level='sequence' 启用 GSPO 算法。然而,仓库中未明确给出完整的 CLI 命令列表或训练启动的具体步骤,仅通过 pyproject.toml 的脚本入口暗示存在命令行接口。详细用法需参考文档或示例笔记本。

6. 补充说明与实现特点

ART 采用模块化设计,关键模块包括 art.cli(命令行)、art.trajectories(轨迹与历史数据结构)、art.dev(训练配置)、art.vllm.patches(vLLM 与 Transformers v5 兼容补丁)。它支持多种训练与推理后端,通过插件机制扩展。算法上除 GRPO 外,还提供实验性 GSPO 以提升序列级优化稳定性。特性如 additional_histories 允许在单轨迹中管理多段对话历史,checkpoint-deletion 可自动清理低性能检查点。项目深度集成外部服务:WandB 用于实验跟踪与推理部署,HuggingFace 用于模型托管,AWS S3 用于日志与模型备份,vLLM 用于高效推理。

思维导图

当前仓库信息不足,或结构不够稳定,暂时没有生成可靠的思维导图。

常见问题

ART 支持哪些大模型?

从 README 与示例看,ART 支持 Qwen3.5、GPT-OSS、Llama 等模型,具体兼容性未完全列出,但示例中使用了 Qwen3 14B 进行训练。建议参考文档的模型支持部分获取完整列表。

如何安装 ART?

仓库未明确给出安装命令,但 pyproject.toml 声明了 Python>=3.11 及核心依赖。安装时可能需要根据可选依赖组(如 backend、langgraph)额外安装包,并配置 .env.example 中的环境变量。建议查阅官方安装指南。

Serverless RL 服务是什么?

Serverless RL 服务是 ART 集成的 W&B Training 提供的无服务器强化学习服务,用于自动化管理训练与推理基础设施,实现资源按需分配、成本优化(降低约 40%)和训练加速(提升约 28%),使开发者无需手动运维 GPU 环境。