这里聚合了 1 个与 grpo 相关的开源项目,适合快速判断哪些工具值得继续深入。
高星代表
ART 是 OpenPipe 开发的 Agent 强化训练库,基于 GRPO 算法为 Qwen、Llama 等大模型提供在岗训练(on-the-job training),通过 Serverless RL 服务降低训练成本与运维复杂度。