跳到主要内容
技术标签3 个项目合计 ★ 90,670平均 ★ 30,223

reinforcement-learning 开源项目合集

这里聚合了 3 个与 reinforcement-learning 相关的开源项目,适合快速判断哪些工具值得继续深入。

语言构成Python · 3

高星代表

这个分组里最值得先看的 3

按 Star 数排序

项目列表按 stars 从高到低

unslothai
unsloth

Unsloth 是一个本地 AI 模型训练与推理一体化平台,提供 Web 界面 (Studio) 和 Python 库 (Core),支持文本、音频、视觉等多模态模型,通过优化内核实现 2 倍训练加速与 70% VRAM 节省。

76.4kPython
OpenPipe
ART

ART 是 OpenPipe 开发的 Agent 强化训练库,基于 GRPO 算法为 Qwen、Llama 等大模型提供在岗训练(on-the-job training),通过 Serverless RL 服务降低训练成本与运维复杂度。

10.8kPython
aiming-lab
MetaClaw

MetaClaw是一个基于对话的AI智能体系统,通过元学习和进化机制使智能体能在真实交互中持续提升能力,无需GPU支持,提供跨会话记忆和技能管理,实现一键部署的自我进化助手。

3.5kPython