O
OpenRLHF
OpenRLHF/OpenRLHF
一个基于Ray的易用、可扩展、高性能的代理强化学习框架(PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & 异步RL)
★9.9kstars
Python
Apache-2.0
更新: 今天
📋 项目速览
点击展开
这是什么?开源数据与基础设施项目,用Python构建、核心能力在large-language-models/proximal-policy-optimization
作者是谁?由 OpenRLHF 团队维护,GitHub 9.9K⭐,在 数据与基础设施 分类 3133 个项目中排名第 202
为什么诞生?large-language-models在数据与基础设施中的需求持续增长,OpenRLHF发现现有方案不够直观,于是创造了OpenRLHF来降低proximal-policy-optimization使用门槛。
能干什么?核心场景:raylib、reinforcement-learning、reinforcement-learning-from-human-feedback
怎么用 AI 安装?推荐使用 AI 编码助手根据 GitHub README 自动完成 pip 安装和虚拟环境配置。
🔗 github.com/OpenRLHF/OpenRLHF | 官网 https://openrlhf.readthedocs.io/
🔗 github.com/OpenRLHF/OpenRLHF | 官网 https://openrlhf.readthedocs.io/
标签
large-language-modelsproximal-policy-optimizationraylibreinforcement-learningreinforcement-learning-from-human-feedbacktransformersvisual-language-modelsvllm