O
Online_RLHF
ZinYY/Online_RLHF
论文《可证明高效的单次奖励建模在线RLHF》的PyTorch实现。该仓库提供了灵活模块化的在线人类反馈强化学习方法。
★94stars
Python
更新: 2周前
📋 项目速览
点击展开
这是什么?用Python构建、打造开源安全与治理项目,专注large-language-model和llm方向
作者是谁?由 ZinYY 团队维护,GitHub 94⭐,在 安全与治理 分类 413 个项目中排名第 312
为什么诞生?large-language-model在安全与治理中的需求持续增长,ZinYY发现现有方案不够直观,于是创造了Online_RLHF来降低llm使用门槛。
能干什么?核心场景:post-training、rlhf
怎么用 AI 安装?推荐使用 AI 编码助手根据 GitHub README 自动完成 pip 安装和虚拟环境配置。
🔗 github.com/ZinYY/Online_RLHF | 官网 https://arxiv.org/abs/2502.07193
🔗 github.com/ZinYY/Online_RLHF | 官网 https://arxiv.org/abs/2502.07193
标签
large-language-modelllmpost-trainingrlhf