模型评估/对齐25 / 77 个项目
模型评估/对齐排行榜,收录 GitHub 上最热门的 AI 模型评估和对齐项目,确保 AI 行为符合人类价值观。
OpenCompass是一个LLM评估平台,支持100多个数据集上的多种模型(Llama3、Mistral、InternLM2、GPT-4、LLaMa2、Qwen、GLM、Claude等)。
用于使语言模型与人类和 AI 偏好对齐的稳健配方。
SWE-bench:语言模型能解决现实世界的GitHub问题吗?
Align Anything: 使用反馈训练全模态模型
跨文本、图像、视频和音频任务的一体化多模态评估工具包。
中文语言理解测评基准 Chinese Language Understanding Evaluation Benchmark: datasets, baselines, pre-trained models, corpus and leaderboard
一个用于大语言模型的统一评估框架
Safe RLHF:通过基于人类反馈的安全强化学习实现约束价值对齐
大型语言模型中 RLHF 的秘密 第一部分:PPO
OpenJudge: 一个用于全面评估和质量奖励的统一框架
[ICLR'25] BigCodeBench: 面向 AGI 的代码生成基准测试
论文《大型语言模型基准测试中应对数据污染的最新进展:从静态评估到动态评估》的官方GitHub仓库
MixEval的官方评估套件和动态数据发布。
BeaverTails 是一个数据集集合,旨在促进大型语言模型(LLM)安全对齐的研究。
用于评估基于LLM的交互式科学推理的基准测试套件
代码仓库:AIRTBench:衡量语言模型中自主AI红队能力
LLM 对齐越狱;一套用于审计其内部推理并揭示偏见的指令
相同模型,不同封装:一个从零开始的基准测试,比较编码Agent框架(codex, pi, opencode, cursor, devin)和开放模型在正确性、速度和Token成本方面的表现
用于评估LLM × 框架性能的基准测试。
(EMNLP 2025 Findings) 人类最后代码考试的源评估脚本
论文 "LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners" 的代码仓库
论文《可证明高效的单次奖励建模在线RLHF》的PyTorch实现。该仓库提供了灵活模块化的在线人类反馈强化学习方法。
多模态 AI 生成内容检测:图像、视频和音频。包含基准测试、训练代码(DINOv2、DINOv3、ReStraV、BreathNet)以及用于真实与合成分类的评估流程,并带有校准感知指标。
该仓库包含"MEGA-Bench:将多模态评估扩展到超过500个真实世界任务"的代码 [ICLR 2025]
用于评估大型视觉语言模型 (LVLM) 能力的基准
数据来源:GitHub API · 人工精选 · 实时同步