安全与治理413 个项目
收录 GitHub 上最热门的 AI 安全与治理开源项目,包括 AI 安全、模型评估、隐私合规和可解释性工具,按 Stars 排名。
此仓库由 Omar Santos (@santosomar) 维护,包含数千个与道德黑客、漏洞赏金、数字取证和事件响应(DFIR)、AI 安全、漏洞研究、漏洞利用开发、逆向工程等相关的资源。🔥 另请查看:https://hackertraining.org
语言模型的完全自动审查移除
一种基于博弈论的方法,用于解释任何机器学习模型的输出。
FHEVM,一个用于将全同态加密(FHE)与区块链应用集成的全栈框架
SafeLine是一个自托管的WAF(Web应用防火墙)/反向代理,用于保护您的Web应用免受攻击和漏洞利用。
基于WireGuard®的、具有身份感知功能的VPN和隧道反向代理,用于远程访问。
🔒 一份包含300多条2026年数字安全与隐私保护技巧的清单
LLM 评估框架
用于 Agent AI 可观测性、监控和评估框架的 Python SDK。包含代理、LLM 和工具追踪、多代理系统调试、自托管仪表板以及带有时间线和执行图视图的高级分析功能。
Zama 赏金计划:为 FHE 领域和 Zama 的开源库做出贡献并获得奖励 💰
提升您的LLM应用评估🚀
提取和解密浏览器数据,支持多种数据类型,可在多种操作系统(macOS、Windows、Linux)上运行。
AI 代理技能的安全扫描器。检测漏洞、恶意模式和安全风险。
用于语言模型少样本评估的框架。
Bitwarden客户端应用(Web、浏览器扩展、桌面和CLI)。
面向计算机视觉的高级 AI 可解释性。支持 CNN、Vision Transformer、分类、目标检测、分割、图像相似度等。
在Windows 11中强制移除Copilot、Recall等
Lime:解释任何机器学习分类器的预测结果
AI 可观测性与评估
一个用于检测、编辑、掩码和匿名化文本、图像和结构化数据中敏感数据(PII)的开源框架。支持NLP、模式匹配和可定制管道。
对驻留在他人服务器上的数据执行数据科学
网络安全AI(CAI),AI安全框架
Transformer可视化解释:通过交互式可视化学习LLM Transformer模型的工作原理
BertViz:可视化Transformer模型中的注意力机制
OpenShell是自主AI代理的安全、私有运行时环境。
这是一个用于Linux系统的多用途bash脚本,用于审计无线网络。
Evidently是一个开源的ML和LLM可观测性框架。评估、测试和监控任何AI驱动的系统或数据管道。从表格数据到生成式AI。100多个指标。
🛡️ 类似Windows Hello™风格的面部认证,适用于Linux
😈Awful AI是一个精选列表,用于跟踪当前AI的可怕用途——希望提高意识
WiFi安全审计工具套件
OpenCompass是一个LLM评估平台,支持100多个数据集上的多种模型(Llama3、Mistral、InternLM2、GPT-4、LLaMa2、Qwen、GLM、Claude等)。
为大型语言模型添加护栏。
拟合可解释模型。解释黑盒机器学习。
NeMo Guardrails是一个开源工具包,用于轻松地向基于LLM的对话系统添加可编程护栏。
Superagent保护您的AI应用免受提示注入、数据泄露和有害输出的侵害。将安全性直接嵌入您的应用,并向客户证明合规性。
对抗鲁棒性工具箱 (ART) - 用于机器学习安全的 Python 库 - 逃逸、投毒、提取、推理 - 红队和蓝队。
一个工业级联邦学习框架。
Passbolt社区版(CE)API。面向团队的开源密码管理器的JSON API!
将强化学习民主化应用于 LLM。
AI Agent 治理工具包 — 策略执行、零信任身份、执行沙箱以及自主AI Agent的可靠性工程。涵盖 OWASP Agentic Top 10 全部10项。
一个巨大的手动策划的包含 AI 生成图像的网站黑名单,适用于 uBlock Origin 和 uBlacklist。
用于使语言模型与人类和 AI 偏好对齐的稳健配方。
SWE-bench:语言模型能解决现实世界的GitHub问题吗?
Fawkes,针对面部识别系统的隐私保护工具。更多信息请访问 https://sandlab.cs.uchicago.edu/fawkes
自主红队平台;多智能体进攻性安全元框架
基于AI的对抗模拟和红队平台
跟踪你的朋友。使用图像识别和反向图像搜索找到他们的Instagram、FB和Twitter个人资料。
红队自主黑客代理
本地优先的医疗 AI:临床 NER 和 HIPAA PII 去标识化,100% 在设备上运行。1000+ 医疗模型,12 种语言,Apple MLX + Python,无云端,无患者数据离开网络。Apache-2.0。
《可解释的机器学习--黑盒模型可解释性理解指南》,该书为《Interpretable Machine Learning》中文版
开源统一漏洞管理、DevSecOps与ASPM
对对齐语言模型的通用和可迁移攻击。
用于神经网络可解释性研究的基础设施和工具集合。
Align Anything: 使用反馈训练全模态模型
一个全栈AI红队平台,通过OpenClaw安全扫描、代理扫描、技能扫描、MCP扫描、AI基础设施扫描和LLM越狱评估来保护AI生态系统。
跨文本、图像、视频和音频任务的一体化多模态评估工具包。
大型多模态模型 (LMM) 的开源评估工具包,支持 220+ LMM、80+ 基准测试。
CISO Assistant是一个一站式GRC平台,用于风险管理、应用安全、合规与审计、第三方风险管理、业务影响分析、隐私和报告。它支持150多个全球框架,并具有自动控制映射功能,包括ISO 27001、NIST CSF、SOC 2、CIS、PCI DSS、NIS2、DORA、GDPR、HIPAA、CMMC等。
中文语言理解测评基准 Chinese Language Understanding Evaluation Benchmark: datasets, baselines, pre-trained models, corpus and leaderboard
Python生成式AI风险识别工具(PyRIT)是一个开源框架,旨在帮助安全专业人员和工程师主动识别生成式AI系统中的风险。
扫描器,检测使用已知漏洞的 JavaScript 库。还可以生成所发现库的 SBOM。
面向开发者的开源数据安全平台,用于监控和检测个人身份信息(PII)、匿名化生产数据并在不同环境间同步。
一个用于管理双因素认证(2FA)账户并生成安全码的Web应用
Deepchecks:用于ML模型和数据持续验证的测试。Deepchecks是一个全面的开源解决方案,满足您所有的AI和ML验证需求,支持从研究到生产对数据和模型进行彻底测试。
要屏蔽的AI代理和机器人列表
[CCS'24] 一个包含来自 Reddit、Discord、网站和开源数据集的 15,140 个 ChatGPT 提示词的数据集(包括 1,405 个越狱提示词)。
面向团队和 AI 智能体的开源安全自动化平台。
用于 GPT 风格语言模型机制可解释性的库
内部 Windows 渗透测试/AD 安全自动化。
学习可解释性工具:以可扩展且框架无关的界面交互式分析 ML 模型,理解其行为。
在几秒内沙盒化任何 AI 智能体——零设置,零延迟。
OML 1.0 通过指纹识别:开放、可货币化且忠诚的 AI
LLM 实验和 AI 代理的评估与跟踪
TextAttack 🐙 是一个用于 NLP 中对抗攻击、数据增强和模型训练的 Python 框架 https://textattack.readthedocs.io/en/master/
比较LLM在总结短文档时产生幻觉性能的排行榜
超越模仿遊戲的協作基準測試,用於衡量和推斷語言模型的能力。
一个精简且可定制的框架,用于高效的大模型(LLM、VLM、AIGC)评估和性能基准测试。
LLM 交互的安全工具包
注重隐私的密码管理器,内置电子邮件别名功能。完全加密且可自托管。
Keras的神经网络可视化工具包
一个Python工具箱,用于创建欺骗PyTorch、TensorFlow和JAX中神经网络的对抗样本
[ACL 2024] 一个易于使用的 LLM 知识编辑框架。
针对AI代理、MCP服务器和代理技能的安全扫描器。
语言模型全面评估(HELM)是一个开源 Python 框架,由斯坦福基础模型研究中心(CRFM)创建,用于对基础模型(包括大语言模型和多模态模型)进行全面、可重复且透明的评估。
一个用于大语言模型的统一评估框架
用于调试/检查机器学习分类器并解释其预测的库
用于隐私保护数据分析和机器学习的统一框架。
用于异常值、对抗性和漂移检测的算法
Inspect:一个用于大型语言模型评估的框架。
UpTrain是一个开源统一平台,用于评估和改进生成式AI应用。我们为20多个预配置检查(涵盖语言、代码、嵌入用例)提供评分,对失败案例进行根因分析,并提供解决见解。
解释、分析和可视化NLP语言模型。Ecco直接在Jupyter笔记本中创建交互式可视化,解释基于Transformer的语言模型(如GPT2、BERT、RoBERTA、T5和T0)的行为。
关于机器学习和安全的源代码。
智能体大语言模型漏洞扫描器 / AI红队测试工具包 🧪
"通过人类反馈的强化学习训练有用且无害的助手"的人类偏好数据
Safe RLHF:通过基于人类反馈的安全强化学习实现约束价值对齐
Instagram信息收集。
将用于CSAM检测的Apple NeuralHash模型转换为ONNX格式。
LLM提示注入检测器
大型语言模型中 RLHF 的秘密 第一部分:PPO
人类ChatGPT对比语料库(HC3)、检测器等!🔥
与🤗 transformers无缝协作的模型可解释性工具。仅需两行代码即可解释你的transformers模型。
隐私保护计算平台 由密码学专家团队打造的开源隐私计算平台,支持多方安全计算、联邦学习、隐私求交、匿踪查询等。
大型语言模型应用的OWASP Top 10(GenAI安全项目的一部分)
面向AI驱动的云和Kubernetes操作的安全优先护栏
已弃用 - Privacy Pass 协议客户端,提供不可关联的加密令牌
用于自定义 LLM 应用程序的安全扫描器
AttackGen 是一款网络安全事件响应测试工具,利用大型语言模型和全面的 MITRE ATT&CK 框架的强大功能。该工具根据用户选择的威胁行为者组和组织的详细信息生成量身定制的事件响应场景。
用于评估和提升大模型安全性的中文安全提示。中文安全prompts,用于评估和提升大模型的安全性。
流行的 NoScript 安全套件浏览器扩展。
使用 Prometheus 和 GPT4 评估你的 LLM 响应 💯
一个基于AI的威胁建模工具,利用OpenAI的GPT模型,基于STRIDE方法为给定应用生成威胁模型。
通用分布外检测基准测试
用于评估自回归代码生成语言模型的框架
面向智能体的持续改进栈。我们的环境数据和评估驱动智能体改进和监控。
通过自蒸馏进行强化学习 (SDPO)
Data Selfie - 一个浏览器扩展,用于在Facebook上追踪自己并分析数据
AI代理安全扫描器。检测代理配置、MCP服务器和工具权限中的漏洞。可作为CLI、GitHub Action、ECC插件和GitHub App集成使用
针对 LLM 代理工作流的安全扫描器
nnsight 包支持解释和操作深度学习模型的内部结构。
扫描MCP服务器以发现潜在威胁和安全发现。
与框架无关的最先进显著性方法实现(XRAI、BlurIG、SmoothGrad 等)
:art: 一个 CNN 可视化工具
Open-source reverse engineering lab: 197-article knowledge base + MCP tools + CTF/APK/PE automation toolchain. Agent-native. Note:由于场景原因,目前有让几乎所有(除fable5)AI都会越狱的bug,静等官方修复,但是请在合法授权下进行安全测试😉(等我用上5.6再更新(ー_ー)!!)
🔍 LangKit:用于监控大语言模型 (LLM) 的开源工具包。📚 从提示和响应中提取信号,确保安全与保障。🛡️ 功能包括文本质量、相关性指标和情感分析。📊 一个全面的 LLM 可观测性工具。👀
Offen公平网络分析
OmniXAI: 一个可解释AI库
在浏览器中使用AES对URL进行密码保护;无需浏览器扩展即可创建隐藏书签
AI原生风险智能系统,OpenDeRisk——您的应用系统风险智能管理器,提供7*24小时全面深入的防护
AI 优先的安全扫描器。v2026.7 新功能:Claude Code 入侵检测——在克隆前审查 .claude/ 钩子、权限和技能——加上始终在线的 AI 攻击签名扫描器和原生 Rust 与 PHP 规则。还有:medusa scan --git 审查任何仓库,medusa secrets scan 检测泄露的 API 密钥。40,000+ 模式,零设置
开放安全控制评估语言(OSCAL)
FacTool: 生成式 AI 中的事实性检测
这是一个旨在提供 OpenAI GPT 语言模型越狱状态更新的仓库。
论文《LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code》的官方仓库
AI编码代理和人类终端命令的安全护栏
Mozilla 5 万美元 AI 奖金的获得者
Diffprivlib:IBM 差分隐私库
[ICCV 2021 - 口头报告] 通用注意力模型可解释性用于解释双模态和编码器-解码器 Transformer 的官方 PyTorch 实现,一种可视化任何基于 Transformer 网络的新方法。包括 DETR、VQA 的示例
一个故意存在漏洞的银行应用程序,用于练习 Web 应用、API、AI 集成应用的安全测试和安全代码审查。包含真实应用中常见的漏洞,是安全专业人员、开发者和爱好者学习渗透测试和安全编码实践的理想平台。
一个易于使用的Python框架,用于生成对抗性越狱提示
论文《Automated Hate Speech Detection and the Problem of Offensive Language》的仓库,ICWSM 2017
用于 RLHF 及其替代方案的模拟框架。无需收集人类数据即可开发您的 RLHF 方法。
一个隐藏使用生成式 AI 的网站功能和内容的过滤器列表。
Metis 是一个开源的、AI 驱动的深度安全代码审查工具
自主 AI 渗透测试引擎,跨 Web、云、AD 和 Kubernetes 的持续进攻性安全。代理推理 + 真实漏洞利用执行提供基于证明的漏洞。隐私网关:LLM 永远不会看到你的真实 IP、主机、凭据或路径(确定性占位符在本地还原),没有任何内容离开你的边界。
该仓库用于安全强化学习基线。
AIRecon 是一个自主网络安全代理,结合了自托管的大语言模型(Ollama)、Kali Linux Docker 沙箱和 Textual TUI。它旨在自动化安全评估、渗透测试和漏洞赏金侦察——无需任何 API 密钥或云依赖。
Disconnect 是一款浏览器扩展,可使网页更快、更私密、更安全。
用于解释Stable Diffusion的扩散注意力归因图。
一个浏览器数据(密码|历史记录|Cookie|书签|下载记录)的导出工具,支持主流浏览器。
BLEURT是一种基于迁移学习的自然语言生成指标。
开源AI代理防火墙,用于MCP安全和代理出口。扫描中介的HTTP、MCP、A2A和WebSocket流量,检测数据泄露、SSRF和提示注入,并发出中介签名的操作收据:来自代理外部的可验证审计证据。
CodeGate:AI 代理框架的安全性、工作区和多路复用
一个用于文本对抗攻击的开源包。
OpenJudge: 一个用于全面评估和质量奖励的统一框架
在GPT中定位和编辑事实关联 (NeurIPS 2022)
BruteSploit是一个用于自动化生成、暴力破解和操作词表的交互式shell方法集合。可在渗透测试期间用于枚举,也可能在CTF中用于操作、组合、转换和排列某些单词或文本文件:p
一个基于深度图的欺诈检测工具箱
一个用于制作 RepE 控制向量的库
一个模块化、与栈无关的安全审查技能工具包,供 AI 编码代理自主发现、复现和修补漏洞。
AI获取上下文,而非你的私人数据。浏览器聊天、AI API和编码代理的本地优先隐私代理
让你的 GenAI 应用安全可靠 :rocket: 测试并强化你的系统提示词
提高恶意AI驱动图像编辑的成本
联邦学习基准测试。献给社区。🤗
训练可解释ML模型、解释ML模型以及调试ML模型以提升准确性、公平性和安全性的技术示例。
针对NeuralHash的原像攻击💣
高性能秘密扫描器。CLI、Go库、Burp Suite扩展和Chrome扩展。487条检测规则,支持实时凭据验证
统一的多语言自然语言处理鲁棒性评估工具包
Chrome扩展,阻止对使用法律威胁将自己从其他黑名单中移除的网站的请求
Microsoft Security Copilot 是一款基于生成式 AI 的安全解决方案,能够以机器速度和规模提升防御者的效率和能力,改善安全成果,同时遵循负责任的 AI 原则。
WinDBG 反 RootKit 扩展
GenAI 合规基准测试是一套针对受监管行业中生成式 AI 的评估基准。
在你睡觉时发现零日漏洞。DeepZero 是一个自动化漏洞研究框架,它使用 AI 代理原生地解析、反编译和分析数千个 Windows 内核驱动程序,以寻找可利用的 IOCTL。
Real Intelligence Threat Analytics (RITA) 是一个通过网络流量分析检测命令与控制通信的框架。
一款帮助云租户发现和测试云上风险、增强云上防护能力的综合性开源工具
用于理解Transformer预测逐层构建过程的工具
一个将Chromium浏览器转换为C2植入工具的工具
ChatGPT 及类似模型的故障存档。
本仓库包含论文《MMMU:面向专家级AGI的大规模多学科多模态理解与推理基准》的评估代码
IDS-ML 的代码:使用机器学习算法(决策树、随机森林、极端随机树、XGBoost、堆叠、K-means、贝叶斯优化等)开发入侵检测系统。
Parseltongue是一个强大的提示黑客工具/浏览器扩展,用于实时分词可视化和无缝文本转换,支持二进制、base64、leet语、特殊字符和多种语言格式。非常适合红队成员、开发者、语言学家和潜在空间探索者
Firefox和Chrome扩展,防止Google使链接变得丑陋
VULNRΞPO - 免费漏洞报告生成器和仓库,端到端加密!包含问题模板、CWE、CVE、MITRE ATT&CK、PCI DSS,支持导入Nmap/Nessus/Burp/OpenVAS/Bugcrowd/Trivy,导出Jira、TXT/JSON/MARKDOWN/HTML/DOCX,附件、自动变更日志、统计、漏洞管理、漏洞赏金、本地AI/LLM,超快速渗透测试报告!
用于AI代理和MCP服务器的开源对手模拟
Casbin AI & MCP HTTP安全网关,在线演示:https://door.caswaf.com
交付安全有效的语言模型
基于 TensorFlow 的隐私保护框架。
一款为Chrome、Firefox和Opera带来安全与隐私保护的浏览器扩展
一种用于文本分类和推理的自然语言攻击模型
🐘 🔒 兼容KeePass的浏览器扩展,用于填充密码
在您喜爱的浏览器中享受iCloud的隐藏我的电子邮件服务
论文《The Stable Signature: Rooting Watermarks in Latent Diffusion Models》的官方实现
[ICLR'25] BigCodeBench: 面向 AGI 的代码生成基准测试
PromptInject是一个以模块化方式组装提示的框架,用于定量分析LLM对对抗性提示攻击的鲁棒性。🏆 NeurIPS ML安全研讨会2022最佳论文奖
开源运行时AI Agent安全工具 - 监控和控制AI Agent,在Agent行动前实时捕获恶意工具使用、提示注入和策略漂移。
基于数据驱动的 LLM 应用评估。
一个健壮且灵活的开源用户与实体行为分析(UEBA)框架,用于安全分析。由网络安全行业的数据科学家和安全分析师倾心开发。[测试版]
论文《大型语言模型基准测试中应对数据污染的最新进展:从静态评估到动态评估》的官方GitHub仓库
⚡ Vigil ⚡ 检测提示注入、越狱和其他潜在风险的大语言模型(LLM)输入
开源 AI 渗透测试工具,用于发现并修复应用程序的漏洞。
扩散解释器:文本到图像稳定扩散的可视化解释
数据来源:GitHub API · 人工精选 · 实时同步