AI 安全72 / 209 个项目
AI 安全排行榜,收录 GitHub 上最热门的 AI 安全工具项目,包括红队测试、对抗攻击防御和内容安全过滤。
SafeLine是一个自托管的WAF(Web应用防火墙)/反向代理,用于保护您的Web应用免受攻击和漏洞利用。
🔒 一份包含300多条2026年数字安全与隐私保护技巧的清单
在Windows 11中强制移除Copilot、Recall等
一个用于检测、编辑、掩码和匿名化文本、图像和结构化数据中敏感数据(PII)的开源框架。支持NLP、模式匹配和可定制管道。
这是一个用于Linux系统的多用途bash脚本,用于审计无线网络。
WiFi安全审计工具套件
NeMo Guardrails是一个开源工具包,用于轻松地向基于LLM的对话系统添加可编程护栏。
Superagent保护您的AI应用免受提示注入、数据泄露和有害输出的侵害。将安全性直接嵌入您的应用,并向客户证明合规性。
Passbolt社区版(CE)API。面向团队的开源密码管理器的JSON API!
AI Agent 治理工具包 — 策略执行、零信任身份、执行沙箱以及自主AI Agent的可靠性工程。涵盖 OWASP Agentic Top 10 全部10项。
开源统一漏洞管理、DevSecOps与ASPM
一个全栈AI红队平台,通过OpenClaw安全扫描、代理扫描、技能扫描、MCP扫描、AI基础设施扫描和LLM越狱评估来保护AI生态系统。
CISO Assistant是一个一站式GRC平台,用于风险管理、应用安全、合规与审计、第三方风险管理、业务影响分析、隐私和报告。它支持150多个全球框架,并具有自动控制映射功能,包括ISO 27001、NIST CSF、SOC 2、CIS、PCI DSS、NIS2、DORA、GDPR、HIPAA、CMMC等。
扫描器,检测使用已知漏洞的 JavaScript 库。还可以生成所发现库的 SBOM。
面向团队和 AI 智能体的开源安全自动化平台。
在几秒内沙盒化任何 AI 智能体——零设置,零延迟。
TextAttack 🐙 是一个用于 NLP 中对抗攻击、数据增强和模型训练的 Python 框架 https://textattack.readthedocs.io/en/master/
针对AI代理、MCP服务器和代理技能的安全扫描器。
Safe RLHF:通过基于人类反馈的安全强化学习实现约束价值对齐
LLM提示注入检测器
大型语言模型中 RLHF 的秘密 第一部分:PPO
面向AI驱动的云和Kubernetes操作的安全优先护栏
AI代理安全扫描器。检测代理配置、MCP服务器和工具权限中的漏洞。可作为CLI、GitHub Action、ECC插件和GitHub App集成使用
针对 LLM 代理工作流的安全扫描器
扫描MCP服务器以发现潜在威胁和安全发现。
AI 优先的安全扫描器。v2026.7 新功能:Claude Code 入侵检测——在克隆前审查 .claude/ 钩子、权限和技能——加上始终在线的 AI 攻击签名扫描器和原生 Rust 与 PHP 规则。还有:medusa scan --git 审查任何仓库,medusa secrets scan 检测泄露的 API 密钥。40,000+ 模式,零设置
开放安全控制评估语言(OSCAL)
这是一个旨在提供 OpenAI GPT 语言模型越狱状态更新的仓库。
开源AI代理防火墙,用于MCP安全和代理出口。扫描中介的HTTP、MCP、A2A和WebSocket流量,检测数据泄露、SSRF和提示注入,并发出中介签名的操作收据:来自代理外部的可验证审计证据。
CodeGate:AI 代理框架的安全性、工作区和多路复用
一个基于深度图的欺诈检测工具箱
一个模块化、与栈无关的安全审查技能工具包,供 AI 编码代理自主发现、复现和修补漏洞。
AI获取上下文,而非你的私人数据。浏览器聊天、AI API和编码代理的本地优先隐私代理
让你的 GenAI 应用安全可靠 :rocket: 测试并强化你的系统提示词
高性能秘密扫描器。CLI、Go库、Burp Suite扩展和Chrome扩展。487条检测规则,支持实时凭据验证
VULNRΞPO - 免费漏洞报告生成器和仓库,端到端加密!包含问题模板、CWE、CVE、MITRE ATT&CK、PCI DSS,支持导入Nmap/Nessus/Burp/OpenVAS/Bugcrowd/Trivy,导出Jira、TXT/JSON/MARKDOWN/HTML/DOCX,附件、自动变更日志、统计、漏洞管理、漏洞赏金、本地AI/LLM,超快速渗透测试报告!
交付安全有效的语言模型
一款为Chrome、Firefox和Opera带来安全与隐私保护的浏览器扩展
PromptInject是一个以模块化方式组装提示的框架,用于定量分析LLM对对抗性提示攻击的鲁棒性。🏆 NeurIPS ML安全研讨会2022最佳论文奖
一个健壮且灵活的开源用户与实体行为分析(UEBA)框架,用于安全分析。由网络安全行业的数据科学家和安全分析师倾心开发。[测试版]
机器学习的安全与隐私风险模拟器(arXiv:2312.17667)
全球首个支持面部认证的MacOS应用锁。使用面部、TouchID或密码解锁Mac应用。完全本地化和加密——您的数据永远不会离开Mac。
模拟联邦设置并运行差分隐私联邦学习。
用于深度学习和联邦学习的后门框架。一个轻量级工具,用于进行后门研究。
Lyrie.ai — 全球首个自主AI网络安全代理。由OTT Cybersecurity LLC构建。
🤖 Admyral 支持对任何自定义控制进行持续控制监控
自主白帽安全审计员,用于 AI 驱动的代码审查、漏洞赏金研究、漏洞利用构建和基于执行的验证。
在视觉和文本的联邦学习场景中突破隐私保护
用于大型语言模型的自我强化防火墙
Agent Execution Partnership (AEE) 是一个开源控制平面,确保每个 AI 代理动作在运行前被授权、运行时可观察、完成后可验证。
BeaverTails 是一个数据集集合,旨在促进大型语言模型(LLM)安全对齐的研究。
一个用于在`--dangerous`模式下安全运行AI智能体的Docker和开发容器设置。所有容器流量通过透明mitmproxy路由,强制执行网络访问规则并注入密钥。
用于大语言模型评估、护栏和安全的框架
面向 AI 代理的开源对抗性测试引擎、SDK 和 CLI。可本地运行或针对 Humanbound 平台运行。
为 AI 编码代理提供运行时安全,具有实时执行、系统事件监控和长期溯源功能。支持原生 macOS 上的 Claude Code 和 Codex。
代码仓库:AIRTBench:衡量语言模型中自主AI红队能力
LLM 对齐越狱;一套用于审计其内部推理并揭示偏见的指令
AgentGuard:AI 代理的零信任安全基础
Chrome扩展风险扫描器——扫描Chrome Web Store链接或CRX/ZIP构建,并生成基于证据的安全/隐私报告。开源核心。
MCP和技能扫描器,扫描任何MCP服务器或技能的间接攻击向量以及安全或配置漏洞
一种被动查找备份/敏感信息的方法。
MSR4P&S'22发表的论文《SecurityEval数据集:挖掘漏洞示例以评估基于机器学习的代码生成技术》的仓库。
:zap: 基于Lua脚本的快速Web安全扫描器,使用Rust编写 :waning_gibbous_moon: :crab:
用于赋能生物医学研究的协作学习框架
AI 代理的治理网关——有界、可审计、会话感知的控制,带有 MCP 代理、Shell 代理和 HTTP API。适用于 Cursor、Claude Code、Codex 和任何兼容 MCP 的代理。
面向 AI 智能体和供应链信任的开源安全引擎。
大规模静态检测浏览器扩展中的脆弱数据流。
🥇 Amazon Nova AI 挑战赛冠军 - ASTRA 在亚马逊全球 AI 安全竞赛中作为顶级攻击团队胜出,在实时对抗评估中击败了来自全球大学的精英防御团队。
RAG/LLM 安全扫描器可识别 AI 驱动应用程序(包括聊天机器人、虚拟助手和知识检索系统)中的关键漏洞。
自动修复代码中的安全漏洞。
由Claude Code驱动的自主漏洞赏金狩猎框架。20个AI代理、状态机编排、Burp Suite MCP、凭证库、LLM安全追踪。输入'hunt target.com'让AI发现漏洞。
一个尖端、高科技的自主银行网络,采用高级安全功能、强大的身份验证和授权机制。GBN仓库包含模块化架构、安全通信协议和稳健的事件响应计划,为银河系金融交易提供可靠安全的平台。
数据来源:GitHub API · 人工精选 · 实时同步