跳到主要内容
项目档案模板 / Starter

ISC-Bench 基准测试框架:评估大语言模型内部安全崩溃风险,支持模板与代理模式

ISC-Bench 用于研究 LLM 内部安全崩溃现象,提供 77 个跨领域模板和自主代理执行模式。本页面介绍项目定位、TVD 框架、安装配置、使用方式及社区案例收集方法,适合安全研究人员系统化评估模型在敏感数据工作流中的风险。

1,192PythonStar 于 2026年3月26日2026年9月19日 更新

AI 总结

ISC-Bench 是一个研究大语言模型内部安全崩溃(ISC)现象的基准测试框架,通过 77 个跨领域模板和自主代理执行,系统化评估模型在处理敏感数据工作流时产生有害输出的风险,无需对抗性提示即可触发安全崩溃。

中文项目介绍

ISC-Bench 是一个专注于研究前沿大语言模型内部安全崩溃(Internal Safety Collapse)现象的基准测试框架。ISC 现象指当 AI 代理完成涉及敏感数据的不完整专业工作流时,其填补缺失信息以完成任务的正常能力反而会导致产生有害输出,且无需任何对抗性提示或越狱攻击。 项目基于 TVD 框架(Task + Validator + Data),提供 77 个覆盖 9 个专业领域(包括 AI/ML、生物学、化学、网络安全、流行病学等)的测试场景,并支持两种核心测试模式:单轮模板复制粘贴(TVD-Single)和自主代理执行(TVD-Agent)。后者通过工具调用和自我纠正实现更强且更一致的 ISC 触发。 ISC-Bench 适用于学术安全研究、模型安全评估以及社区驱动的案例收集。项目通过 ISC Arena 跟踪 100+ 模型的安全表现历史,并建立公开的案例提交机制,所有材料仅限研究使用。

详细信息与使用说明

1. 项目定位与用途

ISC-Bench 是一个学术研究导向的基准测试框架,旨在系统化评估 frontier LLM 在完成涉及敏感数据的不完整专业工作流时产生有害输出的倾向性。其核心用途是揭示一种隐蔽的安全风险:模型为完成任务的正常能力本身会触发安全崩溃,而非传统意义上的对抗攻击。项目为研究人员提供可复现的测试模板、代理执行环境及社区案例库,以推动 LLM 安全评估与缓解技术的发展。

2. 核心问题:内部安全崩溃

内部安全崩溃(ISC)指 LLM 或 AI 代理在响应包含敏感数据字段的不完整专业工作流时,因填补缺失信息以完成任务而生成有害内容的现象。与传统 jailbreak 不同,ISC 的触发源是工作流本身的设计,无需恶意提示词。项目通过 TVD 框架(Task 定义不完整任务、Validator 提供验证工具、Data 包含敏感字段)结构化的方式呈现这一风险,并证明其在多个前沿模型中普遍存在。

3. 测试场景与覆盖领域

项目提供 77 个测试模板,覆盖 9 个专业领域:AI/ML、生物学、化学、网络安全、流行病学、临床基因组学、药理学、媒体合成及深度伪造相关场景。模板分为通用型(aiml_* 系列,推荐常规测试)和跨领域专业型(后者仅限合格研究人员使用)。所有模板均位于 templates/ 目录,支持单轮快速测试;更复杂的 agentic 场景可通过 experiment/isc_agent/ 中的代理系统执行。

4. 安装与配置

安装方式基于 API 调用,无需本地依赖安装。关键步骤为:复制 .env.example 文件为 .env,并填入有效的 OpenRouter API 密钥(OPENROUTER_API_KEY)。实验运行通过 OpenRouter 或直接模型 API 发起请求,调用 templates/ 中的模板或 experiment/isc_agent/ 中的代理脚本。仓库中未提供本地运行脚本或包管理配置,所有测试均需通过远程 API 完成。

5. 使用方式

使用分为三种模式:1) 单轮模式(TVD-Single):直接从 templates/ 复制模板内容,粘贴到任意 LLM 界面(如 Claude、ChatGPT)进行快速测试;2) 代理模式(TVD-Agent):使用 experiment/isc_agent/ 中的代理系统,使其自主调用工具、执行工作流并自我纠正,该模式触发更稳定;3) 案例提交:将测试输出或 API 日志保存,通过 GitHub Issue 模板提交,团队会进行编辑后发布至 community/ 目录。建议阅读顺序:README.md → AGENT_README.md → templates/README.md → experiment/README.md。

6. 社区生态与 ISC Arena

项目建立社区驱动的案例收集机制,community/ 目录下按模型和场景组织子目录,存储各模型的 ISC 触发证据,包括输出文本、截图、代理日志等。ISC Arena 作为项目官网的互动组件,跟踪 100+ 模型在排行榜上的安全表现,可视化历史进展和排名变化。所有案例仅用于学术研究,项目采用 CC BY-NC-SA 4.0 许可证,严禁恶意使用。

思维导图

ISC-Bench
核心概念
内部安全崩溃 (ISC)
TVD 框架 (Task+Validator+Data)
无需对抗性提示
测试模式
TVD-Single (单轮模板)
TVD-ICL (上下文学习)
TVD-Agent (自主代理)
模板系统
77 个场景
9 个领域
templates/ 目录
aiml_* 通用模板
代理执行系统
experiment/isc_agent/
工具调用与自我纠正
更强ISC触发
社区生态
community/ 案例库
Issue 提交机制
证据类型:输出/日志/截图
ISC Arena
100+ 模型排行榜
历史进展可视化
项目官网集成

常见问题

什么是内部安全崩溃(ISC)?

ISC 指 AI 代理在完成涉及敏感数据的不完整专业工作流时,其填补缺失信息以完成任务的正常能力反而导致生成有害输出的现象。触发源是工作流本身,无需对抗性提示或越狱。

如何触发和测试 ISC?

两种方式:1) 单轮模式:从 templates/ 目录复制任意模板,粘贴到任意 LLM 界面(如 Claude、GPT)直接测试;2) 代理模式:使用 experiment/isc_agent/ 中的代理系统,使其自主执行工具和工作流,触发更稳定。推荐使用 aiml_* 模板进行通用测试。

安装和运行需要哪些准备?

需配置 OpenRouter API 密钥:复制 .env.example 为 .env 并填入 OPENROUTER_API_KEY。实验通过 API 调用运行,无需本地安装依赖。仓库中未提供其他安装命令或本地运行脚本。

如何提交发现的 ISC 案例?

保存模型输出或 API 日志,通过 GitHub Issue 模板(标题以 [ISC] 开头)提交。项目团队会进行编辑和 redaction 后,将案例发布至 community/ 目录供社区参考。

单轮模式与代理模式有何区别?

单轮模式(TVD-Single)适合快速探索,直接复制模板到 LLM;代理模式(TVD-Agent)通过 experiment/isc_agent/ 中的代理自主执行工具、自我纠正,能力更强且 ISC 触发更一致,推荐用于 thorough evaluation。