EXPERIMENT IV · AI SECURITY
从文本到行动
一段外部文本,要经过几步才能让 Agent 执行一次危险操作?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
提示注入真正的风险不在模型“说错话”,而在它读到外部内容后去调用了工具。需要把这条路径拆开,看每一步能在哪里被拦下。
假设
HYPOTHESIS大多数间接注入要经过“读取 → 采信 → 规划 → 调用”四步;在“调用”一步做最小权限,比在“读取”一步做检测拦截得更多。
最小装置
MINIMAL SETUP- 01构造网页、文档、工具返回值三类间接注入样本
- 02在带文件与网络工具的 Agent 中逐步记录执行轨迹
- 03分别只开启输入检测 / 只开启工具最小权限 / 两者都开,比较被拦截的位置
什么会证明我错了
FALSIFIED IF只开启输入检测的拦截率不低于只开启最小权限。
将会公开
WILL PUBLISH样本集、执行轨迹、拦截点统计,以及绕过成功的样本。
前期线索相关的已有工作,不是这个实验的结论
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗