联系我 ↗

EXPERIMENT IV · AI SECURITY

从文本到行动

一段外部文本,要经过几步才能让 Agent 执行一次危险操作?

待开始提示词注入工具权限Agent 安全
  1. Q提出可证伪的问题当前阶段
  2. R做最小运行路径未开始
  3. E连接真实验证未开始
  4. P公开证据与限制未开始

为什么值得做

提示注入真正的风险不在模型“说错话”,而在它读到外部内容后去调用了工具。需要把这条路径拆开,看每一步能在哪里被拦下。

Q

假设

HYPOTHESIS

大多数间接注入要经过“读取 → 采信 → 规划 → 调用”四步;在“调用”一步做最小权限,比在“读取”一步做检测拦截得更多。

R

最小装置

MINIMAL SETUP
  1. 01构造网页、文档、工具返回值三类间接注入样本
  2. 02在带文件与网络工具的 Agent 中逐步记录执行轨迹
  3. 03分别只开启输入检测 / 只开启工具最小权限 / 两者都开,比较被拦截的位置
E

什么会证明我错了

FALSIFIED IF

只开启输入检测的拦截率不低于只开启最小权限。

P

将会公开

WILL PUBLISH

样本集、执行轨迹、拦截点统计,以及绕过成功的样本。

前期线索相关的已有工作,不是这个实验的结论

实验日志RUN LOG

还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。

去实验室 ↗