EXPERIMENT VI · INFERENCE
重复的前缀
一个 Agent 的多轮对话里,有多少 token 在被重复计算?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
Agent 每一轮都会把系统提示、工具定义和历史重新发给模型。前缀缓存能省下这部分,但只要上下文顺序稍有变化,缓存就会失效。
假设
HYPOTHESIS把稳定内容(系统提示、工具定义、Skills)固定在前、易变内容放在后,缓存命中率能提高一倍以上,首 token 时延随之下降。
最小装置
MINIMAL SETUP- 01记录真实编码 Agent 多轮会话的完整请求
- 02在 vLLM 开启前缀缓存,对照原始顺序与重排后的上下文
- 03统计命中 token 比例、首 token 时延与总成本
什么会证明我错了
FALSIFIED IF重排后命中率提升不到 20%,或重排损害了任务通过率。
将会公开
WILL PUBLISH会话请求样本(脱敏)、重排规则、命中率与时延对照。
前期线索相关的已有工作,不是这个实验的结论
- Prompt Caching 链路优化在 Eazo 参与过 Prompt Caching 与模型调用链路优化;这里用开源推理框架独立复现。
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗