联系我 ↗

EXPERIMENT VI · INFERENCE

重复的前缀

一个 Agent 的多轮对话里,有多少 token 在被重复计算?

待开始Prompt Caching前缀缓存vLLM
  1. Q提出可证伪的问题当前阶段
  2. R做最小运行路径未开始
  3. E连接真实验证未开始
  4. P公开证据与限制未开始

为什么值得做

Agent 每一轮都会把系统提示、工具定义和历史重新发给模型。前缀缓存能省下这部分,但只要上下文顺序稍有变化,缓存就会失效。

Q

假设

HYPOTHESIS

把稳定内容(系统提示、工具定义、Skills)固定在前、易变内容放在后,缓存命中率能提高一倍以上,首 token 时延随之下降。

R

最小装置

MINIMAL SETUP
  1. 01记录真实编码 Agent 多轮会话的完整请求
  2. 02在 vLLM 开启前缀缓存,对照原始顺序与重排后的上下文
  3. 03统计命中 token 比例、首 token 时延与总成本
E

什么会证明我错了

FALSIFIED IF

重排后命中率提升不到 20%,或重排损害了任务通过率。

P

将会公开

WILL PUBLISH

会话请求样本(脱敏)、重排规则、命中率与时延对照。

前期线索相关的已有工作,不是这个实验的结论

  • Prompt Caching 链路优化在 Eazo 参与过 Prompt Caching 与模型调用链路优化;这里用开源推理框架独立复现。

实验日志RUN LOG

还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。

去实验室 ↗