联系我 ↗

EXPERIMENT II · ALGORITHMS

模型在看哪里

长上下文里,模型每一步真正在看的 token 有多少?

待开始注意力稀疏注意力KV Cache
  1. Q提出可证伪的问题当前阶段
  2. R做最小运行路径未开始
  3. E连接真实验证未开始
  4. P公开证据与限制未开始

为什么值得做

稀疏注意力、MLA、KV Cache 压缩都建立在一个前提上:大部分 token 在大部分时候并不重要。这个前提在什么任务上成立,值得自己量一遍。

Q

假设

HYPOTHESIS

在长文档问答中,每个解码步里注意力权重前 5% 的 token 覆盖了绝大部分注意力质量,且这些 token 在相邻步之间高度重叠。

R

最小装置

MINIMAL SETUP
  1. 01在开源小模型上导出长文档问答的逐层、逐头注意力
  2. 02统计 top-k 覆盖率、相邻步重叠率随层数和上下文长度的变化
  3. 03只保留 top-k 的 KV 重新解码,比较答案变化
E

什么会证明我错了

FALSIFIED IF

保留 top-k KV 后答案准确率明显下降,或覆盖率随上下文增长快速分散。

P

将会公开

WILL PUBLISH

统计脚本、各层热力图、截断实验结果,以及稀疏假设不成立的任务。

实验日志RUN LOG

还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。

去实验室 ↗