EXPERIMENT II · ALGORITHMS
模型在看哪里
长上下文里,模型每一步真正在看的 token 有多少?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
稀疏注意力、MLA、KV Cache 压缩都建立在一个前提上:大部分 token 在大部分时候并不重要。这个前提在什么任务上成立,值得自己量一遍。
假设
HYPOTHESIS在长文档问答中,每个解码步里注意力权重前 5% 的 token 覆盖了绝大部分注意力质量,且这些 token 在相邻步之间高度重叠。
最小装置
MINIMAL SETUP- 01在开源小模型上导出长文档问答的逐层、逐头注意力
- 02统计 top-k 覆盖率、相邻步重叠率随层数和上下文长度的变化
- 03只保留 top-k 的 KV 重新解码,比较答案变化
什么会证明我错了
FALSIFIED IF保留 top-k KV 后答案准确率明显下降,或覆盖率随上下文增长快速分散。
将会公开
WILL PUBLISH统计脚本、各层热力图、截断实验结果,以及稀疏假设不成立的任务。
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗