EXPERIMENT VII · REASONING
循环的深度
同一组参数迭代 k 次,能不能替代堆叠 k 层?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
参数共享的循环结构让“想得更久”变成调节迭代次数,而不是换更大的模型。它在什么任务上成立,需要亲手复现。
假设
HYPOTHESIS在需要多步推理的小规模算法任务上,循环 Block 以更少参数接近同深度堆叠模型的表现。
最小装置
MINIMAL SETUP- 01实现权重共享的循环 Block
- 02在加法、排序等算法任务上训练循环 / 堆叠 / 显式思维链三种模型
- 03比较参数量、准确率与推理时延
什么会证明我错了
FALSIFIED IF同等迭代深度下,循环模型的准确率显著低于堆叠模型。
将会公开
WILL PUBLISH训练代码、配置、曲线和失败的设置。
前期线索相关的已有工作,不是这个实验的结论
- 循环 Transformer 复现此前做过小规模复现,这次从零重做并完整公开。
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗