联系我 ↗

EXPERIMENT VII · REASONING

循环的深度

同一组参数迭代 k 次,能不能替代堆叠 k 层?

待开始循环 Transformer权重共享PyTorch
  1. Q提出可证伪的问题当前阶段
  2. R做最小运行路径未开始
  3. E连接真实验证未开始
  4. P公开证据与限制未开始

为什么值得做

参数共享的循环结构让“想得更久”变成调节迭代次数,而不是换更大的模型。它在什么任务上成立,需要亲手复现。

Q

假设

HYPOTHESIS

在需要多步推理的小规模算法任务上,循环 Block 以更少参数接近同深度堆叠模型的表现。

R

最小装置

MINIMAL SETUP
  1. 01实现权重共享的循环 Block
  2. 02在加法、排序等算法任务上训练循环 / 堆叠 / 显式思维链三种模型
  3. 03比较参数量、准确率与推理时延
E

什么会证明我错了

FALSIFIED IF

同等迭代深度下,循环模型的准确率显著低于堆叠模型。

P

将会公开

WILL PUBLISH

训练代码、配置、曲线和失败的设置。

前期线索相关的已有工作,不是这个实验的结论

  • 循环 Transformer 复现此前做过小规模复现,这次从零重做并完整公开。

实验日志RUN LOG

还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。

去实验室 ↗