EXPERIMENT X · DECISION
该不该自己决定
哪些判断应该交给模型,哪些应该回退给人或规则?
- Q提出可证伪的问题当前阶段
- R做最小运行路径未开始
- E连接真实验证未开始
- P公开证据与限制未开始
为什么值得做
意图识别、任务分流这类判断,用生成式模型做既慢又难控制。类型化的概率输出也许能把“要不要自动处理”变成一个可以设阈值的决定。
假设
HYPOTHESIS类型化决策加置信度门控,在路由准确率接近生成式结构化输出的同时,显著降低时延与调用成本。
最小装置
MINIMAL SETUP- 01调研类型化概率输出与 RLCD
- 02在同一批分流任务上对照:生成式结构化输出 / 类型化决策 + 门控
- 03记录路由准确率、误判后的回退、时延和成本
什么会证明我错了
FALSIFIED IF类型化决策的误判率明显更高,且无法通过门控回退弥补。
将会公开
WILL PUBLISH任务集、两种方案的对照数据、适用与不适用的任务类型。
前期线索相关的已有工作,不是这个实验的结论
- Jev 类型化决策模型目前处于调研阶段。
实验日志RUN LOG
还没有记录。实验开始后,每一次运行、失败和修正都会记在实验室里。
去实验室 ↗