联系我 ↗
← 返回首页
// RESEARCH / 03 / INFERENCE

推理架构

模型怎样被高效地跑起来:缓存、解码、调度,以及推理时的算力怎样换成推理能力。

实践过
当前状态
VI · IX
造物之书里的实验
// CURRENT THESIS
推理成本决定一个模型能被多少人真正用上。每一次重复计算、每一次缓存失效,最后都会变成用户等待的时间。

在 Eazo 参与 Prompt Caching 与模型调用链路优化:连接复用、配置并行初始化、扩展增量同步。也做过 cctop,把本地 token 记录与服务账单对账。

// OPEN QUESTIONS

我正在追的问题

  1. 01

    一个 Agent 的多轮对话里,有多少 token 在被重复计算?上下文怎样排布才能让前缀缓存命中?

  2. 02

    模型能否按题目难度提前退出,把简单题的算力省下来?

  3. 03

    投机解码在代码、中文长文本上的接受率有多高?

  4. 04

    Prefill / Decode 分离在什么负载下才值得?

// EXPERIMENTS

造物之书里的实验

每个实验都从一个可以被证伪的问题开始
// EVIDENCE LEDGER

已经公开的关联证据

链接能证明已有工作,不代表整个研究问题已经解决
// LIMITS

现在还不能证明什么