推理成本决定一个模型能被多少人真正用上。每一次重复计算、每一次缓存失效,最后都会变成用户等待的时间。
在 Eazo 参与 Prompt Caching 与模型调用链路优化:连接复用、配置并行初始化、扩展增量同步。也做过 cctop,把本地 token 记录与服务账单对账。
- 01
一个 Agent 的多轮对话里,有多少 token 在被重复计算?上下文怎样排布才能让前缀缓存命中?
- 02
模型能否按题目难度提前退出,把简单题的算力省下来?
- 03
投机解码在代码、中文长文本上的接受率有多高?
- 04
Prefill / Decode 分离在什么负载下才值得?
// LIMITS
现在还不能证明什么
- 线上优化经验来自公司内部,数据不能公开
- 还没有在开源推理框架上复现的对照数据