上游贡献 · #2346

按 prompt 哈希记忆化 SpecPrefill 的打分结果

字节相同的 prompt 每次重新打分。缓存了输入(草稿 KV),没有缓存输出(选中的 token)。

状态
仍开放,尚未合并
提交
改动
+511 / −10
分组
调度与推测式预填充

稀疏预填充先用便宜的打分器估计哪些 prompt token 重要,只对选中的部分做完整预填充。打分在输入固定时是确定的,但服务端对字节完全相同的 prompt 每次都重跑——生产日志里同一个两万多 token 的 prompt 在一分半内被重复打分四次。

有意思的地方是不能靠已有缓存绕开它。跑完之后缓存里存的是稀疏 KV,按「选中了哪些 token」索引;想用它跳过打分,就得先知道选中了哪些——而那正是打分的产物。唯一的破法是拿打分之前就在手的东西作键,也就是原始 token 的哈希。

截至 2026 年 7 月 27 日,这个 PR 仍开放且尚未合并;实时状态以 GitHub 为准。