稀疏预填充先用便宜的打分器估计哪些 prompt token 重要,只对选中的部分做完整预填充。打分在输入固定时是确定的,但服务端对字节完全相同的 prompt 每次都重跑——生产日志里同一个两万多 token 的 prompt 在一分半内被重复打分四次。
有意思的地方是不能靠已有缓存绕开它。跑完之后缓存里存的是稀疏 KV,按「选中了哪些 token」索引;想用它跳过打分,就得先知道选中了哪些——而那正是打分的产物。唯一的破法是拿打分之前就在手的东西作键,也就是原始 token 的哈希。
截至 2026 年 7 月 27 日,这个 PR 仍开放且尚未合并;实时状态以 GitHub 为准。