返回 OmniWise透明样例链路

OmniWise sample · KV cache survey

从一手来源到可审阅的 LaTeX 工件

沿着一条应与研究稿同时公开的证据链,检查这份生成式初稿。

生成式演示稿,不是已发表或经过同行评审的论文。

本样例是文献综述,OmniWise 未运行引用论文所报告的实验。

PDF 保留了可见的草稿占位信息,包括匿名单位和占位出版元数据。所有结论都应作为独立核验的起点。

原始完整 LaTeX 工程未随静态 PDF 保存。下方 LaTeX 下载是明确标注的 companion 摘录,不是对原始来源的伪造重建。

KV cache survey generated draft preview

1. 一手来源

四篇代表论文,每篇都链接到官方出版社或会议论文集页面。

  1. kwon2023pagedattention

    Efficient Memory Management for Large Language Model Serving with PagedAttention

    Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E. Gonzalez, Hao Zhang, and Ion Stoica · SOSP 2023

    官方来源
  2. zhang2023h2o

    H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models

    Zhenyu Zhang, Ying Sheng, Tianyi Zhou, Tianlong Chen, Lianmin Zheng, Ruisi Cai, Zhao Song, Yuandong Tian, Christopher Re, Clark Barrett, Zhangyang Wang, and Beidi Chen · NeurIPS 2023

    官方来源
  3. li2024snapkv

    SnapKV: LLM Knows What You are Looking for Before Generation

    Yuhong Li, Yingbing Huang, Bowen Yang, Bharat Venkitesh, Acyr Locatelli, Hanchen Ye, Tianle Cai, Patrick Lewis, and Deming Chen · NeurIPS 2024

    官方来源
  4. zhao2025semsharekv

    SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching

    Xinye Zhao and Spyridon Mastorakis · Findings of IJCNLP-AACL 2025

    官方来源

2. 有边界的证据

原论文报告的结果始终与其评测条件和限制绑定。

Efficient Memory Management for Large Language Model Serving with PagedAttention

原论文报告
论文报告称,在其评测条件下,vLLM 相比 FasterTransformer 和 Orca 在延迟相当时将吞吐量提高了 2-4 倍。
适用范围
适用于论文所评测模型与工作负载下的服务期 KV 缓存内存管理和共享。
证据边界
这是原论文报告的对比结果,不是普适加速承诺,也不能证明语义级缓存等价。

H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models

原论文报告
在保留 20% 重 hitter 的设置下,论文报告相对三种指定推理系统的吞吐提升上限分别为 29 倍、29 倍和 3 倍,同批量下延迟最多降低 1.9 倍。
适用范围
适用于论文描述的 OPT-6.7B、OPT-30B 实验和对应基线中的 KV 缓存淘汰。
证据边界
这些上限依赖模型、20% 策略、工作负载和对比系统,不能与其他论文数字直接横向比较。

SnapKV: LLM Knows What You are Looking for Before Generation

原论文报告
针对 16K token 输入,论文报告生成速度提高 3.6 倍、内存效率提高 8.2 倍,并在 16 个长序列数据集上进行了评测。
适用范围
适用于 SnapKV 所研究的、利用提示末端观察窗口选择重要 KV 位置的免微调方法。
证据边界
报告数值受论文硬件、基线、输入长度和任务集约束,本页面不将其外推到所有部署。

SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching

原论文报告
在论文针对 5K token 输入的摘要实验中,SemShareKV 报告最高 6.25 倍加速和 42% 的 GPU 内存下降。
适用范围
适用于所评测摘要场景中,语义相似提示之间的模糊 token 匹配与选择性 KV 复用。
证据边界
证据受任务和配置约束,不能据此认定已实现生产范围的跨模型缓存共享。

3. BibTeX

可下载文献库与证据图、LaTeX 摘录使用完全一致的四个稳定引用键。

@inproceedings{kwon2023pagedattention, title = {Efficient Memory Management for Large Language Model Serving with PagedAttention}, author = {Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E. Gonzalez, Hao Zhang, and Ion Stoica}, booktitle = {SOSP 2023}, year = {2023}, url = {https://dl.acm.org/doi/10.1145/3600006.3613165} } @inproceedings{zhang2023h2o, title = {H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models}, author = {Zhenyu Zhang, Ying Sheng, Tianyi Zhou, Tianlong Chen, Lianmin Zheng, Ruisi Cai, Zhao Song, Yuandong Tian, Christopher Re, Clark Barrett, Zhangyang Wang, and Beidi Chen}, booktitle = {NeurIPS 2023}, year = {2023}, url = {https://proceedings.neurips.cc/paper_files/paper/2023/hash/6ceefa7b15572587b78ecfcebb2827f8-Abstract-Conference.html} } @inproceedings{li2024snapkv, title = {SnapKV: LLM Knows What You are Looking for Before Generation}, author = {Yuhong Li, Yingbing Huang, Bowen Yang, Bharat Venkitesh, Acyr Locatelli, Hanchen Ye, Tianle Cai, Patrick Lewis, and Deming Chen}, booktitle = {NeurIPS 2024}, year = {2024}, url = {https://proceedings.neurips.cc/paper_files/paper/2024/hash/28ab418242603e0f7323e54185d19bde-Abstract-Conference.html} } @inproceedings{zhao2025semsharekv, title = {SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching}, author = {Xinye Zhao and Spyridon Mastorakis}, booktitle = {Findings of IJCNLP-AACL 2025}, year = {2025}, url = {https://aclanthology.org/2025.findings-ijcnlp.25/} }
BibTeX

4. Companion LaTeX

这份可编译的小型摘录展示引用接线,但不会冒充已经遗失的完整源码工程。

Evidence remains bounded \\cite{kwon2023pagedattention,zhang2023h2o,li2024snapkv,zhao2025semsharekv}. \bibliographystyle{plain} \bibliography{references}
Companion LaTeX