Efficient Memory Management for Large Language Model Serving with PagedAttention
- 原论文报告
- 论文报告称,在其评测条件下,vLLM 相比 FasterTransformer 和 Orca 在延迟相当时将吞吐量提高了 2-4 倍。
- 适用范围
- 适用于论文所评测模型与工作负载下的服务期 KV 缓存内存管理和共享。
- 证据边界
- 这是原论文报告的对比结果,不是普适加速承诺,也不能证明语义级缓存等价。
OmniWise sample · KV cache survey
沿着一条应与研究稿同时公开的证据链,检查这份生成式初稿。
生成式演示稿,不是已发表或经过同行评审的论文。
本样例是文献综述,OmniWise 未运行引用论文所报告的实验。
PDF 保留了可见的草稿占位信息,包括匿名单位和占位出版元数据。所有结论都应作为独立核验的起点。
原始完整 LaTeX 工程未随静态 PDF 保存。下方 LaTeX 下载是明确标注的 companion 摘录,不是对原始来源的伪造重建。
四篇代表论文,每篇都链接到官方出版社或会议论文集页面。
kwon2023pagedattention
Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E. Gonzalez, Hao Zhang, and Ion Stoica · SOSP 2023
官方来源zhang2023h2o
Zhenyu Zhang, Ying Sheng, Tianyi Zhou, Tianlong Chen, Lianmin Zheng, Ruisi Cai, Zhao Song, Yuandong Tian, Christopher Re, Clark Barrett, Zhangyang Wang, and Beidi Chen · NeurIPS 2023
官方来源li2024snapkv
Yuhong Li, Yingbing Huang, Bowen Yang, Bharat Venkitesh, Acyr Locatelli, Hanchen Ye, Tianle Cai, Patrick Lewis, and Deming Chen · NeurIPS 2024
官方来源zhao2025semsharekv
Xinye Zhao and Spyridon Mastorakis · Findings of IJCNLP-AACL 2025
官方来源原论文报告的结果始终与其评测条件和限制绑定。
Efficient Memory Management for Large Language Model Serving with PagedAttention
H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models
SnapKV: LLM Knows What You are Looking for Before Generation
SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching
可下载文献库与证据图、LaTeX 摘录使用完全一致的四个稳定引用键。
@inproceedings{kwon2023pagedattention,
title = {Efficient Memory Management for Large Language Model Serving with PagedAttention},
author = {Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E. Gonzalez, Hao Zhang, and Ion Stoica},
booktitle = {SOSP 2023},
year = {2023},
url = {https://dl.acm.org/doi/10.1145/3600006.3613165}
}
@inproceedings{zhang2023h2o,
title = {H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models},
author = {Zhenyu Zhang, Ying Sheng, Tianyi Zhou, Tianlong Chen, Lianmin Zheng, Ruisi Cai, Zhao Song, Yuandong Tian, Christopher Re, Clark Barrett, Zhangyang Wang, and Beidi Chen},
booktitle = {NeurIPS 2023},
year = {2023},
url = {https://proceedings.neurips.cc/paper_files/paper/2023/hash/6ceefa7b15572587b78ecfcebb2827f8-Abstract-Conference.html}
}
@inproceedings{li2024snapkv,
title = {SnapKV: LLM Knows What You are Looking for Before Generation},
author = {Yuhong Li, Yingbing Huang, Bowen Yang, Bharat Venkitesh, Acyr Locatelli, Hanchen Ye, Tianle Cai, Patrick Lewis, and Deming Chen},
booktitle = {NeurIPS 2024},
year = {2024},
url = {https://proceedings.neurips.cc/paper_files/paper/2024/hash/28ab418242603e0f7323e54185d19bde-Abstract-Conference.html}
}
@inproceedings{zhao2025semsharekv,
title = {SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching},
author = {Xinye Zhao and Spyridon Mastorakis},
booktitle = {Findings of IJCNLP-AACL 2025},
year = {2025},
url = {https://aclanthology.org/2025.findings-ijcnlp.25/}
}这份可编译的小型摘录展示引用接线,但不会冒充已经遗失的完整源码工程。
Evidence remains bounded \\cite{kwon2023pagedattention,zhang2023h2o,li2024snapkv,zhao2025semsharekv}.
\bibliographystyle{plain}
\bibliography{references}