=Paper=
{{Paper
|id=Vol-4275/paper13
|storemode=property
|title=CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference
|pdfUrl=https://ceur-ws.org/Vol-4275/paper13.pdf
|volume=Vol-4275
|authors=Xiaolin Lin,Jingcun Wang,Olga Kondrateva,Yiyu Shi,Bing Li,Grace Li Zhang
}}
==CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference==
None