=Paper= {{Paper |id=Vol-4275/paper13 |storemode=property |title=CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference |pdfUrl=https://ceur-ws.org/Vol-4275/paper13.pdf |volume=Vol-4275 |authors=Xiaolin Lin,Jingcun Wang,Olga Kondrateva,Yiyu Shi,Bing Li,Grace Li Zhang }} ==CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference== https://ceur-ws.org/Vol-4275/paper13.pdf
None