Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
논문 링크 점수는 낭비였다: KV 캐시 eviction에서 ‘무작위 추출’이 최강자와 동률이 되는 역설 — Random Attention 심층 리뷰 TL;DR — 추론 특화 KV 캐시 eviction 연구는 전부 “어떤 …
19분
KV Cache
vLLM
Natural Language Processing
논문 링크 점수는 낭비였다: KV 캐시 eviction에서 ‘무작위 추출’이 최강자와 동률이 되는 역설 — Random Attention 심층 리뷰 TL;DR — 추론 특화 KV 캐시 eviction 연구는 전부 “어떤 …
![[논문리뷰] Marconi: Prefix Caching for the Era of Hybrid LLMs](https://pbs.twimg.com/media/GdyLXO9W4AADox0.jpg)
논문 링크 같은 논문을 2025-03-12 에도 한 번 더 정리해 두었다. Marconi: 하이브리드 LLM 시대의 프리픽스 캐싱을 다시 설계하다한 줄 요약 (TL;DR)Marconi는 하이브리드 LLM(Attention+SSM) 서빙에서 재사용 가능 …
논문 링크 Hydragen: 공유 프리픽스가 있는 대규모 배치를 32 × 빠르게 디코딩하는 비밀 병기한 줄 요약 (TL;DR)Softmax 분모 재스케일링으로 프리픽스-서픽스를 분해해 Code-Llama-13 B 기준 vLLM보다 최대 32배 빠르게, …