Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
논문 링크 Fathom: 쿼리마다 깊이를 바꾸는 스캔으로 1M 토큰 디코딩을 1.67배 빠르게 하다한 줄 요약 (TL;DR)에이전트 세션이 1M 토큰까지 길어지고 수십 세션이 동시에 상주하면 KV 캐시와 이를 랭킹하는 인덱스가 호스트 메모리에 살게 되 …
20분
KV Cache
Long Context
Efficient Inference
LLM Inference
Attention Optimization
Quantization