KV Cache

디코딩이 길어질수록 KV 캐시가 메모리를 먹는다는 문제는 같은데, 그걸 푸는 방향은 논문마다 다릅니다. 이 태그의 글들이 나뉘는 축:

  • 무엇을 버릴지 고르는 문제 — 어텐션 점수 기반 축출, 쿼리에 독립적인 압축, 모델이 스스로 내보내는 축출 신호
  • 얼마나 정밀하게 둘지 — 4비트·FP4 양자화와 그때 생기는 오차
  • 어디에 둘지 — GPU 밖으로 내보내고 필요한 만큼만 읽어 오기
  • 다시 쓸 수 있는지 — 접두사 공유, 모델 사이의 캐시 재사용

같은 주제를 닫힌 분류로 모은 kv-cache 카테고리 도 있습니다.

17페이지

Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches

논문 링크 Fathom: 쿼리마다 깊이를 바꾸는 스캔으로 1M 토큰 디코딩을 1.67배 빠르게 하다한 줄 요약 (TL;DR)에이전트 세션이 1M 토큰까지 길어지고 수십 세션이 동시에 상주하면 KV 캐시와 이를 랭킹하는 인덱스가 호스트 메모리에 살게 되 …

20분
KV Cache Long Context Efficient Inference LLM Inference Attention Optimization Quantization

Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

논문 링크 비디오 LLM은 왜 아직도 비싼가? — 추론 효율화 메커니즘 4단계 총정리TL;DR — 이 논문은 2022년 말부터 2026년 8월까지 발표된 VideoLLM 추론 효율화 연구 125편을 엔코더–커넥터–LLM 파이프라인의 4단계로 분류하고, …

14분
Long Context KV Cache Multimodal Learning Vision-Language Model Efficient Inference Large Language Models