Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
논문 링크 Fathom: 쿼리마다 깊이를 바꾸는 스캔으로 1M 토큰 디코딩을 1.67배 빠르게 하다한 줄 요약 (TL;DR)에이전트 세션이 1M 토큰까지 길어지고 수십 세션이 동시에 상주하면 KV 캐시와 이를 랭킹하는 인덱스가 호스트 메모리에 살게 되 …
디코딩이 길어질수록 KV 캐시가 메모리를 먹는다는 문제는 같은데, 그걸 푸는 방향은 논문마다 다릅니다. 이 태그의 글들이 나뉘는 축:
같은 주제를 닫힌 분류로 모은 kv-cache 카테고리 도 있습니다.
논문 링크 Fathom: 쿼리마다 깊이를 바꾸는 스캔으로 1M 토큰 디코딩을 1.67배 빠르게 하다한 줄 요약 (TL;DR)에이전트 세션이 1M 토큰까지 길어지고 수십 세션이 동시에 상주하면 KV 캐시와 이를 랭킹하는 인덱스가 호스트 메모리에 살게 되 …
논문 링크 ZGCM-1: 7B 밀집 모델이 235B 프런티어와 겨루는 법 — 완전 개방형·초고효율 파운데이션 모델 설계 보고서TL;DR — ZGCM-1은 7.39B 밀집(dense) 모델 하나로 AIME 2026 75.0%, WebWalkerQA …
논문 링크 SAS: 증류 없이 문맥 랭킹을 직접 학습하는 단순한 어텐션 스파시피케이션TL;DR — 사후 학습(post-training) 어텐션 스파시피케이션에서, 선택기(selector)가 만든 연속 점수를 어텐션 로짓에 로그 게이트(log gate) …
논문 링크 CoVeR: 지오메트리만으로 멀티뷰 3D 추론의 비주얼 토큰을 92%까지 덜어내는 커버리지 기반 프루닝한 줄 요약 (TL;DR)3D 장면을 여러 시점 이미지로 렌더링해 2D VLM에 넣으면 토큰이 시점 수에 비례해 폭증한다. CoVeR는 학 …
논문 링크 칼만 필터로 다시 쓴 선형 어텐션: Kalman Delta Networks한 줄 요약 (TL;DR)선형 어텐션(linear attention)의 고정 크기 recurrent memory 갱신을 선형-가우시안 상태공간 모델 로 재해석하고, 최 …
논문 링크 데드라인을 채우는 프리필 청크: SLOWeave — LLM 서빙의 적응형 청킹 스케줄러 TL;DR — 고정된 프리필 청크 크기 대신, 매 반복(iteration)마다 “가장 이른 디코드 데드라인 전에 끝나는 가장 큰 프리필 청크 …
논문 링크 비디오 LLM은 왜 아직도 비싼가? — 추론 효율화 메커니즘 4단계 총정리TL;DR — 이 논문은 2022년 말부터 2026년 8월까지 발표된 VideoLLM 추론 효율화 연구 125편을 엔코더–커넥터–LLM 파이프라인의 4단계로 분류하고, …
논문 링크 VestigeKV: 퇴화한 RoPE 가지가 스스로 캐시 축출 신호를 품고 있다한 줄 요약 (TL;DR)NoPE-MLA 모델(Kimi Linear 48B)에서, 훈련이 샐리언스 채널 로 재용도한 64차원 decoupled branch — …
논문 링크 ShallowStream: 얕게 인덱싱하고, 깊게 답하라 — 스트리밍 비디오 이해의 계산 병목을 푸는 방법TL;DR — 스트리밍 비디오 이해에서 가장 비싼 비용은 매 프레임을 MLLM의 전체 깊이(28~32개 레이어) 로 prefill하는 …
논문 링크 모델이 ‘생각을 다시 꺼내 보는’ 순간을 잡아라: BeaconKV가 비콘 쿼리로 추론 KV 캐시를 5.8배 압축하는 법 TL;DR — Large Reasoning Model(LRM)은 긴 …
논문 링크 언어 모델이 스스로 어텐션을 통제한다: Declarative AttentionTL;DR — 기존의 희소 어텐션(sparse attention)은 매 디코딩 스텝마다 어떤 토큰이 중요한지 외부에서 근사 하느라 여전히 $O(N)$ 비용을 지불했 …
논문 링크 SGD-KV: ‘요약을 잘하는 헤드’를 찾아 1M 토큰의 KV 캐시를 75%까지 줄인다 TL;DR — 어텐션 헤드는 모두 같은 일을 하지 않는다. ‘요약’이라는 고차원 정보 압축을 담당하는 …
논문 링크 SMELT: 계산량을 맞춘 MoE 루프 트랜스포머의 스케일링 법칙한 줄 요약 (TL;DR)루프 트랜스포머는 레이어 블록을 반복 실행해 깊이를 늘리지만, 기존 연구는 대부분 파라미터 수만 고정한 채 FLOPs를 늘려 “공짜 점수 …
논문 링크 순환 절반은 양자화하기 쉬운 절반이다: Gated DeltaNet이 4비트에서 살아남는 이유TL;DR — 하이브리드 27B LLM(Qwen3.8-27B)의 순환 레이어인 Gated DeltaNet(GDN) 48개 층은 그동안 “오 …
논문 링크 점수는 낭비였다: KV 캐시 eviction에서 ‘무작위 추출’이 최강자와 동률이 되는 역설 — Random Attention 심층 리뷰 TL;DR — 추론 특화 KV 캐시 eviction 연구는 전부 “어떤 …
논문 링크 Dynamic Memory Sparsification(DMS): KV 캐시 8× 압축으로 LLM 하이퍼-스케일링을 현실로한 줄 요약 (TL;DR)1 K 스텝만의 경량 재적합과 지연 퇴출 전략을 결합한 DMS는 KV 캐시를 최대 8× 압축하면 …
논문 링크 ⚡️TL;DRKVzip는 LLM의 KV 캐시를 한 번 압축해도 이후 모든 질의 · 세션에서 재사용할 수 있도록 설계된 query-agnostic 캐시 컴프레서다. 그 결과 정확도 손실 ≤ 3 pp를 유지하면서 레이턴시 2 × ↓, 메모리 …