SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking
논문 링크 SAS: 증류 없이 문맥 랭킹을 직접 학습하는 단순한 어텐션 스파시피케이션TL;DR — 사후 학습(post-training) 어텐션 스파시피케이션에서, 선택기(selector)가 만든 연속 점수를 어텐션 로짓에 로그 게이트(log gate) …
논문 링크 SAS: 증류 없이 문맥 랭킹을 직접 학습하는 단순한 어텐션 스파시피케이션TL;DR — 사후 학습(post-training) 어텐션 스파시피케이션에서, 선택기(selector)가 만든 연속 점수를 어텐션 로짓에 로그 게이트(log gate) …
논문 링크 VestigeKV: 퇴화한 RoPE 가지가 스스로 캐시 축출 신호를 품고 있다한 줄 요약 (TL;DR)NoPE-MLA 모델(Kimi Linear 48B)에서, 훈련이 샐리언스 채널 로 재용도한 64차원 decoupled branch — …
논문 링크 ShallowStream: 얕게 인덱싱하고, 깊게 답하라 — 스트리밍 비디오 이해의 계산 병목을 푸는 방법TL;DR — 스트리밍 비디오 이해에서 가장 비싼 비용은 매 프레임을 MLLM의 전체 깊이(28~32개 레이어) 로 prefill하는 …
논문 링크 모델이 ‘생각을 다시 꺼내 보는’ 순간을 잡아라: BeaconKV가 비콘 쿼리로 추론 KV 캐시를 5.8배 압축하는 법 TL;DR — Large Reasoning Model(LRM)은 긴 …
논문 링크 언어 모델이 스스로 어텐션을 통제한다: Declarative AttentionTL;DR — 기존의 희소 어텐션(sparse attention)은 매 디코딩 스텝마다 어떤 토큰이 중요한지 외부에서 근사 하느라 여전히 $O(N)$ 비용을 지불했 …
논문 링크 같은 요청, 다른 답: 프리픽스 캐시가 서빙을 비재현적으로 만들고, 양자화가 이를 증폭시킨다 TL;DR — 프리픽스 캐시는 “투명한 최적화"로 여겨지지만 투명하지 않다. 캐시를 끄면 동일 워크로드의 반복 실행이 10개 설 …
논문 링크 SGD-KV: ‘요약을 잘하는 헤드’를 찾아 1M 토큰의 KV 캐시를 75%까지 줄인다 TL;DR — 어텐션 헤드는 모두 같은 일을 하지 않는다. ‘요약’이라는 고차원 정보 압축을 담당하는 …
논문 링크 점수는 낭비였다: KV 캐시 eviction에서 ‘무작위 추출’이 최강자와 동률이 되는 역설 — Random Attention 심층 리뷰 TL;DR — 추론 특화 KV 캐시 eviction 연구는 전부 “어떤 …