Language Models Can Control Their Own Attention
논문 링크 언어 모델이 스스로 어텐션을 통제한다: Declarative AttentionTL;DR — 기존의 희소 어텐션(sparse attention)은 매 디코딩 스텝마다 어떤 토큰이 중요한지 외부에서 근사 하느라 여전히 $O(N)$ 비용을 지불했 …
기술과 일상에 대한 글 목록입니다.
논문 링크 언어 모델이 스스로 어텐션을 통제한다: Declarative AttentionTL;DR — 기존의 희소 어텐션(sparse attention)은 매 디코딩 스텝마다 어떤 토큰이 중요한지 외부에서 근사 하느라 여전히 $O(N)$ 비용을 지불했 …
논문 링크 같은 요청, 다른 답: 프리픽스 캐시가 서빙을 비재현적으로 만들고, 양자화가 이를 증폭시킨다 TL;DR — 프리픽스 캐시는 “투명한 최적화"로 여겨지지만 투명하지 않다. 캐시를 끄면 동일 워크로드의 반복 실행이 10개 설 …
논문 링크 SGD-KV: ‘요약을 잘하는 헤드’를 찾아 1M 토큰의 KV 캐시를 75%까지 줄인다 TL;DR — 어텐션 헤드는 모두 같은 일을 하지 않는다. ‘요약’이라는 고차원 정보 압축을 담당하는 …
논문 링크 SMELT: 계산량을 맞춘 MoE 루프 트랜스포머의 스케일링 법칙한 줄 요약 (TL;DR)루프 트랜스포머는 레이어 블록을 반복 실행해 깊이를 늘리지만, 기존 연구는 대부분 파라미터 수만 고정한 채 FLOPs를 늘려 “공짜 점수 …
논문 링크 순환 절반은 양자화하기 쉬운 절반이다: Gated DeltaNet이 4비트에서 살아남는 이유TL;DR — 하이브리드 27B LLM(Qwen3.8-27B)의 순환 레이어인 Gated DeltaNet(GDN) 48개 층은 그동안 “오 …
논문 링크 점수는 낭비였다: KV 캐시 eviction에서 ‘무작위 추출’이 최강자와 동률이 되는 역설 — Random Attention 심층 리뷰 TL;DR — 추론 특화 KV 캐시 eviction 연구는 전부 “어떤 …