Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
논문 링크 Fathom: 쿼리마다 깊이를 바꾸는 스캔으로 1M 토큰 디코딩을 1.67배 빠르게 하다한 줄 요약 (TL;DR)에이전트 세션이 1M 토큰까지 길어지고 수십 세션이 동시에 상주하면 KV 캐시와 이를 랭킹하는 인덱스가 호스트 메모리에 살게 되 …
문맥 길이가 늘어나면 어텐션 비용과 KV 캐시가 함께 커집니다. 이 태그의 글들은 대체로 네 갈래 중 하나입니다.
논문 링크 Fathom: 쿼리마다 깊이를 바꾸는 스캔으로 1M 토큰 디코딩을 1.67배 빠르게 하다한 줄 요약 (TL;DR)에이전트 세션이 1M 토큰까지 길어지고 수십 세션이 동시에 상주하면 KV 캐시와 이를 랭킹하는 인덱스가 호스트 메모리에 살게 되 …
논문 링크 ZGCM-1: 7B 밀집 모델이 235B 프런티어와 겨루는 법 — 완전 개방형·초고효율 파운데이션 모델 설계 보고서TL;DR — ZGCM-1은 7.39B 밀집(dense) 모델 하나로 AIME 2026 75.0%, WebWalkerQA …
논문 링크 SAS: 증류 없이 문맥 랭킹을 직접 학습하는 단순한 어텐션 스파시피케이션TL;DR — 사후 학습(post-training) 어텐션 스파시피케이션에서, 선택기(selector)가 만든 연속 점수를 어텐션 로짓에 로그 게이트(log gate) …
논문 링크 칼만 필터로 다시 쓴 선형 어텐션: Kalman Delta Networks한 줄 요약 (TL;DR)선형 어텐션(linear attention)의 고정 크기 recurrent memory 갱신을 선형-가우시안 상태공간 모델 로 재해석하고, 최 …
논문 링크 데드라인을 채우는 프리필 청크: SLOWeave — LLM 서빙의 적응형 청킹 스케줄러 TL;DR — 고정된 프리필 청크 크기 대신, 매 반복(iteration)마다 “가장 이른 디코드 데드라인 전에 끝나는 가장 큰 프리필 청크 …
논문 링크 비디오 LLM은 왜 아직도 비싼가? — 추론 효율화 메커니즘 4단계 총정리TL;DR — 이 논문은 2022년 말부터 2026년 8월까지 발표된 VideoLLM 추론 효율화 연구 125편을 엔코더–커넥터–LLM 파이프라인의 4단계로 분류하고, …
논문 링크 대규모·장문맥 RL 사후학습에서 Speculative Decoding을 실용화하는 두 가지 설계TL;DR : RL 사후학습의 벽-클록 시간을 지배하는 롤아웃 생성을 speculative decoding으로 가속하고, 여기에 온라인 드래프트 …
논문 링크 Uno: AR과 Diffusion을 하나의 모델에 — 무손실 병렬 생성을 통한 LLM 가속TL;DR — LLM이 느린 이유는 next-token prediction(NTP)이 한 번에 토큰 하나씩만 내놓는 순차 구조 때문이다. Uno는 하나 …
논문 링크 언어 모델이 스스로 어텐션을 통제한다: Declarative AttentionTL;DR — 기존의 희소 어텐션(sparse attention)은 매 디코딩 스텝마다 어떤 토큰이 중요한지 외부에서 근사 하느라 여전히 $O(N)$ 비용을 지불했 …
논문 링크 SGD-KV: ‘요약을 잘하는 헤드’를 찾아 1M 토큰의 KV 캐시를 75%까지 줄인다 TL;DR — 어텐션 헤드는 모두 같은 일을 하지 않는다. ‘요약’이라는 고차원 정보 압축을 담당하는 …
![[논문리뷰]: Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models](https://paper-assets.alphaxiv.org/figures/2601.07372v1/img-0.jpeg)
논문 링크 Engram: 조건부 연산(MoE) 이후의 두 번째 희소성 축, 조건부 메모리(Conditional Memory)한 줄 요약 (TL;DR)Engram은 Transformer에 “지식 조회(lookup) primitive”를 추가해, 표준 모 …
![[논문리뷰] Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality](https://icml.cc/media/PosterPDFs/ICML%202024/32613.png)
논문 링크 같은 논문을 2024-12-24 에도 한 번 더 정리해 두었다. Structured State Space Duality: Mamba-2로 본 SSM↔Attention 통일과 2–8× 가속한 줄 요약 (TL;DR)SSD(Structured …
![[논문리뷰] KIMI K2: OPEN AGENTIC INTELLIGENCE](https://github.com/MoonshotAI/Kimi-K2/raw/main/figures/kimi-logo.png)
논문 링크 Kimi K2: 오픈소스 LLM이 에이전트 지능을 향해 내딛은 한 걸음TL;DRMuonClip 프리트레인 + 대규모 에이전틱 툴 데이터 + Verifiable‑RL 정렬의 3‑단계 파이프라인으로, Kimi K2는 τ²‑Bench …
논문 링크 Qwen 3: 생각량을 조절하는 거대 MoE 언어모델의 진화한 줄 요약 (TL;DR)Qwen 3는 “얼마나 깊게 생각할지”를 토큰 수치로 직접 제어할 수 있는 Thinking Budget과 128-전문가 MoE 설계를 결합해, 활성 파라미터 …
논문 링크 CODE I/O: 코드 입·출력 + 자연어 CoT로 범용 추론까지 — 데이터 설계만으로 7B-30B LLM을 평균 +2 점 끌어올리다TL;DR“코드 함수 → 입력·출력 예측 + 체계적 Chain-of-Thought(CoT)”라는 단일 데이터 …
논문 링크 Native Sparse Attention (NSA) — 64 k 토큰도 11× 빠르게, 정확도는 그대로한 줄 요약 (TL;DR)NSA는 ‘압축 → 선택 → 슬라이딩’ 3 분기 희소 어텐션과 GQA/MQA-친화 커널을 결합해 64 k 컨텍스 …
논문 링크 ⚡️TL;DRKVzip는 LLM의 KV 캐시를 한 번 압축해도 이후 모든 질의 · 세션에서 재사용할 수 있도록 설계된 query-agnostic 캐시 컴프레서다. 그 결과 정확도 손실 ≤ 3 pp를 유지하면서 레이턴시 2 × ↓, 메모리 …
논문 링크 ⚡️ REFORM: 100만 토큰도 잊지 않는 LLM 추론 파이프라인한 줄 요약 (TL;DR)REFORM은 압축(Compress) → 선별(Gather) → 선택적 재계산(Recompute) 세 단계를 하나로 묶어, 단일 H100 GPU에서 …