Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches
논문 링크 Fathom: 쿼리마다 깊이를 바꾸는 스캔으로 1M 토큰 디코딩을 1.67배 빠르게 하다한 줄 요약 (TL;DR)에이전트 세션이 1M 토큰까지 길어지고 수십 세션이 동시에 상주하면 KV 캐시와 이를 랭킹하는 인덱스가 호스트 메모리에 살게 되 …
논문 링크 Fathom: 쿼리마다 깊이를 바꾸는 스캔으로 1M 토큰 디코딩을 1.67배 빠르게 하다한 줄 요약 (TL;DR)에이전트 세션이 1M 토큰까지 길어지고 수십 세션이 동시에 상주하면 KV 캐시와 이를 랭킹하는 인덱스가 호스트 메모리에 살게 되 …
논문 링크 SSD에 산 MoE를 깨우다: 24 GB 데스크톱에서 35B MoE를 20 tok/s로 서빙하는 Edge0한 줄 요약 (TL;DR)35B급 MoE는 4-bit로도 19.5 GB 를 차지해 24 GB 머신에 상주하지 못한다 (근거: §1). …
논문 링크 “무손실” 스페큘레이티브 디코딩은 정말 무손실일까? — Orthrus 재현으로 드러난 수치 정밀도의 함정TL;DR — Orthrus는 frozen AR 백본에 diffusion 뷰를 얹어 여러 토큰을 병렬로 생성하며 …
논문 링크 ZGCM-1: 7B 밀집 모델이 235B 프런티어와 겨루는 법 — 완전 개방형·초고효율 파운데이션 모델 설계 보고서TL;DR — ZGCM-1은 7.39B 밀집(dense) 모델 하나로 AIME 2026 75.0%, WebWalkerQA …
논문 링크 SAS: 증류 없이 문맥 랭킹을 직접 학습하는 단순한 어텐션 스파시피케이션TL;DR — 사후 학습(post-training) 어텐션 스파시피케이션에서, 선택기(selector)가 만든 연속 점수를 어텐션 로짓에 로그 게이트(log gate) …
논문 링크 CoVeR: 지오메트리만으로 멀티뷰 3D 추론의 비주얼 토큰을 92%까지 덜어내는 커버리지 기반 프루닝한 줄 요약 (TL;DR)3D 장면을 여러 시점 이미지로 렌더링해 2D VLM에 넣으면 토큰이 시점 수에 비례해 폭증한다. CoVeR는 학 …
논문 링크 SQS: 가지치기와 양자화를 하나의 베이지안 학습으로 — 스파이크-앤-슬랩과 GMM의 만남TL;DR — 프루닝(pruning)과 저비트 양자화(quantization)를 따로 하면 남는 잉여가 생긴다. SQS는 스파이크-앤-슬랩 사전분포와 …
논문 링크 칼만 필터로 다시 쓴 선형 어텐션: Kalman Delta Networks한 줄 요약 (TL;DR)선형 어텐션(linear attention)의 고정 크기 recurrent memory 갱신을 선형-가우시안 상태공간 모델 로 재해석하고, 최 …
논문 링크 X-AuT: 행동 프로브와 크로스스케일 증류로 음성 LLM의 오디오 인코더를 깎아내는 방법한 줄 요약 (TL;DR)음성 LLM의 오디오 인코더(오디오 Transformer)를 18→16→14 레이어로 점진적으로 프루닝 하면서, 짧은 행동 프 …
논문 링크 데드라인을 채우는 프리필 청크: SLOWeave — LLM 서빙의 적응형 청킹 스케줄러 TL;DR — 고정된 프리필 청크 크기 대신, 매 반복(iteration)마다 “가장 이른 디코드 데드라인 전에 끝나는 가장 큰 프리필 청크 …
논문 링크 비디오 LLM은 왜 아직도 비싼가? — 추론 효율화 메커니즘 4단계 총정리TL;DR — 이 논문은 2022년 말부터 2026년 8월까지 발표된 VideoLLM 추론 효율화 연구 125편을 엔코더–커넥터–LLM 파이프라인의 4단계로 분류하고, …
논문 링크 Hydragen: 공유 프리픽스가 있는 대규모 배치를 32 × 빠르게 디코딩하는 비밀 병기한 줄 요약 (TL;DR)Softmax 분모 재스케일링으로 프리픽스-서픽스를 분해해 Code-Llama-13 B 기준 vLLM보다 최대 32배 빠르게, …
논문 링크 📝 Mamba Drafters: 선형 SSM으로 외부 Speculative Decoding SOTA 다시 쓰기한 줄 요약 (TL;DR)Transformer 대신 Mamba SSM을 외부 드래프터로 쓰고, 트리 초안 + UCB 탐색을 결합해 …