Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference
논문 링크 캐시를 배우는 라우터 : 메모리-제약 MoE 추론을 위한 Cache-Aware Joint Router Adaptation한 줄 요약 (TL;DR)MoE의 진짜 병목은 연산량이 아니라 전문가 가중치 이동량이다 라는 문제의식에서 출발해, 네이티 …
논문 링크 캐시를 배우는 라우터 : 메모리-제약 MoE 추론을 위한 Cache-Aware Joint Router Adaptation한 줄 요약 (TL;DR)MoE의 진짜 병목은 연산량이 아니라 전문가 가중치 이동량이다 라는 문제의식에서 출발해, 네이티 …
논문 링크 VestigeKV: 퇴화한 RoPE 가지가 스스로 캐시 축출 신호를 품고 있다한 줄 요약 (TL;DR)NoPE-MLA 모델(Kimi Linear 48B)에서, 훈련이 샐리언스 채널 로 재용도한 64차원 decoupled branch — …
논문 링크 ShallowStream: 얕게 인덱싱하고, 깊게 답하라 — 스트리밍 비디오 이해의 계산 병목을 푸는 방법TL;DR — 스트리밍 비디오 이해에서 가장 비싼 비용은 매 프레임을 MLLM의 전체 깊이(28~32개 레이어) 로 prefill하는 …
논문 링크 Uno: AR과 Diffusion을 하나의 모델에 — 무손실 병렬 생성을 통한 LLM 가속TL;DR — LLM이 느린 이유는 next-token prediction(NTP)이 한 번에 토큰 하나씩만 내놓는 순차 구조 때문이다. Uno는 하나 …
논문 링크 모델이 ‘생각을 다시 꺼내 보는’ 순간을 잡아라: BeaconKV가 비콘 쿼리로 추론 KV 캐시를 5.8배 압축하는 법 TL;DR — Large Reasoning Model(LRM)은 긴 …