ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
논문 링크 ShallowStream: 얕게 인덱싱하고, 깊게 답하라 — 스트리밍 비디오 이해의 계산 병목을 푸는 방법TL;DR — 스트리밍 비디오 이해에서 가장 비싼 비용은 매 프레임을 MLLM의 전체 깊이(28~32개 레이어) 로 prefill하는 …
논문 링크 ShallowStream: 얕게 인덱싱하고, 깊게 답하라 — 스트리밍 비디오 이해의 계산 병목을 푸는 방법TL;DR — 스트리밍 비디오 이해에서 가장 비싼 비용은 매 프레임을 MLLM의 전체 깊이(28~32개 레이어) 로 prefill하는 …
논문 링크 Uno: AR과 Diffusion을 하나의 모델에 — 무손실 병렬 생성을 통한 LLM 가속TL;DR — LLM이 느린 이유는 next-token prediction(NTP)이 한 번에 토큰 하나씩만 내놓는 순차 구조 때문이다. Uno는 하나 …
논문 링크 모델이 ‘생각을 다시 꺼내 보는’ 순간을 잡아라: BeaconKV가 비콘 쿼리로 추론 KV 캐시를 5.8배 압축하는 법 TL;DR — Large Reasoning Model(LRM)은 긴 …
논문 링크 FP4 텐서 코어가 빨라도 어텐션은 왜 안 빨라지는가: Direct-P와 양자화된 역전파로 푼 Blackwell FlashAttention-4TL;DR — Blackwell의 FP4 텐서 코어는 행렬곱을 BF16보다 훨씬 빨리 처리하지만, …
논문 링크 언어 모델이 스스로 어텐션을 통제한다: Declarative AttentionTL;DR — 기존의 희소 어텐션(sparse attention)은 매 디코딩 스텝마다 어떤 토큰이 중요한지 외부에서 근사 하느라 여전히 $O(N)$ 비용을 지불했 …
논문 링크 같은 요청, 다른 답: 프리픽스 캐시가 서빙을 비재현적으로 만들고, 양자화가 이를 증폭시킨다 TL;DR — 프리픽스 캐시는 “투명한 최적화"로 여겨지지만 투명하지 않다. 캐시를 끄면 동일 워크로드의 반복 실행이 10개 설 …
논문 링크 SGD-KV: ‘요약을 잘하는 헤드’를 찾아 1M 토큰의 KV 캐시를 75%까지 줄인다 TL;DR — 어텐션 헤드는 모두 같은 일을 하지 않는다. ‘요약’이라는 고차원 정보 압축을 담당하는 …
논문 링크 SMELT: 계산량을 맞춘 MoE 루프 트랜스포머의 스케일링 법칙한 줄 요약 (TL;DR)루프 트랜스포머는 레이어 블록을 반복 실행해 깊이를 늘리지만, 기존 연구는 대부분 파라미터 수만 고정한 채 FLOPs를 늘려 “공짜 점수 …
논문 링크 순환 절반은 양자화하기 쉬운 절반이다: Gated DeltaNet이 4비트에서 살아남는 이유TL;DR — 하이브리드 27B LLM(Qwen3.8-27B)의 순환 레이어인 Gated DeltaNet(GDN) 48개 층은 그동안 “오 …