Long Context

문맥 길이가 늘어나면 어텐션 비용과 KV 캐시가 함께 커집니다. 이 태그의 글들은 대체로 네 갈래 중 하나입니다.

  • 어텐션을 희소하게 — 하드웨어에 맞춰 학습까지 가능한 희소 어텐션
  • 문맥을 줄였다 되살리기 — 압축 후 필요할 때 다시 계산
  • 구조를 바꾸기 — 상태공간 모델과 Transformer 의 관계
  • 서빙에서 감당하기 — 백만 토큰급 요청을 나눠 처리하는 병렬화
18페이지

Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches

논문 링크 Fathom: 쿼리마다 깊이를 바꾸는 스캔으로 1M 토큰 디코딩을 1.67배 빠르게 하다한 줄 요약 (TL;DR)에이전트 세션이 1M 토큰까지 길어지고 수십 세션이 동시에 상주하면 KV 캐시와 이를 랭킹하는 인덱스가 호스트 메모리에 살게 되 …

20분
KV Cache Long Context Efficient Inference LLM Inference Attention Optimization Quantization

Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

논문 링크 비디오 LLM은 왜 아직도 비싼가? — 추론 효율화 메커니즘 4단계 총정리TL;DR — 이 논문은 2022년 말부터 2026년 8월까지 발표된 VideoLLM 추론 효율화 연구 125편을 엔코더–커넥터–LLM 파이프라인의 4단계로 분류하고, …

14분
Long Context KV Cache Multimodal Learning Vision-Language Model Efficient Inference Large Language Models

Online Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training

논문 링크 대규모·장문맥 RL 사후학습에서 Speculative Decoding을 실용화하는 두 가지 설계TL;DR : RL 사후학습의 벽-클록 시간을 지배하는 롤아웃 생성을 speculative decoding으로 가속하고, 여기에 온라인 드래프트 …

11분
Speculative Decoding Long Context Reinforcement Learning Distributed Computing Efficient Training Inference Acceleration