The KV Cache Is the New Memory Wall
논문 링크 KV 캐시가 새로운 메모리 월(Memory Wall)이다: 장문맥 LLM 추론의 세 영역과 다섯 도메인 TL;DR — 장문맥 LLM의 디코드(decode) 추론은 산술 연산이 아니라 메모리 대역폭에 묶이며, 문맥 길이가 계산 가능한 특정 …
기술과 일상에 대한 글 목록입니다.
논문 링크 KV 캐시가 새로운 메모리 월(Memory Wall)이다: 장문맥 LLM 추론의 세 영역과 다섯 도메인 TL;DR — 장문맥 LLM의 디코드(decode) 추론은 산술 연산이 아니라 메모리 대역폭에 묶이며, 문맥 길이가 계산 가능한 특정 …
논문 링크 WavePP — 프리픽스 재사용을 태우는 파이프라인 병렬 프리필 런타임TL;DRTensorRT-LLM 위에 구축한 WavePP 는 요청 admission(재사용 합의·캐시 보호·용량 예약)을 파이프라인 실행과 비동기로 겹쳐 처리 하고, …
논문 링크 위상 감수성(Phase Sensitivity): 청크 단위 KV 캐시 압축이 만드는 ‘주기적 약점’ TL;DR — 청크 단위 KV 캐시 압축을 쓰는 모델(DeepSeek-V4 계열 등)에서, 같은 정보라도 압축 창 경계 …
논문 링크 WorldAttention: 슬라이딩 윈도우를 버린 인터랙티브 비디오 월드 모델의 시스템 공동 설계TL;DR — 텍스트로 제어되는 인터랙티브 비디오 월드 모델은 “전체 히스토리를 기억해야 한다"는 요구와 “KV …
논문 링크 KV 캐시 비용은 누가 내는가? — 쿠버네티스·게이트웨이·프로바이더 청구서를 하나의 장부로 TL;DR — 같은 AI 기능 한 건에 드는 비용은 쿠버네티스 할당, 게이트웨이 로그, 프로바이더의 토큰 단위 청구서라는 서로 연결되지 않은 세 장부 …
논문 링크 SPECTRA: 추론 단계가 바뀔 때마다 하드웨어도 옷을 갈아입는 재구성 가능 LLM 가속기한 줄 요약 (TL;DR)스펙큘레이티브 디코딩은 프리필(연산 바운드 GEMM)·디코드(메모리 바운드 GEMV)·그 사이의 병렬 검증을 오가며 산술 강 …