Adapting Tree-Structured Speculative Decoding to DeepSeek-V4 for Efficient Inference
논문 링크 압축된 기억 위에서 가지를 뻗기: DeepSeek-V4에 트리 추론을 얹은 이야기TL;DR DeepSeek-V4-Flash에 트리 구조 추론적 디코딩을 올리면 같은 검증 예산에서 더 긴 채택 길이와 최대 약 18.5% 의 디코드 처리량 향상 …
기술과 일상에 대한 글 목록입니다.
논문 링크 압축된 기억 위에서 가지를 뻗기: DeepSeek-V4에 트리 추론을 얹은 이야기TL;DR DeepSeek-V4-Flash에 트리 구조 추론적 디코딩을 올리면 같은 검증 예산에서 더 긴 채택 길이와 최대 약 18.5% 의 디코드 처리량 향상 …
논문 링크 Flash-dLLM: I/O를 먼저 본 Diffusion LLM 가속, 퓨즈드 캐시와 셀프 검증으로 210.6 tokens/s 를 열다한 줄 요약 (TL;DR)Diffusion LLM(dLLM)은 병렬 디노이징이 가능하지만 KV 캐시 재사용 …
논문 링크 Drafter-Side KV Cache 없이 병렬 추론하기: H-Spec의 하이브리드 추측 디코딩TL;DR 은 블록 확산 드래프터가 매 토큰마다 타깃 은닉 상태를 투영해 별도 KV 캐시를 유지해야 한다는 점이 동시 서빙의 병목임을 보이고, …
PD 분리 LLM 추론에서 prefill·decode 인스턴스 수와 KV-cache 예약을 함께 모델링해, 요구 용량을 가장 낮은 전력으로 만족하는 배치를 찾는 해석적 프로비저닝 방법을 소개한다.
VC-Attention은 비디오 Diffusion Transformer의 저비트 어텐션에서 값 양자화 오차와 softmax 병목을 함께 줄여 B200에서 어텐션을 최대 1.59배 가속한 학습-프리 커널이다.
LLM 서빙 프레임워크를 처음 열면 대개 스케줄러부터 찾는다. 하지만 스케줄러 코드를 아무리 읽어도 “이 함수는 누가 부르고, 저 큐에는 누가 넣는가"가 풀리지 않는다. Mini-SGLang 은 한 프로세스짜리 프로그램이 아니기 때 …