Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving
논문 링크 데드라인을 채우는 프리필 청크: SLOWeave — LLM 서빙의 적응형 청킹 스케줄러 TL;DR — 고정된 프리필 청크 크기 대신, 매 반복(iteration)마다 “가장 이른 디코드 데드라인 전에 끝나는 가장 큰 프리필 청크 …
15분
LLM Inference
KV Cache
Long Context
Inference Acceleration
Efficient Inference
Transformer