Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving
논문 링크 데드라인을 채우는 프리필 청크: SLOWeave — LLM 서빙의 적응형 청킹 스케줄러 TL;DR — 고정된 프리필 청크 크기 대신, 매 반복(iteration)마다 “가장 이른 디코드 데드라인 전에 끝나는 가장 큰 프리필 청크 …
15분
LLM Inference
KV Cache
Long Context
Inference Acceleration
Efficient Inference
Transformer
![[논문 리뷰] Hardware-Efficient Attention for Fast Decoding](https://moonlight-paper-snapshot.s3.ap-northeast-2.amazonaws.com/arxiv/hardware-efficient-attention-for-fast-decoding-1.png)
![[논문리뷰] SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-bit Training](https://cdn-uploads.huggingface.co/production/uploads/66c0a08bac74db25de8427ec/Tb20E3IJSV6PjcD9Nkvfg.png)