Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving
논문 링크 데드라인을 채우는 프리필 청크: SLOWeave — LLM 서빙의 적응형 청킹 스케줄러 TL;DR — 고정된 프리필 청크 크기 대신, 매 반복(iteration)마다 “가장 이른 디코드 데드라인 전에 끝나는 가장 큰 프리필 청크 …
논문 링크 데드라인을 채우는 프리필 청크: SLOWeave — LLM 서빙의 적응형 청킹 스케줄러 TL;DR — 고정된 프리필 청크 크기 대신, 매 반복(iteration)마다 “가장 이른 디코드 데드라인 전에 끝나는 가장 큰 프리필 청크 …
논문 링크 비디오 LLM은 왜 아직도 비싼가? — 추론 효율화 메커니즘 4단계 총정리TL;DR — 이 논문은 2022년 말부터 2026년 8월까지 발표된 VideoLLM 추론 효율화 연구 125편을 엔코더–커넥터–LLM 파이프라인의 4단계로 분류하고, …
논문 링크 Miles v0.1: 프론티어 RL 사후학습을 위한 “검증·청결·확장 가능"한 풀스택 시스템TL;DR : Miles는 rolluout 생성과 트레이닝이 서로 다른 엔진·커널·정밀도로 돌아가며 발생하는 …
논문 링크 대규모·장문맥 RL 사후학습에서 Speculative Decoding을 실용화하는 두 가지 설계TL;DR : RL 사후학습의 벽-클록 시간을 지배하는 롤아웃 생성을 speculative decoding으로 가속하고, 여기에 온라인 드래프트 …
논문 링크 캐시를 배우는 라우터 : 메모리-제약 MoE 추론을 위한 Cache-Aware Joint Router Adaptation한 줄 요약 (TL;DR)MoE의 진짜 병목은 연산량이 아니라 전문가 가중치 이동량이다 라는 문제의식에서 출발해, 네이티 …