Mini-SGLang: LLM 서빙 프레임워크의 스케줄러 읽기sgl-project/mini-sglang 을 커밋 하나에 고정해 8편으로 읽습니다. 요청이 지나는 프로세스 경계부터 radix cache, 두 스트림 겹치기까지. 8페이지
tiny-vLLM: CUDA로 직접 쓴 LLM 추론 엔진 읽기jmaczan/tiny-vllm 의 CUDA 1,500줄을 7편으로 읽습니다. 가중치 적재와 GPU 버퍼부터 block table KV 캐시와 continuous batching 까지. 7페이지