<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Series on Jaehun's Blog</title><link>https://jaehun.me/series/</link><description>Recent content in Series on Jaehun's Blog</description><generator>Hugo</generator><language>ko-kr</language><lastBuildDate>Sat, 19 Sep 2026 00:54:10 +0900</lastBuildDate><atom:link href="https://jaehun.me/series/index.xml" rel="self" type="application/rss+xml"/><item><title>Mini-SGLang: LLM 서빙 프레임워크의 스케줄러 읽기</title><link>https://jaehun.me/series/sgl-project--mini-sglang/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://jaehun.me/series/sgl-project--mini-sglang/</guid><description>&lt;p&gt;&lt;a&#10; href="https://github.com/sgl-project/mini-sglang"target="_blank"&#10; class="inline-flex items-center gap-1"&#10; &gt;sgl-project/mini-sglang&lt;svg class="h-3 w-3 flex-shrink-0" id="external-link" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="2" d="M15 3h6v6m-11 5L21 3m-3 10v6a2 2 0 0 1-2 2H5a2 2 0 0 1-2-2V8a2 2 0 0 1 2-2h6"/&gt;&lt;/svg&gt;&#10; &lt;/a&gt; 을&#10;커밋 &lt;code&gt;9a91cfa&lt;/code&gt; 에 고정해 놓고 여덟 편에 걸쳐 읽습니다. 인용한 코드는 모두&#10;그 커밋의 permalink 로 이어집니다.&lt;/p&gt;</description></item><item><title>tiny-vLLM: CUDA로 직접 쓴 LLM 추론 엔진 읽기</title><link>https://jaehun.me/series/jmaczan--tiny-vllm/</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://jaehun.me/series/jmaczan--tiny-vllm/</guid><description>&lt;p&gt;&lt;a&#10; href="https://github.com/jmaczan/tiny-vllm"target="_blank"&#10; class="inline-flex items-center gap-1"&#10; &gt;jmaczan/tiny-vllm&lt;svg class="h-3 w-3 flex-shrink-0" id="external-link" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="2" d="M15 3h6v6m-11 5L21 3m-3 10v6a2 2 0 0 1-2 2H5a2 2 0 0 1-2-2V8a2 2 0 0 1 2-2h6"/&gt;&lt;/svg&gt;&#10; &lt;/a&gt; 은 CUDA 로 직접&#10;쓴 1,500 줄짜리 추론 엔진입니다. 커밋 하나에 고정해 놓고 일곱 편에 걸쳐&#10;읽습니다.&lt;/p&gt;&#10;&lt;p&gt;가중치를 올리고 GPU 버퍼를 잡는 일부터 시작해, 프롬프트 전체를 한 번에&#10;흘리는 prefill 경로, cuBLAS 에 행렬을 뒤집어 넘기는 이유, 토큰 하나를&#10;만드는 decode 경로와 전용 커널, KV 캐시를 16토큰 블록으로 쪼개 block&#10;table 로 읽는 방법, 슬롯과 큐로 여러 요청을 겹치는 continuous batching&#10;까지 따라갑니다.&lt;/p&gt;</description></item></channel></rss>