<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Code-Series on Jaehun's Blog</title><link>https://jaehun.me/categories/code-series/</link><description>Recent content in Code-Series on Jaehun's Blog</description><generator>Hugo</generator><language>ko-kr</language><lastBuildDate>Thu, 17 Sep 2026 10:35:30 +0900</lastBuildDate><atom:link href="https://jaehun.me/categories/code-series/index.xml" rel="self" type="application/rss+xml"/><item><title>1. CUDA 1,500줄로 만든 추론 엔진, 전체 지도</title><link>https://jaehun.me/posts/code-series-jmaczan--tiny-vllm-01/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0900</pubDate><guid>https://jaehun.me/posts/code-series-jmaczan--tiny-vllm-01/</guid><description>&lt;p&gt;&lt;a&#10; href="https://github.com/jmaczan/tiny-vllm"target="_blank"&#10; class="inline-flex items-center gap-1"&#10; &gt;jmaczan/tiny-vllm&lt;svg class="h-3 w-3 flex-shrink-0" id="external-link" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="2" d="M15 3h6v6m-11 5L21 3m-3 10v6a2 2 0 0 1-2 2H5a2 2 0 0 1-2-2V8a2 2 0 0 1 2-2h6"/&gt;&lt;/svg&gt;&#10; &lt;/a&gt;은 Llama 3.2 1B Instruct 를 GPU 에서 돌리는 추론 엔진을 C++ 와 CUDA 로 처음부터 짠 저장소다. PyTorch 도, Hugging Face 도, 심지어 토크나이저도 쓰지 않는다. safetensors 파일을 직접 열어 가중치를 GPU 로 올리고, 어텐션과 RMSNorm 과 softmax 를 전부 자기 커널로 계산한다.&lt;/p&gt;</description></item></channel></rss>