<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Multimodal on Jaehun's Blog</title><link>https://jaehun.me/tags/multimodal/</link><description>Recent content in Multimodal on Jaehun's Blog</description><generator>Hugo</generator><language>ko-kr</language><lastBuildDate>Sat, 19 Sep 2026 00:28:38 +0900</lastBuildDate><atom:link href="https://jaehun.me/tags/multimodal/index.xml" rel="self" type="application/rss+xml"/><item><title>[논문리뷰] SGLang: Efficient Execution of Structured Language Model Programs</title><link>https://jaehun.me/posts/%EB%85%BC%EB%AC%B8%EB%A6%AC%EB%B7%B0-sglang-efficient-execution-of-structured-language-model-programs/</link><pubDate>Fri, 03 Oct 2025 00:00:00 +0900</pubDate><guid>https://jaehun.me/posts/%EB%85%BC%EB%AC%B8%EB%A6%AC%EB%B7%B0-sglang-efficient-execution-of-structured-language-model-programs/</guid><description>&lt;p&gt;&lt;a&#10; href="https://arxiv.org/abs/2312.07104v2"target="_blank"&#10; class="inline-flex items-center gap-1"&#10; &gt;논문 링크&lt;svg class="h-3 w-3 flex-shrink-0" id="external-link" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="2" d="M15 3h6v6m-11 5L21 3m-3 10v6a2 2 0 0 1-2 2H5a2 2 0 0 1-2-2V8a2 2 0 0 1 2-2h6"/&gt;&lt;/svg&gt;&#10; &lt;/a&gt;&lt;/p&gt;&#10;&lt;h2 id="sglang--radixattention-lm-프로그램-시대의-실행-최적화-어떻게-64-빨라졌나"&gt;SGLang &amp;amp; RadixAttention: “LM 프로그램” 시대의 실행 최적화, 어떻게 6.4× 빨라졌나&lt;a href="#sglang--radixattention-lm-%ed%94%84%eb%a1%9c%ea%b7%b8%eb%9e%a8-%ec%8b%9c%eb%8c%80%ec%9d%98-%ec%8b%a4%ed%96%89-%ec%b5%9c%ec%a0%81%ed%99%94-%ec%96%b4%eb%96%bb%ea%b2%8c-64-%eb%b9%a8%eb%9d%bc%ec%a1%8c%eb%82%98" class="heading-anchor" aria-label="이 섹션에 대한 링크"&gt;&lt;/a&gt;&lt;/h2&gt;&lt;h2 id="tldr"&gt;TL;DR&lt;a href="#tldr" class="heading-anchor" aria-label="이 섹션에 대한 링크"&gt;&lt;/a&gt;&lt;/h2&gt;&lt;p&gt;언어–런타임 &lt;strong&gt;공동 설계(co-design)&lt;/strong&gt; 위에 &lt;strong&gt;RadixAttention(라딕스 트리 기반 KV 캐시+스케줄링)&lt;/strong&gt;, &lt;strong&gt;Compressed FSM(다중 토큰 제약 디코딩)&lt;/strong&gt;, &lt;strong&gt;API speculative execution&lt;/strong&gt;을 결합해, 다양한 LM 프로그램에서 &lt;strong&gt;처리량 최대 6.4×↑&lt;/strong&gt;, &lt;strong&gt;지연 최대 3.7×↓&lt;/strong&gt;, &lt;strong&gt;TTFT 평균 1.7×↓&lt;/strong&gt;, &lt;strong&gt;JSON/Regex 디코딩 1.6×↑&lt;/strong&gt;, &lt;strong&gt;멀티모달 ~6×↑&lt;/strong&gt;를 달성한다. 캐시 재사용 기회가 없을 때도 &lt;strong&gt;오버헤드 &amp;lt;0.3%&lt;/strong&gt;.&lt;/p&gt;</description></item></channel></rss>