<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Pipeline Parallelism on Jaehun's Blog</title><link>https://jaehun.me/tags/pipeline-parallelism/</link><description>Recent content in Pipeline Parallelism on Jaehun's Blog</description><generator>Hugo</generator><language>ko-kr</language><lastBuildDate>Fri, 02 Oct 2026 09:27:51 +0900</lastBuildDate><atom:link href="https://jaehun.me/tags/pipeline-parallelism/index.xml" rel="self" type="application/rss+xml"/><item><title>WavePP: High-Throughput Pipeline Parallel LLM Prefill under Prefix Reuse</title><link>https://jaehun.me/posts/paper-2609-35263v1/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0900</pubDate><guid>https://jaehun.me/posts/paper-2609-35263v1/</guid><description>&lt;p&gt;&lt;a&#10; href="https://arxiv.org/abs/2609.35263v1"target="_blank"&#10; class="inline-flex items-center gap-1"&#10; &gt;논문 링크&lt;svg class="h-3 w-3 flex-shrink-0" id="external-link" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="2" d="M15 3h6v6m-11 5L21 3m-3 10v6a2 2 0 0 1-2 2H5a2 2 0 0 1-2-2V8a2 2 0 0 1 2-2h6"/&gt;&lt;/svg&gt;&#10; &lt;/a&gt;&lt;/p&gt;&#10;&lt;h2 id="wavepp--프리픽스-재사용을-태우는-파이프라인-병렬-프리필-런타임"&gt;WavePP — 프리픽스 재사용을 태우는 파이프라인 병렬 프리필 런타임&lt;a href="#wavepp--%ed%94%84%eb%a6%ac%ed%94%bd%ec%8a%a4-%ec%9e%ac%ec%82%ac%ec%9a%a9%ec%9d%84-%ed%83%9c%ec%9a%b0%eb%8a%94-%ed%8c%8c%ec%9d%b4%ed%94%84%eb%9d%bc%ec%9d%b8-%eb%b3%91%eb%a0%ac-%ed%94%84%eb%a6%ac%ed%95%84-%eb%9f%b0%ed%83%80%ec%9e%84" class="heading-anchor" aria-label="이 섹션에 대한 링크"&gt;&lt;/a&gt;&lt;/h2&gt;&lt;h2 id="tldr"&gt;TL;DR&lt;a href="#tldr" class="heading-anchor" aria-label="이 섹션에 대한 링크"&gt;&lt;/a&gt;&lt;/h2&gt;&lt;p&gt;TensorRT-LLM 위에 구축한 &lt;strong&gt;WavePP&lt;/strong&gt; 는 요청 admission(재사용 합의·캐시 보호·용량 예약)을 파이프라인 실행과 &lt;strong&gt;비동기로 겹쳐 처리&lt;/strong&gt; 하고, wave 크기를 동적으로 조절해 파이프라인을 꽉 채운다. &lt;strong&gt;동일 커널·동일 토폴로지&lt;/strong&gt; 에서 GLM 5.2와 MiniMax M2.7의 프리필 처리량을 최대 &lt;strong&gt;2.91×/2.02×&lt;/strong&gt; 까지 끌어올렸고, 28개 Kimi K3 세팅 중 동시성 8 이상의 &lt;strong&gt;18개 전부&lt;/strong&gt; 에서 가장 높은 처리량을 기록했다.&lt;/p&gt;</description></item></channel></rss>