abseil
82편Abseil Tip of the Week 를 한국어로 옮긴 글 모음입니다. string_view, unique_ptr, 임시 객체와 수명처럼 C++ 를 쓰면서 매번 다시 확인하게 되는 주제를 한 편에 하나씩 다룹니다.
Abseil Tip of the Week 를 한국어로 옮긴 글 모음입니다. string_view, unique_ptr, 임시 객체와 수명처럼 C++ 를 쓰면서 매번 다시 확인하게 되는 주제를 한 편에 하나씩 다룹니다.
오픈소스 추론 엔진을 한 커밋에 고정해 놓고 처음부터 끝까지 읽는 연재입니다. 실행 경로를 따라가며 각 편이 코드의 특정 구간과 그 설계 이유를 다룹니다.
LLM 추론을 빠르게, 싸게 만드는 방법을 다룬 논문 리뷰입니다. 추측 디코딩, KV 캐시 압축, 프롬프트 압축, 희소성 활용, 이기종 파이프라인 등을 다룹니다.
KV 캐시를 줄이고, 버리고, 다시 쓰는 방법을 다룬 논문 리뷰입니다. 압축·양자화·축출 신호·오프로딩·접두사 재사용을 한 자리에 모았습니다.
긴 문맥을 감당하는 방법을 다룬 논문 리뷰입니다. 희소 어텐션, 문맥 압축과 재계산, 상태공간 모델, 백만 토큰급 서빙을 다룹니다.
여러 GPU·노드에 걸친 LLM 서빙과 학습을 다룬 논문 리뷰입니다. 프리필/디코드 분리, 파이프라인 병렬, 통신-연산 겹치기, 스케줄링과 에너지를 다룹니다.
논문 링크 압축된 기억 위에서 가지를 뻗기: DeepSeek-V4에 트리 추론을 얹은 이야기TL;DR DeepSeek-V4-Flash에 트리 구조 추론적 디코딩을 올리면 같은 검증 예산에서 더 긴 채택 길이와 최대 약 18.5% 의 디코드 처리량 향상 …
논문 링크 Flash-dLLM: I/O를 먼저 본 Diffusion LLM 가속, 퓨즈드 캐시와 셀프 검증으로 210.6 tokens/s 를 열다한 줄 요약 (TL;DR)Diffusion LLM(dLLM)은 병렬 디노이징이 가능하지만 KV 캐시 재사용 …
논문 링크 Drafter-Side KV Cache 없이 병렬 추론하기: H-Spec의 하이브리드 추측 디코딩TL;DR 은 블록 확산 드래프터가 매 토큰마다 타깃 은닉 상태를 투영해 별도 KV 캐시를 유지해야 한다는 점이 동시 서빙의 병목임을 보이고, …
PD 분리 LLM 추론에서 prefill·decode 인스턴스 수와 KV-cache 예약을 함께 모델링해, 요구 용량을 가장 낮은 전력으로 만족하는 배치를 찾는 해석적 프로비저닝 방법을 소개한다.
VC-Attention은 비디오 Diffusion Transformer의 저비트 어텐션에서 값 양자화 오차와 softmax 병목을 함께 줄여 B200에서 어텐션을 최대 1.59배 가속한 학습-프리 커널이다.