류재훈

류재훈

안녕하세요! 기술과 일상에 대한 생각을 기록하는 블로그입니다

리벨리온(Rebellions)에서 딥러닝 컴파일러를 개발하는 엔지니어입니다. AI 모델, 최근엔 LLM을 하드웨어에서 더 효율적으로 실행하기 위한 컴파일러 기술과 최적화에 대해서 공부하려고 만든 블로그입니다. 또한 취미와 투자에 대해서도 간간히 글을 올리려고 하고있습니다.

최근 글

Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

논문 링크 비디오 LLM은 왜 아직도 비싼가? — 추론 효율화 메커니즘 4단계 총정리TL;DR — 이 논문은 2022년 말부터 2026년 8월까지 발표된 VideoLLM 추론 효율화 연구 125편을 엔코더–커넥터–LLM 파이프라인의 4단계로 분류하고, …

14분
Long Context KV Cache Multimodal Learning Vision-Language Model Efficient Inference Large Language Models

Online Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training

논문 링크 대규모·장문맥 RL 사후학습에서 Speculative Decoding을 실용화하는 두 가지 설계TL;DR : RL 사후학습의 벽-클록 시간을 지배하는 롤아웃 생성을 speculative decoding으로 가속하고, 여기에 온라인 드래프트 …

11분
Speculative Decoding Long Context Reinforcement Learning Distributed Computing Efficient Training Inference Acceleration