류재훈

류재훈

안녕하세요! 기술과 일상에 대한 생각을 기록하는 블로그입니다

리벨리온(Rebellions)에서 딥러닝 컴파일러를 개발하는 엔지니어입니다. AI 모델, 최근엔 LLM을 하드웨어에서 더 효율적으로 실행하기 위한 컴파일러 기술과 최적화에 대해서 공부하려고 만든 블로그입니다. 또한 취미와 투자에 대해서도 간간히 글을 올리려고 하고있습니다.

주제별로 둘러보기

최근 글

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

논문 링크 온폴리시는 만능이 아니다: 증류 동역학에서 롤아웃 정책·KL 방향·학습률의 진짜 주인공 TL;DR — 강-약 증류(strong-to-weak distillation)에서 온폴리시(OnPD)와 오프폴리시(OffPD)를 분리해 보면, 최종 성능 …

3분
Machine Learning Natural Language Processing Large Language Models Reinforcement Learning Efficient Training Knowledge Distillation