Inference Acceleration

5페이지

Online Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training

논문 링크 대규모·장문맥 RL 사후학습에서 Speculative Decoding을 실용화하는 두 가지 설계TL;DR : RL 사후학습의 벽-클록 시간을 지배하는 롤아웃 생성을 speculative decoding으로 가속하고, 여기에 온라인 드래프트 …

11분
Speculative Decoding Long Context Reinforcement Learning Distributed Computing Efficient Training Inference Acceleration