Inference-Time Scaling for Generalist Reward Modeling
Paper Inference-Time Scaling: How DeepSeek-GRM Surpassed Giant ModelsOne-Line Summary (TL;DR)“27B model × 32 samples”—With only …
25 min
Generative Reward Model
LLM Evaluation
Preference Modeling
RLHF
DeepSeek