COPR: Continual Human Preference Learning via Optimal Policy Regularization

Han Zhang, Lin Gui, Lei Yu, Yuanzhao Zhai, Yehong Zhang, Zhuo Zhang, Yulan He, Hui Wang, Yue Yu, Kam‐Fai Wong, Bin Liang, Ruifeng Xu · 2025

Han Zhang, Lin Gui, Yu Lei, Yuanzhao Zhai, Yehong Zhang, Zhuo Zhang, Yulan He, Hui Wang, Yue Yu, Kam-Fai Wong, Bin Liang, Ruifeng Xu. Findings of the Association for Computational Linguistics: ACL 2025. 2025.

Read the paper · More papers on PaperTik