COPR: Continual Human Preference Learning via Optimal Policy Regularization
Han Zhang, Lin Gui, Lei Yu, Yuanzhao Zhai, Yehong Zhang, Zhuo Zhang, Yulan He, Hui Wang, Yue Yu, Kam‐Fai Wong, Bin Liang, Ruifeng Xu · 2025
Han Zhang, Lin Gui, Yu Lei, Yuanzhao Zhai, Yehong Zhang, Zhuo Zhang, Yulan He, Hui Wang, Yue Yu, Kam-Fai Wong, Bin Liang, Ruifeng Xu. Findings of the Association for Computational Linguistics: ACL 2025. 2025.