trlX: A Framework for Large Scale Reinforcement Learning from Human Feedback

Alexander Havrilla, Maksym Zhuravinskyi, Duy Phung, Aman Kumar Tiwari, Jonathan Tow, Stella Biderman, Quentin G. Anthony, Louis Castricato · 2023

Alexander Havrilla, Maksym Zhuravinskyi, Duy Phung, Aman Tiwari, Jonathan Tow, Stella Biderman, Quentin Anthony, Louis Castricato. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. 2023.

Read the paper · More papers on PaperTik