trlX: A Framework for Large Scale Reinforcement Learning from Human Feedback
Alexander Havrilla, Maksym Zhuravinskyi, Duy Phung, Aman Kumar Tiwari, Jonathan Tow, Stella Biderman, Quentin G. Anthony, Louis Castricato · 2023
Alexander Havrilla, Maksym Zhuravinskyi, Duy Phung, Aman Tiwari, Jonathan Tow, Stella Biderman, Quentin Anthony, Louis Castricato. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. 2023.