2023-On The Fragility of Learned Reward Functions [paper]
peft
2021-LoRA- Low-Rank Adaptation of Large Language Models [paper]
align
2023-RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment [paper]
2023-Preference Ranking Optimization for Human Alignment [paper]
2023-Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization [paper]
2023-Fine-Grained Human Feedback Gives Better Rewards for Language Model Training paper]
2023-Chain of Hindsight Aligns Language Models with Feedback [paper]
2023-Training Socially Aligned Language Models in Simulated Human Society [paper]
2023-On The Fragility of Learned Reward Functions [paper]
peft
2021-LoRA- Low-Rank Adaptation of Large Language Models [paper]
align
2023-RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment [paper]
2023-Preference Ranking Optimization for Human Alignment [paper]
2023-Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization [paper]
2023-Fine-Grained Human Feedback Gives Better Rewards for Language Model Training paper]
2023-Chain of Hindsight Aligns Language Models with Feedback [paper]
2023-Training Socially Aligned Language Models in Simulated Human Society [paper]