This repo contains the implementation for the submission: "Alignment of Large Language Models with Constrained Learning".
algorithms/ – Dual Optimization Algorithmsdual_optimizer.py: Implements the dual variable computation algorithm.data_prep/ – Data Preparation Scriptsdataset_configs/: Custom dataset class definitions.collect.py: Collects prompt datasets.generate.py: Generates responses using a specified model and prompt dataset.score.py: Evaluates responses using reward and cost models.templates/: Prompt templates used for model-based generation.trainers/ – Training Scriptsmulti_shot_trainer.py: Multi-shot training loop.one_shot_trainer.py: One-shot training loop.gpt_based/ – GPT-Based Evaluation Scriptsadversarial_collect.py: Collects adversarial prompts.gpt_generate.py: Generates responses for GPT-based evaluation.gpt_eval.py: Evaluates responses using a GPT model as the evaluator.templates/: Prompt templates for GPT-based evaluation.visualize/ – Plotting Scriptsexec/ – Execution Scripts2 commits
Python
96.6%
Shell
3.4%
This repo contains the implementation for the submission: "Alignment of Large Language Models with Constrained Learning".
algorithms/ – Dual Optimization Algorithmsdual_optimizer.py: Implements the dual variable computation algorithm.data_prep/ – Data Preparation Scriptsdataset_configs/: Custom dataset class definitions.collect.py: Collects prompt datasets.generate.py: Generates responses using a specified model and prompt dataset.score.py: Evaluates responses using reward and cost models.templates/: Prompt templates used for model-based generation.trainers/ – Training Scriptsmulti_shot_trainer.py: Multi-shot training loop.one_shot_trainer.py: One-shot training loop.gpt_based/ – GPT-Based Evaluation Scriptsadversarial_collect.py: Collects adversarial prompts.gpt_generate.py: Generates responses for GPT-based evaluation.gpt_eval.py: Evaluates responses using a GPT model as the evaluator.templates/: Prompt templates for GPT-based evaluation.visualize/ – Plotting Scriptsexec/ – Execution Scripts2 commits
Python
96.6%
Shell
3.4%