Code for ACL 2026 Findings paper "Alignment Data Map for Efficient Preference Data Selection and Diagnosis"
1
stars
76
commits
Jupyter Notebook
primary language
Jun 30, 2026
updated
Code for ACL 2026 Findings Paper "Alignment Data Map for Efficient Preference Data Selection and Diagnosis"
conda env create -f environment.yml
conda activate dc
pip install -r requirements.txt
Dataset-Cartography/
├── data-map/ # Generating Data maps
│ ├── results/
│ └── src/
├── train-eval/ # for Train and Evaluation
│ ├── LLaMA-Factory/ # for DPO Train
│ ├── SimPO/ # for SimPO Train
│ ├── src/ # Evaluation Code
│ └── eval/
│ ├── alpaca_eval
│ ├── instruct-eval
│ └── FastChat
├── README.md
├── requirements.txt
└── environment.yml
Choose model to use and process openAI API Inference
config : ./src/config.yaml
python gpt-inference.py
calculating similarity of proxy GPT response and other model responses using various Sentence Transformer models
config : ./src/scores/sentence-transformer-config.yaml
available models : ST(Sentence Transformer), NV
python sentence-transformer.py
calculating variance between responses
config : ./src/scores/variance-config.yaml
available methods : proxy-response, response
python variance.py
calculating correlation of human preference and proxy-response similarity score using various methods
config : ./src/correlations/correlation-config.yaml
available methods : cosine, cosine-minmax, pearson, pearson-minmax, kendall
python correlation-calculation.py
./src/visualization
76 commits
Jupyter Notebook
70.0%
Python
29.6%
Code for ACL 2026 Findings paper "Alignment Data Map for Efficient Preference Data Selection and Diagnosis"
1
stars
76
commits
Jupyter Notebook
primary language
Jun 30, 2026
updated
Code for ACL 2026 Findings Paper "Alignment Data Map for Efficient Preference Data Selection and Diagnosis"
conda env create -f environment.yml
conda activate dc
pip install -r requirements.txt
Dataset-Cartography/
├── data-map/ # Generating Data maps
│ ├── results/
│ └── src/
├── train-eval/ # for Train and Evaluation
│ ├── LLaMA-Factory/ # for DPO Train
│ ├── SimPO/ # for SimPO Train
│ ├── src/ # Evaluation Code
│ └── eval/
│ ├── alpaca_eval
│ ├── instruct-eval
│ └── FastChat
├── README.md
├── requirements.txt
└── environment.yml
Choose model to use and process openAI API Inference
config : ./src/config.yaml
python gpt-inference.py
calculating similarity of proxy GPT response and other model responses using various Sentence Transformer models
config : ./src/scores/sentence-transformer-config.yaml
available models : ST(Sentence Transformer), NV
python sentence-transformer.py
calculating variance between responses
config : ./src/scores/variance-config.yaml
available methods : proxy-response, response
python variance.py
calculating correlation of human preference and proxy-response similarity score using various methods
config : ./src/correlations/correlation-config.yaml
available methods : cosine, cosine-minmax, pearson, pearson-minmax, kendall
python correlation-calculation.py
./src/visualization
76 commits
Jupyter Notebook
70.0%
Python
29.6%