mtkresearch/RAD-Bench

RAD-Bench: A Benchmark for Evaluating Large Language Models with Context Utilization in Multi-Turn Dialogues

9

stars

29

commits

Python

primary language

Aug 15, 2024

updated

README

RAD-Bench

RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues

Tzu-Lin Kuo*, Feng-Ting Liao*, Mu-Wei Hsieh, Fu-Chieh Chang, Po-Chun Hsu, Da-Shan Shiu

*core contributors

This is the official repo of the RAD-Bench.

Benchmark results

model_radar correlation
NameAcademicNewsEducationFinanceCustomerTravelAverage
GPT-4o8.778.688.959.009.107.838.72
GPT-4o-mini8.278.538.808.878.537.808.47
Mistral-Large8.177.778.338.587.836.767.91
GPT-3.5-Turbo5.305.236.558.048.475.936.59
Llama3.1-405B7.908.078.258.227.637.217.88
Llama3.1-70B8.037.728.258.026.837.077.65
Mixtral-8x22b7.707.477.978.228.105.797.54
Gemma-2-27B5.503.603.057.716.171.524.59
Deepseek-v27.576.678.008.718.277.957.86
BreeXe-8x7B8.478.148.587.567.635.747.69
Mistral-Nemo-12B7.206.847.427.337.473.556.63
Gemma-2-9B5.633.613.178.046.001.504.66
Llama3.1-8B7.336.167.538.336.775.176.88
Breeze-7B7.477.337.806.937.134.836.92

Installation

pip install -r requirements.txt

Inference

Simply do,

cd rad_bench/script
sh run_inference.sh

Evaluation

Simply do,

cd rad_bench/script
sh run_evaluation.sh

Visulization

To see the results, do

cd rad_bench/script
sh run_qa_browser.sh

then open localhost:1234 in your browser

Citation

Please cite this repo with

@misc{rad-kuo2024,
      title={RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval
Augmented Dialogues},
      author={Tzu-Lin Kuo, Feng-Ting Liao, Mu-Wei Hsieh, Fu-Chieh Chang, Po-Chun Hsu, Da-Shan Shiu},
      year={2024}
}

Contributors

FTLiao

11 commits

ftmtk

11 commits

morweee

4 commits

d09942015ntu

3 commits

mtkresearch/RAD-Bench

RAD-Bench: A Benchmark for Evaluating Large Language Models with Context Utilization in Multi-Turn Dialogues

9

stars

29

commits

Python

primary language

Aug 15, 2024

updated

README

RAD-Bench

RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues

Tzu-Lin Kuo*, Feng-Ting Liao*, Mu-Wei Hsieh, Fu-Chieh Chang, Po-Chun Hsu, Da-Shan Shiu

*core contributors

This is the official repo of the RAD-Bench.

Benchmark results

model_radar correlation
NameAcademicNewsEducationFinanceCustomerTravelAverage
GPT-4o8.778.688.959.009.107.838.72
GPT-4o-mini8.278.538.808.878.537.808.47
Mistral-Large8.177.778.338.587.836.767.91
GPT-3.5-Turbo5.305.236.558.048.475.936.59
Llama3.1-405B7.908.078.258.227.637.217.88
Llama3.1-70B8.037.728.258.026.837.077.65
Mixtral-8x22b7.707.477.978.228.105.797.54
Gemma-2-27B5.503.603.057.716.171.524.59
Deepseek-v27.576.678.008.718.277.957.86
BreeXe-8x7B8.478.148.587.567.635.747.69
Mistral-Nemo-12B7.206.847.427.337.473.556.63
Gemma-2-9B5.633.613.178.046.001.504.66
Llama3.1-8B7.336.167.538.336.775.176.88
Breeze-7B7.477.337.806.937.134.836.92

Installation

pip install -r requirements.txt

Inference

Simply do,

cd rad_bench/script
sh run_inference.sh

Evaluation

Simply do,

cd rad_bench/script
sh run_evaluation.sh

Visulization

To see the results, do

cd rad_bench/script
sh run_qa_browser.sh

then open localhost:1234 in your browser

Citation

Please cite this repo with

@misc{rad-kuo2024,
      title={RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval
Augmented Dialogues},
      author={Tzu-Lin Kuo, Feng-Ting Liao, Mu-Wei Hsieh, Fu-Chieh Chang, Po-Chun Hsu, Da-Shan Shiu},
      year={2024}
}

Contributors

FTLiao

11 commits

ftmtk

11 commits

morweee

4 commits

d09942015ntu

3 commits

Languages

Python

95.7%

Jupyter Notebook

3.4%