If you find any error in this benchmark or want to contribute to this benchmark, please feel free to contact us.
This is a dataset collection of JMedBench, which is a benchmark for evaluating Japanese biomedical large language models (LLMs). Details can be found in this paper. We also provide an evaluation framework, med-eval, for easy evaluation.
The JMedBench consists of 20 datasets across 5 tasks, listed below.
| Task | Dataset | License | Source | Note |
|---|---|---|---|---|
| MCQA | medmcqa_jp | MIT | MedMCQA | Translated |
| usmleqa_jp | MIT | MedQA | Translated | |
| medqa_jp | MIT | MedQA | Translated | |
| mmlu_medical_jp | MIT | MMLU | Translated | |
| jmmlu_medical | CC-BY-SA-4.0 | JMMLU | ||
| igakuqa | - | paper | ||
| pubmedqa_jp | MIT | PubMedQA | Translated | |
| MT | ejmmt | CC-BY-4.0 | paper | |
| NER | mrner_medicine | CC-BY-4.0 | JMED-LLM | |
| mrner_disease | CC-BY-4.0 | JMED-LLM | ||
| nrner | CC-BY-NC-SA-4.0 | JMED-LLM | ||
| bc2gm_jp | Unknown | BLURB | Translated | |
| bc5chem_jp | Other | BLURB | Translated | |
| bc5disease_jp | Other | BLURB | Translated | |
| jnlpba_jp | Unknown | BLURB | Translated | |
| ncbi_disease_jp | Unknown | BLURB | Translated | |
| DC | crade | CC-BY-4.0 | JMED-LLM | |
| rrtnm | CC-BY-4.0 | JMED-LLM | ||
| smdis | CC-BY-4.0 | JMED-LLM | ||
| STS | jcsts | CC-BY-NC-SA-4.0 | paper |
Please be aware of the risks, biases, and limitations of this benchmark.
As introduced in the previous section, some evaluation datasets are translated from the original sources (in English). Although we used the most powerful API from OpenAI (i.e., gpt-4-0613) to conduct the translation, it may be unavoidable to contain incorrect or inappropriate translations. If you are developing biomedical LLMs for real-world applications, please conduct comprehensive human evaluation before deployment.
BibTeX: If our JMedBench is helpful for you, please cite our work:
@misc{jiang2024jmedbenchbenchmarkevaluatingjapanese,
title={JMedBench: A Benchmark for Evaluating Japanese Biomedical Large Language Models},
author={Junfeng Jiang and Jiahao Huang and Akiko Aizawa},
year={2024},
eprint={2409.13317},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2409.13317},
}
139 commits
If you find any error in this benchmark or want to contribute to this benchmark, please feel free to contact us.
This is a dataset collection of JMedBench, which is a benchmark for evaluating Japanese biomedical large language models (LLMs). Details can be found in this paper. We also provide an evaluation framework, med-eval, for easy evaluation.
The JMedBench consists of 20 datasets across 5 tasks, listed below.
| Task | Dataset | License | Source | Note |
|---|---|---|---|---|
| MCQA | medmcqa_jp | MIT | MedMCQA | Translated |
| usmleqa_jp | MIT | MedQA | Translated | |
| medqa_jp | MIT | MedQA | Translated | |
| mmlu_medical_jp | MIT | MMLU | Translated | |
| jmmlu_medical | CC-BY-SA-4.0 | JMMLU | ||
| igakuqa | - | paper | ||
| pubmedqa_jp | MIT | PubMedQA | Translated | |
| MT | ejmmt | CC-BY-4.0 | paper | |
| NER | mrner_medicine | CC-BY-4.0 | JMED-LLM | |
| mrner_disease | CC-BY-4.0 | JMED-LLM | ||
| nrner | CC-BY-NC-SA-4.0 | JMED-LLM | ||
| bc2gm_jp | Unknown | BLURB | Translated | |
| bc5chem_jp | Other | BLURB | Translated | |
| bc5disease_jp | Other | BLURB | Translated | |
| jnlpba_jp | Unknown | BLURB | Translated | |
| ncbi_disease_jp | Unknown | BLURB | Translated | |
| DC | crade | CC-BY-4.0 | JMED-LLM | |
| rrtnm | CC-BY-4.0 | JMED-LLM | ||
| smdis | CC-BY-4.0 | JMED-LLM | ||
| STS | jcsts | CC-BY-NC-SA-4.0 | paper |
Please be aware of the risks, biases, and limitations of this benchmark.
As introduced in the previous section, some evaluation datasets are translated from the original sources (in English). Although we used the most powerful API from OpenAI (i.e., gpt-4-0613) to conduct the translation, it may be unavoidable to contain incorrect or inappropriate translations. If you are developing biomedical LLMs for real-world applications, please conduct comprehensive human evaluation before deployment.
BibTeX: If our JMedBench is helpful for you, please cite our work:
@misc{jiang2024jmedbenchbenchmarkevaluatingjapanese,
title={JMedBench: A Benchmark for Evaluating Japanese Biomedical Large Language Models},
author={Junfeng Jiang and Jiahao Huang and Akiko Aizawa},
year={2024},
eprint={2409.13317},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2409.13317},
}
139 commits