这是面向ShizhenGPT的文本基准,ShizhenGPT是一款针对中医药(TCM) 的多模态大型语言模型。
该基准由7个部分组成,每个部分均汇编自不同的权威中医药图解书籍。
| 部分 | 样本数量 |
|---|---|
| TCM Patent | 1119 |
| TCM Material | 1020 |
| TCM Herb | 1100 |
| Tongue | 768 |
| Palm | 640 |
| Holism | 1011 |
| Tuina | 831 |
| Eye | 715 |
{
"image": [
"tcm_bench_images/0001.jpg"
],
"question": "请根据这张图片,判断它属于下面哪一种?",
"options": {
"A": "巴戟肉",
"B": "盐巴戟天",
"C": "制白附子片",
"D": "生白附子片"
},
"answer": "巴戟肉",
"answer_idx": "A",
"category": "TCM Patent"
}如果您发现我们的数据有用,请考虑引用我们的研究成果!
@misc{chen2025shizhengptmultimodalllmstraditional,
title={ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine},
author={Junying Chen and Zhenyang Cai and Zhiheng Liu and Yunjin Yang and Rongsheng Wang and Qingying Xiao and Xiangyi Feng and Zhan Su and Jing Guo and Xiang Wan and Guangjun Yu and Haizhou Li and Benyou Wang},
year={2025},
eprint={2508.14706},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2508.14706},
}