GewisLab/dataset_benchmark
数据集
数据集查看器
文件和版本
Pull Requests
讨论

📚 简介

这是面向ShizhenGPT的文本基准,ShizhenGPT是一款针对中医药(TCM) 的多模态大型语言模型。

有关详细信息,请参见我们的论文和GitHub仓库。

📊 基准概述

该基准由7个部分组成,每个部分均汇编自不同的权威中医药图解书籍。

部分样本数量
TCM Patent1119
TCM Material1020
TCM Herb1100
Tongue768
Palm640
Holism1011
Tuina831
Eye715

⚒️ 数据构建

{
  "image": [
    "tcm_bench_images/0001.jpg"
  ],
  "question": "请根据这张图片,判断它属于下面哪一种?",
  "options": {
    "A": "巴戟肉",
    "B": "盐巴戟天",
    "C": "制白附子片",
    "D": "生白附子片"
  },
  "answer": "巴戟肉",
  "answer_idx": "A",
  "category": "TCM Patent"
}

📖 引用说明

如果您发现我们的数据有用,请考虑引用我们的研究成果!

@misc{chen2025shizhengptmultimodalllmstraditional,
      title={ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine}, 
      author={Junying Chen and Zhenyang Cai and Zhiheng Liu and Yunjin Yang and Rongsheng Wang and Qingying Xiao and Xiangyi Feng and Zhan Su and Jing Guo and Xiang Wan and Guangjun Yu and Haizhou Li and Benyou Wang},
      year={2025},
      eprint={2508.14706},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2508.14706},
}