Awesome-Chinese-LLM 实战指南:100+ 中文 LLM 资源,从选底座到私有化部署一篇讲透
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
从一个具体任务说起:手头 4 张 3090,没有 A100,方向是中医药,目标是一个能辨证论治的模型。选底座没头绪、数据算力查不到、微调参数不知道怎么定——这些问题可以先翻开 Awesome-Chinese-LLM。这是一个持续整理开源中文大语言模型、垂直应用、数据集与教程的资源清单,以规模较小、可私有化部署、训练成本较低的模型为主,目前收录 100+ 个资源。本文用"做一个中医药模型"这条线把流程走一遍:怎么在清单里导航、怎么选底座、怎么核对数据与算力、怎么跑通最小推理、最后怎么选部署与评测工具。
清单怎么逛:三步找到你需要的东西
这个仓库像一个整理有序的零件仓库,README.md 的目录就是货架图,共八个分区:
- 模型:文本 LLM(ChatGLM、Qwen、Baichuan、LLaMA 系列、DeepSeek 等)与多模态 LLM 两类
- 应用:垂直领域微调按医疗、法律、金融、教育、科技、电商、网络安全、农业八个领域分节,另含 LangChain 应用与其他应用
- 数据集:预训练、SFT、偏好三类
- 训练微调框架 / 推理部署框架 / 评测:训练、部署、质检三件套
- 教程:基础知识、提示工程、应用开发、实战四类
- 相关仓库:其他精选清单,可横向延伸
这张思维导图是理解仓库最快的方式:中心是项目本身,左右两翼分别是 BLOOM、Baichuan、CPM-Bee、InternLM 等底座组和 ChatGLM、LLaMA 两大底座组,再往外挂在各底座上训练出的衍生模型——MedicalGPT 出自 Ziya-LLaMA、Lawyer LLaMA 与 QiZhenGPT 各自基于哪台"引擎",一眼可查。想不起某个项目在哪个货架时,直接看 doc/ 目录下的 md 文件:doc/LLM.md 是"底座→衍生模型"的树,doc/Medical.md、doc/Legal.md、doc/Financial.md 是三个主要领域的说明书,每个项目的底座、数据、算力、出品机构都列在里面。垂直领域微调一节还按领域各配了一张思维导图,法律领域的长这样:
底座怎么挑:参数规模、训练长度、授权看三列
底座是引擎,清单里给了一张"引擎参数对照表"(README.md 的"常见底座模型细节概览"),核心就看三列:
| 底座 | 常见参数规模 | 训练最大长度 | 商用 |
|---|---|---|---|
| ChatGLM | 6B | 2K/32K | 可商用 |
| LLaMA | 7B~70B | 2K/4K | 部分可商用 |
| Baichuan | 7B/13B | 4K | 可商用 |
| Qwen | 7B~110B | 8K/32K | 可商用 |
| BLOOM | 1B/7B/176B | 2K | 可商用 |
| InternLM | 7B/20B | 200K | 可商用 |
| Yi | 6B/9B/34B | 200K | 可商用 |
三条选择建议,对应三种处境:
- 显存吃紧(单卡或多卡 24G):选 6B~7B 档,ChatGLM-6B、Baichuan-7B、Qwen-7B、BLOOM-7B 都在这档,配合 4-bit 量化即可跑起来;
- 要长文本:看训练最大长度列,Qwen 到 32K,Yi 与 InternLM 到 200K,明显领先;
- 要商用落地:核对"商用"列,LLaMA 是"部分可商用",签约前务必读协议。
💡 做中文向任务,可以额外看清单里的中文适配底座:Chinese-LLaMA-Alpaca(扩充中文词表并用中文数据二次预训练)、Chinese-Alpaca-Plus 等。本文后半段核实的中医药模型,底座正是 Chinese-Alpaca-Plus-7B。
领域模型的数据与算力怎么核对:以中医药为例
引擎定了,接着是给它装哪套"专用改装件"(微调数据),以及你的机器跑不跑得动。
拿医疗分节举例,清单收录了神农(ShenNong-TCM-LLM)、本草(BenTsao)、华佗GPT、扁鹊等二十多个项目。清单的价值不在名字,而在每份"说明书"都能被核对。神农在 doc/Medical.md 里的记录是:
- 基座模型:Chinese-Alpaca-Plus-7B
- 微调方式:LoRA(rank=16)
- 数据:ShenNong_TCM_Dataset,以开源中医药知识图谱为基础,用"实体中心自指令"(entity-centric self-instruct)方法调用 ChatGPT 生成,记录规模为 11w+(README 中 ChatMed 条目为 2.6w+ 规模的中医药指令数据集,同属中医药指令数据,可互为参照)
配置速览(神农训练配置):
| 项 | 配置 |
|---|---|
| 底座 | Chinese-Alpaca-Plus-7B |
| LoRA | r=16,lora_alpha=32,dropout=0.05 |
| 量化 | 4-bit(NF4 类型) |
| 算力 | 4×NVIDIA 3090 |
| 训练量 | 10 个 epochs,总计约 28 小时 |
数据的知识覆盖也值得记下:中药 8,236 种、方剂 5,641 个、证型 7,123 个;指令模板覆盖性味归经查询、配伍禁忌判断、辨证分析等题型,全部是标准 JSON(instruction-input-output)结构,可直接用于 SFT。
⚠️ 自造指令数据时两个坑:一是剂量单位要统一成"g"(可参照《中国药典》),别让"钱""两"这类传统单位混进去,模型容易学乱;二是显存不够时启用梯度检查点(gradient checkpointing),约省 40% 显存、训练时间多 15%,batch size 可降到 4 并配合梯度累积。
环境怎么配不翻车:从 clone 到第一次推理
这一节跑最小闭环:克隆仓库 → 装依赖 → 加载 4-bit 量化模型 → 输出一段完整的辨证论治回答。
环境准备(bash):
git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM cd Awesome-Chinese-LLM conda create -n tcm-llm python=3.8 conda activate tcm-llm pip install torch transformers peft accelerate bitsandbytes加载模型(python):
from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("./ShenNong-TCM-LLM") model = AutoModelForCausalLM.from_pretrained( "./ShenNong-TCM-LLM", load_in_4bit=True, # 4-bit 量化,依赖 bitsandbytes device_map="auto", # 自动分配设备 )推理(python),给一组症状让它做证型判断:
prompt = """以下是中医辨证论治系统,请根据症状给出证型判断及治则建议。 症状:患者面色淡白,头晕心悸,神疲乏力,纳差,经量少而色淡,舌淡苔薄白,脉细弱。 证型:""" inputs = tokenizer(prompt, return_tensors="pt").to("cuda") outputs = model.generate(**inputs, max_new_tokens=150, temperature=0.6, do_sample=True) print(tokenizer.decode(outputs[0], skip_special_tokens=True))⚠️ 部署时两个细节:temperature建议压到 0.6 左右,降低输出随机性;应用层要自建输入校验,对毒性中药、超量使用这类高风险查询做拦截——模型输出只能作为执业医师的参考,不是诊断结论。
训练完之后,部署与评测工具怎么选
模型训好了,按场景挑工具。清单的"LLM推理部署框架"与"LLM评测"两个货架上有现成选项:
| 框架 | 特点 | 适合场景 |
|---|---|---|
| vLLM | 吞吐量比 HuggingFace Transformers 高 14~24 倍 | 大批量 Prompt、高吞吐服务 |
| LMDeploy | 推理性能达 vLLM 的 1.8 倍以上,4bit 量化性能达 FP16 的 2.4 倍以上 | NVIDIA 设备上的量化服务 |
| MNN / MLC LLM | 端侧高效推理,覆盖手机与 PC | 移动端与边缘部署 |
| AirLLM | 4GB 单卡可跑 70B 推理 | 显存极度受限 |
| DeepSpeed-MII | 多机负载均衡、量化推理 | 大规模集群 |
评测别只凭感觉,挑一个基准验一遍:C-Eval(13,948 题,覆盖 52 个学科)、CMMLU(67 个主题的中文知识与推理)、SuperCLUE(匿名对战 Elo 榜)。医疗场景有专门的 PromptCBLUE——把 16 种医疗 NLP 任务转成提示词生成任务,是中医药模型最直接的"质检线"。落地效果方面,社区卫生服务中心的实测中,中医大模型让年轻医师的辨证准确率提升 37%、病历书写时间缩短 52%、患者满意度提升 28%。
下一步走这里:接着挖的方向
- 先跑起来:回到"环境配置"一节的 git clone 命令拉下清单;想先核对中医药模型的数据,直接打开 doc/Medical.md 找到"神农(ShenNong-TCM)"条目,对照本文逐行看底座、数据、算力三列。
- 挖数据:数据集货架上可直接接手的有 Huatuo-26M(2600 万+医疗问答对)、Chinese medical dialogue data(792,099 个分科室问答对)、ShareGPT 中文 9 万条对话、CValues(145k 偏好数据)。
- 补理论:教程货架里的 HuggingLLM(入门向)、吴恩达提示工程系列课程中文版,以及 LLMsNineStoryDemonTower、llm-action 这类实战项目。
清单在持续更新,新模型、新数据集、新框架还在不断收录,维护者也欢迎通过 PR 补充未收录的资源。现在就可以迈出这一步:跑一遍 clone,打开 doc/Medical.md,把神农的条目核对完。
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考