如何搭建自己的开源法律助手:3 款中文法律大模型选型与部署指南
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
租房押金被扣、合同没看仔细、想查法条却看不懂——这些问题不必每次等律师回复。开源项目 Awesome-Chinese-LLM 把一批中文法律大模型整理在同一个仓库里,基座、训练数据、算力配置都列得清楚,足够你在自己的机器上搭一个开源法律助手。这篇笔记按"选型 → 部署 → 使用"的顺序带你走一遍,坑也一并说在前面。
能力清单:法律咨询、合同审查AI与文书生成
开源法律AI能干的事集中在几件上,先对号入座:
| 能力 | 典型场景 | 适合人群 |
|---|---|---|
| 法律咨询 | 劳动争议、租房纠纷、侵权赔偿等日常问答 | 遇到具体纠纷的普通用户 |
| 合同审查AI | 签约前逐条过条款,标出模糊或不对等的地方 | 个人与小微经营者 |
| 法律文书生成 | 律师函、投诉信、起诉状初稿 | 需要书面文书、预算有限的人 |
| 法条与判例解读 | 法条解释、案例拆解、类案检索思路 | 法学生与法律从业者 |
两个使用场景举例。其一,签劳动协议或租房合同前把全文丢给模型逐条过一遍,让它标出"口头承诺不写进合同""单方免责"这类点,你再决定要不要谈。其二,需要发律师函或投诉信时,先让模型出初稿,你改完事实细节再发,比对着空白文档发呆省事。一句话:初稿能省时间,但事实表述必须由你把关。
法律大模型选型:三款模型怎么挑
仓库里法律方向的模型不止三个,但资料最齐、最常引用的是下面三款。对比表基于仓库 doc/Legal.md 的记录:
| 模型 | 基座 | 团队 | 数据特点 | 适用场景 |
|---|---|---|---|---|
| 獬豸 (LawGPT_zh) | ChatGLM-6B | 上海交通大学 | 20 万条真实律师用户问答,用法条+真实案例构造情景问答 | 贴近实务的日常法律问答 |
| LaWGPT | Chinese-Alpaca-Plus-7B | 南京大学 | 裁判文书网、司法考试、国家法律法规数据库等官方多源数据 | 法条解释、案例分析 |
| ChatLaw | 姜子牙 Ziya-LLaMA-13B-v1(另有 33B 版基于 Anima-33B) | 北京大学 | 论坛、新闻、法条、司法解释、法考题、判决文书混合后构造对话数据 | 复杂问题、需要推理链条的场景 |
每款一句选型建议:
- 獬豸:要"像律师一样说话"的实务回答、机器配置一般,选它,6B 最省心。
- LaWGPT:常查法条和判例、需要官方数据背书的选它;协议是 GPL-3.0,商用前看清条款。
- ChatLaw:问题复杂、要完整推理过程的选它;13B 对显存要求高,小机器慎选。
提醒一句:三款都是 2023 年发布的,法律条文持续更新,它们的"知识截止点"就在各自训练数据里。新法、新司法解释出来之后,模型不会自动知道。
十分钟完成法律大模型部署
法律大模型部署分三步:拿仓库、备硬件、加载模型。
第一步,获取仓库。它本身是资源汇总,模型权重和代码在各模型自己的开源仓库里,按 doc/Legal.md 里的条目逐个找:
git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM第二步,备硬件。仓库官方记录的是训练侧算力(獬豸 4 张 NVIDIA 3090、LaWGPT 8 张 Tesla V100 32GB、ChatLaw 多张 V100),推理侧没给统一标准,按参数量估算分两档:
- 入门档:獬豸、LaWGPT 这类 6B/7B 模型,单张消费级显卡 12GB 显存起步,4bit 量化后 8GB 也可以试。
- 专业档:ChatLaw-13B 这类 13B 模型,建议 24GB 显存,或者先做 4bit 量化再跑。
- 没有独立显卡时 CPU 也能推理,但速度只够测试,不适合日常用。
第三步,加载模型。各仓库 README 都有示例脚本,通用写法大致是这样:
from transformers import AutoModelForCausalLM, AutoTokenizer model = AutoModelForCausalLM.from_pretrained("模型权重路径") tokenizer = AutoTokenizer.from_pretrained("模型权重路径")跑通第一句对话就算部署完成。报错优先查依赖版本和显存占用,这两个问题占大头。
上手技巧:提问、验证与更新
提问方式直接决定回答质量。三条经验:
- 把问题写具体:城市、角色、金额、时间都要有,"北京租房押一付三被扣押金"比"租房被坑了"有效得多。
- 先给背景再提问:一句话交代事实经过,再问法律点。
- 复杂问题拆开问:先问"这算违约吗",再问"我能主张哪些赔偿",一次问完反而容易漏。
结果验证不能省。模型给出的法条编号、条款序号,去官方法律法规数据库核对一遍原文。模型会"编法条",这是大模型的通病,在法律领域代价最大。
维护上两件事:定期看各模型仓库有没有新版权重;新法规出来之后,用检索增强(RAG)外挂一份最新法规库,比干等模型更新更直接,仓库里 DISC-LawLLM 就是带检索增强模块的,可以参考它的做法。
进阶了解:架构分层与发展方向
这类系统的结构大致是三层:底层通用基座(ChatGLM、LLaMA 系),中间法律语料继续预训练加指令微调,顶层按任务挂应用接口——ChatLaw 配了个 Text2Vec 法条匹配模型,DISC-LawLLM 挂了检索增强,都属于这一层。方向上,检索增强和多模态(直接读合同扫描件)是接下来最值得跟的两条线。
更多模型的细节(License、数据构成、算力)都在官方文档:doc/Legal.md。建议先拿獬豸跑通第一句对话,再按你的问题类型换第二款模型对比,一次别贪多。
【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考