news 2026/10/3 2:00:24

如何搭建自己的开源法律助手:3 款中文法律大模型选型与部署指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何搭建自己的开源法律助手:3 款中文法律大模型选型与部署指南

如何搭建自己的开源法律助手:3 款中文法律大模型选型与部署指南

【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM

租房押金被扣、合同没看仔细、想查法条却看不懂——这些问题不必每次等律师回复。开源项目 Awesome-Chinese-LLM 把一批中文法律大模型整理在同一个仓库里,基座、训练数据、算力配置都列得清楚,足够你在自己的机器上搭一个开源法律助手。这篇笔记按"选型 → 部署 → 使用"的顺序带你走一遍,坑也一并说在前面。

能力清单:法律咨询、合同审查AI与文书生成

开源法律AI能干的事集中在几件上,先对号入座:

能力典型场景适合人群
法律咨询劳动争议、租房纠纷、侵权赔偿等日常问答遇到具体纠纷的普通用户
合同审查AI签约前逐条过条款,标出模糊或不对等的地方个人与小微经营者
法律文书生成律师函、投诉信、起诉状初稿需要书面文书、预算有限的人
法条与判例解读法条解释、案例拆解、类案检索思路法学生与法律从业者

两个使用场景举例。其一,签劳动协议或租房合同前把全文丢给模型逐条过一遍,让它标出"口头承诺不写进合同""单方免责"这类点,你再决定要不要谈。其二,需要发律师函或投诉信时,先让模型出初稿,你改完事实细节再发,比对着空白文档发呆省事。一句话:初稿能省时间,但事实表述必须由你把关。

法律大模型选型:三款模型怎么挑

仓库里法律方向的模型不止三个,但资料最齐、最常引用的是下面三款。对比表基于仓库 doc/Legal.md 的记录:

模型基座团队数据特点适用场景
獬豸 (LawGPT_zh)ChatGLM-6B上海交通大学20 万条真实律师用户问答,用法条+真实案例构造情景问答贴近实务的日常法律问答
LaWGPTChinese-Alpaca-Plus-7B南京大学裁判文书网、司法考试、国家法律法规数据库等官方多源数据法条解释、案例分析
ChatLaw姜子牙 Ziya-LLaMA-13B-v1(另有 33B 版基于 Anima-33B)北京大学论坛、新闻、法条、司法解释、法考题、判决文书混合后构造对话数据复杂问题、需要推理链条的场景

每款一句选型建议:

  • 獬豸:要"像律师一样说话"的实务回答、机器配置一般,选它,6B 最省心。
  • LaWGPT:常查法条和判例、需要官方数据背书的选它;协议是 GPL-3.0,商用前看清条款。
  • ChatLaw:问题复杂、要完整推理过程的选它;13B 对显存要求高,小机器慎选。

提醒一句:三款都是 2023 年发布的,法律条文持续更新,它们的"知识截止点"就在各自训练数据里。新法、新司法解释出来之后,模型不会自动知道。

十分钟完成法律大模型部署

法律大模型部署分三步:拿仓库、备硬件、加载模型。

第一步,获取仓库。它本身是资源汇总,模型权重和代码在各模型自己的开源仓库里,按 doc/Legal.md 里的条目逐个找:

git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM

第二步,备硬件。仓库官方记录的是训练侧算力(獬豸 4 张 NVIDIA 3090、LaWGPT 8 张 Tesla V100 32GB、ChatLaw 多张 V100),推理侧没给统一标准,按参数量估算分两档:

  • 入门档:獬豸、LaWGPT 这类 6B/7B 模型,单张消费级显卡 12GB 显存起步,4bit 量化后 8GB 也可以试。
  • 专业档:ChatLaw-13B 这类 13B 模型,建议 24GB 显存,或者先做 4bit 量化再跑。
  • 没有独立显卡时 CPU 也能推理,但速度只够测试,不适合日常用。

第三步,加载模型。各仓库 README 都有示例脚本,通用写法大致是这样:

from transformers import AutoModelForCausalLM, AutoTokenizer model = AutoModelForCausalLM.from_pretrained("模型权重路径") tokenizer = AutoTokenizer.from_pretrained("模型权重路径")

跑通第一句对话就算部署完成。报错优先查依赖版本和显存占用,这两个问题占大头。

上手技巧:提问、验证与更新

提问方式直接决定回答质量。三条经验:

  • 把问题写具体:城市、角色、金额、时间都要有,"北京租房押一付三被扣押金"比"租房被坑了"有效得多。
  • 先给背景再提问:一句话交代事实经过,再问法律点。
  • 复杂问题拆开问:先问"这算违约吗",再问"我能主张哪些赔偿",一次问完反而容易漏。

结果验证不能省。模型给出的法条编号、条款序号,去官方法律法规数据库核对一遍原文。模型会"编法条",这是大模型的通病,在法律领域代价最大。

维护上两件事:定期看各模型仓库有没有新版权重;新法规出来之后,用检索增强(RAG)外挂一份最新法规库,比干等模型更新更直接,仓库里 DISC-LawLLM 就是带检索增强模块的,可以参考它的做法。

进阶了解:架构分层与发展方向

这类系统的结构大致是三层:底层通用基座(ChatGLM、LLaMA 系),中间法律语料继续预训练加指令微调,顶层按任务挂应用接口——ChatLaw 配了个 Text2Vec 法条匹配模型,DISC-LawLLM 挂了检索增强,都属于这一层。方向上,检索增强和多模态(直接读合同扫描件)是接下来最值得跟的两条线。


更多模型的细节(License、数据构成、算力)都在官方文档:doc/Legal.md。建议先拿獬豸跑通第一句对话,再按你的问题类型换第二款模型对比,一次别贪多。

【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主,包括底座模型,垂直领域微调及应用,数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 1:58:39

STM32F1自定义HID实战:寄存器级USB协议栈开发

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华