news 2026/9/9 13:23:11

WeClone 完整教程:用微信聊天记录微调大模型,做出你的 AI 数字分身

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
WeClone 完整教程:用微信聊天记录微调大模型,做出你的 AI 数字分身

WeClone 完整教程:用微信聊天记录微调大模型,做出你的 AI 数字分身

【免费下载链接】WeClone🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone

WeClone 是一个从聊天记录创建 AI 数字分身的大语言模型微调项目:把微信聊天导出的 CSV 记录转成训练集,跑一次 LoRA 微调,一张 16GB 显存的显卡就能得到一个"说话像你"的聊天机器人,还能挂回微信里自动回复。从数据到上线,实际只分四步。

🚀 第一次跑通:把微信聊天记录变成训练数据集

先 clone 仓库并装依赖:

git clone https://gitcode.com/GitHub_Trending/we/WeClone pip install -r requirements.txt

数据是效果的关键。用 PyWxDump 把微信聊天记录解密导出为 CSV(导出类型选 CSV),再把这些文件放进data/csv目录。然后执行项目自带的预处理脚本,它会只保留你发出的消息,并自动过滤手机号、身份证、邮箱、网址:

./make_dataset/csv_to_json.py

脚本在make_dataset/下有三个变体,区别只在"同一个人连发多句"时怎么处理:默认版用逗号拼接,单句多轮.py会把历史句放进提示词的history字段。另外make_dataset/blocked_words.json是禁用词库,命中整句直接丢弃,可以按自己的隐私需求往里加词。

🎯 第一次出效果:16GB 显存 LoRA 微调 ChatGLM3

默认底座是 ChatGLM3-6B,用 LoRA 方式做 SFT 微调,约 16GB 显存。把模型下载到本地后,改两个地方就能开始训练:

  • settings.json里按自己的数据量调整num_train_epochslora_rank,显存吃紧就调小per_device_train_batch_size
  • 训练入口是src/train_sft.py,作者实测 loss 降到 3.5 左右,降太多容易过拟合
python src/train_sft.py

单卡不够就上多卡:装好 deepspeed 后用deepspeed --num_gpus=N src/train_sft.py启动即可。仓库还提供了src/train_pt.py的预训练阶段脚本,但作者自己的结论是提升不明显,新手可以跳过。

💬 第一次分享给别人:Web 演示、命令行和微信机器人

训练完先自己把玩。Web 演示一条命令起服务,浏览器打开就能聊:

python ./src/web_demo.py

命令行交互用src/cli_demo.py,对外提供服务则启动src/api_service.py,之后可以配合src/test_model.py用一组常见聊天问题给模型"体检"。

想让它住进微信,就把它部署成微信机器人:先起 API 服务,再跑src/wechat_bot/下的入口,终端会出登录二维码,扫码后私聊或群里 @ 都能用:

python ./src/api_service.py python ./src/wechat_bot/main.py

提醒一句:微信有封号风险,建议用小号,并且该号必须绑定银行卡。

⚙️ 三个高频问题:显存不够、换模型、效果差怎么办

  • 显存不够:官方表格里 QLoRA 4-bit 跑 7B 只要 6GB。项目基于 LLaMA Factory 生态,换 QLoRA、换更小的模型(如 7B 以下)改settings.json里对应字段即可,模板system提示词要同步调整。
  • 换模型:默认 ChatGLM3 之外可换 LLaMA Factory 支持的任意模型,下载后把settings.json里的model_name_or_path指向本地路径。
  • 效果差:作者用 2 万条数据也只能"差强人意但有时很搞笑"。效果很大程度上取决于聊天数据的数量和质量,先扩充数据比调参更有用。

聊天记录就是你独一无二的"语料库",别人复制不走。找个周末,把四步跑完,你的数字分身就能替你先回几轮消息了。

【免费下载链接】WeClone🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/9 13:22:56

C++实现样条曲线拟合:从三弯矩方程到托马斯算法

简介:一套基于C的样条曲线拟合实现,面向数值分析、图形学与工程建模方向的学习者,解决离散数据点平滑逼近与插值问题。代码围绕三次B样条展开,重点演示基函数构造、控制点定义以及插值与最小二乘拟合的求解流程,并提供…

作者头像 李华
网站建设 2026/9/9 13:22:38

华为MetaERP # 跨境业务:客户回款、供应商付款结算方式、业务场景、会计分录 Oracle EBS / Fusion 处理> > 范围:国际贸易,应收(客户回款)、应付(供应商付款),

跨境业务:客户回款、供应商付款结算方式、业务场景、会计分录 & Oracle EBS / Fusion 处理 范围:国际贸易,应收(客户回款)、应付(供应商付款),包含票据、信用证、保函、汇付、托…

作者头像 李华
网站建设 2026/9/9 13:22:19

opencode 深度实操:终端 AI 编程助手的安装、配置与多模型接入指南

好的,我来为你写一篇关于 opencode 的深度实操博文。内容完全围绕用户提供的标题和热词展开,以资深开发者的一线经验视角来叙述。opencode 是什么:终端 AI 编程助手的一次认真选择老实说,2025 年做 AI 编程工具选择的开发者&#…

作者头像 李华
网站建设 2026/9/9 13:21:57

后端开发必知的10个开源组件,最后一个你可能没用过

2026年,后端开发早已不是“会写CRUD就能胜任”的时代了。无论你用Go、Java、Python还是TypeScript,选对开源组件,决定了你的项目上限和开发效率的下限。一个好的组件能让代码量减半、性能翻倍;一个错误的选择,则可能让…

作者头像 李华
网站建设 2026/9/9 13:20:46

中国地形数据DEM处理:从选型下载到坐标系与预处理

简介:面向GIS与遥感学习者及规划分析人员的一份中国地形栅格数据,压缩包解压后即可在ArcGIS中加载使用。包体内共5个文件,主文件为TIFF格式地形栅格,配套OVR金字塔可加快缩放显示,TFW世界文件用于地理配准,…

作者头像 李华
网站建设 2026/9/9 13:19:53

unity--webgl 访问本地index.html

目录 1:使用本地服务器 1.1 VSCode Live Server(最推荐,Cocos/Unity 通用) 1.2 使用 Python 的 SimpleHTTPServer 1.3 使用 Node.js 的 http-server 2:让其他人通过 IP 地址来访问你的 Unity WebGL 项目 2.1: 确保服务器可…

作者头像 李华