用你的微信聊天记录微调出数字分身:WeClone 微调教程
2026/9/17 2:01:04 网站建设 项目流程

用你的微信聊天记录微调出数字分身:WeClone 微调教程

【免费下载链接】WeClone🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone

WeClone 是一个用真实微信聊天记录微调大模型的工具:它先把你的聊天日志变成训练数据,用 LoRA 微调 ChatGLM3-6B 学会你的说话口吻,再接回微信机器人,让数字分身自动回消息。全程核心命令不超过五条,下面只讲新手要做的判断和必须避的坑。

🖥️ WeClone 微调需要多少显存

够。默认基座是 chatglm3-6b,走 LoRA 路线只更新部分参数,SFT 阶段实际显存开销约 16GB,16GB 的卡不用折腾。显存更紧张就把 settings.json 里的per_device_train_batch_sizegradient_accumulation_steps调小,再不够改用 QLoRA 量化方案。多卡的话装上 deepspeed,用deepspeed --num_gpus=2 src/train_sft.py分摊训练。

环境按官方推荐来最省事:

git clone https://gitcode.com/GitHub_Trending/we/WeClone conda create -n weclone python=3.10 conda activate weclone cd WeClone && pip install -r requirements.txt

💬 微信聊天记录怎么变成训练数据

先说结论:数据质量决定效果上限,这一步比调参数更重要。

用 PyWxDump 把微信日志导出成 CSV(每个联系人、每个群聊一个文件夹),全部放进仓库的./data/csv目录,然后跑一次预处理:

python make_dataset/csv_to_json.py

脚本会自动剔除手机号、身份证号、邮箱、网址;想再过滤内容,就在 make_dataset/blocked_words.json 里加词,含禁用词的整句会直接丢掉。同一个人连回多句默认合并成一句;想保留成多轮历史对话,改用 make_dataset/ 里的多轮处理脚本。

所有参数都集中在 settings.json:批次大小、学习率、LoRA 秩、训练轮数(默认 3 轮),克隆到本地后只改这个文件,代码不用动。另外要先下载基座权重放到./chatglm3-6b目录,训练和推理都从这里加载。

⚙️ WeClone 微调怎么一条命令跑完

就一条:

python src/train_sft.py

它读取 settings.json 里的全部参数做 SFT 微调,loss 降到 3.5 左右即可,降太多容易过拟合。训完起本地页面验证:

python src/web_demo.py

回复的语气像你,就成了。

📱 WeClone 微信机器人怎么上线,有哪些坑

两个终端各跑一个进程,顺序是 API 服务在前、机器人随后:

python src/api_service.py python src/wechat_bot/main.py

终端会打印登录二维码,微信扫码即可。私聊它或在群里 @ 它就开始回复,对话历史由机器人程序负责维护。

封号风险要单独说清:微信上跑机器人有封号风险,务必用小号,且账号需要绑定银行卡。主号不建议接入。

想让机器人换个角色说话,改 src/template.py 里的默认系统提示词即可,默认值是"请你扮演一名人类,不要说自己是人工智能"。

效果不理想的坑基本都在数据上:数量不够或质量差,模型学不到你的口吻。建议先拿一两个密友的聊天记录把全流程跑通,确认语气对味后,再逐步补充更多人的数据重新训练,这是提升效果最直接的一步。

【免费下载链接】WeClone🚀 One-stop solution for creating your AI twin from chat history 💡 Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询