ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从零到能聊:用你的微信聊天记录训练一个数字分身

从零到能聊:用你的微信聊天记录训练一个数字分身 从零到能聊用你的微信聊天记录训练一个数字分身【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone想让 AI 替自己回微信WeClone 做的事情很直接把你的微信聊天记录当作训练数据微调一个大模型得到一个说话习惯和你很像的数字分身。它面向两类人——想搭微信聊天机器人的开发者以及只是想看看AI 版自己长什么样的普通用户。先想清楚你要解决什么问题几百条未读消息、翻来覆去回答同样的问题这些场景靠手动回复只会越来越累。WeClone 的思路是用 LLaMA-Factory 微调框架项目内置依赖llmtuner0.5.3加载你的聊天记录微调后绑定到微信机器人上。跑通后你的账号在私聊和群聊 时都能自动回复风格来自你本人的历史消息。效果要提前说清楚它很大程度取决于聊天数据的数量和质量。作者自述用了约 2 万条清洗后的数据风格差强人意但偶尔很搞笑——所以先拿小号试水心理预期放平。环境准备与依赖安装一条命令链走完硬件方面项目默认基于 ChatGLM3-6B LoRA 微调7B 规模大约需要 16GB 显存显存不够可以改 QLoRA 或换更小的模型README 里有完整显存估算表。软件方面 Python 3.8 起步推荐 3.10。git clone https://link.gitcode.com/i/1158243436285850380287904d578408 cd WeClone pip install -r requirements.txt跑完之后你会看到llmtuner、itchat-uos、pandas、chromadb、langchain等依赖装好。还差一件事把 ChatGLM3-6B 模型放到仓库根目录的chatglm3-6b路径下settings.json 里model_name_or_path指向这里模型文件较大下载需要点耐心。实操演示先看效果再上线机器人命令行对话1 分钟验证模型能不能聊python src/cli_demo.py启动后终端出现User:提示符直接输入问题。模型会流式输出Assistant:的回答一轮轮累积上下文。两个内置命令值得记住输入clear清掉对话历史并释放显存输入exit退出。微信机器人上线先起 API 服务再扫登录码微信机器人不是单跑一个脚本就完事分两步。先起 API 推理服务默认监听 8000 端口浏览器访问http://localhost:8000/docs能看到接口文档python src/api_service.py # 另开一个终端 python src/wechat_bot/main.py第二个终端启动后会直接在终端打印登录二维码手机扫码即可上线。私聊消息会自动回复群聊里 机器人也会触发。回复逻辑在 src/wechat_bot/handler/text.py上下文默认保留 15 轮机器人还会按标点把长回答拆成多条消息发送模拟真人打字节奏。进阶指引数据、训练与参数聊天记录转训练数据用 PyWxDump 把聊天记录导出成 CSV放进data/csv目录然后运行 make_dataset/csv_to_json.py。脚本会默认过滤手机号、身份证、邮箱和网址make_dataset/blocked_words.json里可以追加你想屏蔽的词命中即整句丢弃。同一人连发多条时有三种处理策略csv_to_json.py用逗号合并、csv_to_json-单句回答.py已废弃只留最长一句、csv_to_json-单句多轮.py把多句放进多轮 history。训练src/train_pt.py 做预训练PT阶段src/train_sft.py 做监督微调SFT训练参数集中在 settings.json。作者实测 SFT 的 loss 降到 3.5 左右即可压得太低容易过拟合。多卡训练用 ds_config.json 配合 deepspeed 启动。常见问题老用户想提醒你的三件事微信账号有封号风险吗有。项目 README 明确建议用小号且该账号必须绑定银行卡才能用 itchat 登录。主号别碰。显存不够 / 训练爆显存怎么办在settings.json里调小per_device_train_batch_size、调大gradient_accumulation_steps或者把模型换成 7B 以下、改用 QLoRA 量化方案显存能省一大截。回复很慢、越聊越占内存cli_demo里定期敲clear清历史推理端settings.json里infer_args的max_length默认只给 50本身就是为了控制长度。聊天记录是隐私导出和存放路径注意权限blocked_words.json该加的词加够。环境已经就位的话现在就可以git clone下来先跑一遍cli_demo看看效果再决定要不要认真喂数据训练一个属于你自己的数字分身。【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表