微信聊天记录导出 → 喂给 AI 调研报告
子任务二 · 如何导出微信记录并清洗成可喂 AI 的语料,做每客户个性化话术/画像
#一、被下架项目考据(核心结论)
用户记忆基本属实,但"被告下架"命中的是 PyWxDump 和 chatlog,而不是留痕 WeChatMsg。
事件经过:腾讯早在 2025 年 7 月就向 GitHub 投诉,GitHub 未认定侵权;2026 年 1 月腾讯升级为正式 DMCA 投诉,理由是这些工具"未经授权提取并解密微信本地数据库,绕过其专有加密算法、密钥和数据库协议"。GitHub 给开发者两个选择:1 天内删码,或提交反通知申辩。媒体报道波及范围从"30 多个"到"4000+ 个"仓库不等(后者含大量 fork)。多数原作者选择删库自保。
| 项目 | 作者 | 现状 | 曾经 star |
|---|---|---|---|
| PyWxDump | xaoyaoo | 已删库:收律师函后清空全部代码与提交历史 | ~9.7k |
| chatlog | sjzar | 已删库:2025-10-20 收微信合规函,清空代码 | ~9.2k |
| WeChatMsg / 留痕 | LC044 | 仍在线但停更:README 明说不再更新,不支持 4.0 | 41.9k |
留痕没被强制下架,但长期停更、不支持微信 4.0;真正"能打"的现代工具 PyWxDump 和 chatlog 反而被清掉。
#二、导出的技术方案
1. PC 本地数据库解密(主流、成功率最高)
- 微信 3.x:核心库
MSG.db / MicroMsg.db为 SQLCipher 加密。密钥不在磁盘,需从运行中的WeChat.exe进程内存搜出 32 字节 key。安卓老库EnMicroMsg.db密钥 =md5(IMEI + uin)取前 7 位。 - 微信 4.0:换成 SQLCipher4(更强 KDF),schema 大改,旧脚本全失效;仍靠从内存 dump key。chatlog 是少数适配 4.0 的工具。
- 附件解密:语音 SILK/AMR,需 silk-v3-decoder 转码;图片
.dat在 3.x 是简单 XOR,4.0.3 后改 AES 且每用户独立 key。
2. 手机端提取
- 安卓 root:pull
/data/data/com.tencent.mm/下EnMicroMsg.db,IMEI+uin 算 key。 - iOS:非加密 iTunes 备份 → 解析
MM.sqlite。门槛高、成功率不稳。
结论:To B 落地首选 PC 内存取 key + SQLCipher 解密,能拿全量历史。
#三、现存可用替代项目清单(已核实)
| 项目 | GitHub | star | 4.0 支持 | 活跃度 | 说明 |
|---|---|---|---|---|---|
| WeChatMsg(留痕) | LC044/WeChatMsg |
41.9k | 否 | 停更 | 导出 HTML/Word/CSV/Excel + 年度报告 |
| chatlog | sjzar/chatlog |
9.2k | 是 | 原库已删 | 最新:TUI+HTTP API+MCP Server,找 fork |
| PyWxDump | xaoyaoo/PyWxDump |
9.7k | 全版本 | 原库已删 | 取 key/解密/导出供 AI 训练,找 fork |
| WeClone | xming521/WeClone |
18.1k | 依赖上游 | 活跃 | 聊天记录→LoRA 微调"数字分身"+声音克隆 |
| wechat-decrypt | ylytdeng/wechat-decrypt |
小 | 4.0 专攻 | 新 | 内存抽 key 解 SQLCipher4,含实时监听 |
| echotrace | ycccccccy/echotrace |
小 | — | 新 | 本地导出+分析+年度报告 |
| WechatExplorer | Wxw-Gu/WechatExplorer |
小 | Mac | 新 | 一键导出 Mac 微信+群聊总结 |
实操建议:原库虽删,fork 大量存活(wo1261931780/fork-PyWxDump、OverTM/LC044.WeChatMsg、WechatRagAgent/chatlog-new 等)。生产优先盯 chatlog 的 fork(支持 4.0 + 自带 HTTP/MCP 接口,最适合工程化对接)。
#四、聊天记录 → 喂 AI 的 Pipeline
1. 导出与结构化:用 chatlog(fork) 起 HTTP API 或 PyWxDump 导出,落统一 schema {contact_id, contact_name, sender(me/other), timestamp, msg_type, content};按联系人切分,每客户一条独立时间线——正是"每客户单独画像"的数据单元。
2. 清洗:剔除撤回/系统提示/表情占位;语音转文字,图片走 OCR/多模态;角色标注 me/other 保留时序;脱敏手机号地址支付信息(To B 合规红线)。
3A. RAG 路线(推荐做话术/画像,轻、可解释)
- 每客户对话按时间窗切 chunk → 向量化入库(pgvector / Supabase)。
- 跑"客户画像 prompt":输入该客户全量对话 → 输出结构化画像(需求/预算/顾虑/性格/决策阶段/称呼习惯)存表。
- 生成话术:画像 + 最近 N 轮 RAG 检索 → 专属开场白/跟进话术。不需训练,改 prompt 即迭代,最适合 SaaS 多租户。
3B. 微调路线(做"数字分身",重)
- 参考 WeClone(18.1k、活跃):
(客户消息 → 商家回复)组 QA 对,LoRA 微调让 AI 学"商家说话风格"。适合固化商家人设;每客户单独微调不现实,个性化仍放 RAG/prompt 层。
架构建议:微调固化"商家口吻"(可选)+ RAG/画像 prompt 承载"每客户个性化" 是性价比最高组合。导出层直接复用 chatlog 的 API,不要自己啃 SQLCipher4。
#五、合规提醒(务必)
腾讯批量 DMCA 说明该方向法律风险高。做 To B 须确保:数据是商家自有记录、本地解密不上传原始 db、明确授权、脱敏;不要在产品里内置/分发解密 key 提取代码,避免踩腾讯"绕过技术保护措施"的投诉点。
来源:腾讯 DMCA 下架事件(知乎/博客园)· LC044/WeChatMsg · sjzar/chatlog · xaoyaoo/PyWxDump · xming521/WeClone · ylytdeng/wechat-decrypt · ycccccccy/echotrace
#终审与落地方案(调研3)
#终审报告 · 12-agent 深挖结论 + 落地方案
在「调研1/2」基础上,派了 12 个 agent(两方向各 5 搜索 + 1 Sonnet 审核)二次深挖 GitHub,本文件是终审 + 落地决策。关键约束:用户是 macOS,且为个人自用 demo(自己的微信、本地跑、不商业化)。
#一、方向A:记录导出 → 按客户分区 → 喂 AI
#结论
上一轮说的 PyWxDump / chatlog 原库确实已被腾讯 DMCA 删库,但有活的继任者。且很多 fork 是 AI 生成占位仓库 / 刷 star 假仓(已剔除)。
#可落地项目清单(按对 Mac 自用 demo 的优先级)
| 项目 | star | Mac/4.0 | 用途 | 落地定位 |
|---|---|---|---|---|
| Wxw-Gu/WechatExplorer | 131 | 实测 macOS 4.1.8 ✓ | Electron 桌面应用,一键导出+群聊总结+本地 HTTP API | Mac 首选数据抓取层 |
| teest114514/chatlog_alpha | 1.1k | 实测 4.1.11 ✓ | chatlog 活继任:语义检索+时间知识图谱+HTTP/MCP | 数据引擎(Win 更成熟,Mac 需实测) |
| runzhliu/welink | 210 | 需实测 | 联系人画像卡+FTS5/向量 RAG+话术生成 | 最贴合"按客户分区喂AI",可直接参考其画像/话术设计 |
| xming521/WeClone | 18.1k | 靠桥接 | 聊天记录 LoRA 微调"数字分身" | 想固化"你本人口吻"时的进阶路线 |
| memodb-io/memobase · mem0ai/mem0 | 2.8k · 数万 | 通用 | per-user 长期画像 / 每客户独立向量记忆库 | 画像/记忆层,套在导出工具之上 |
剔除(存疑/造假):wo1261931780/fork-PyWxDump(疑 AI 占位仓)、hicccc77/WeFlow(13k star 仅 12 commit,疑刷量)、ylytdeng/wechat-decrypt & 0xlane/wechat-dump-rs(已被 GitHub 451 封)。
#推荐落地 pipeline(本项目已实现前 3 段,见 wechat-ai-pipeline/)
① 抓取:Mac 上用 WechatExplorer 导出 → 标准化 JSON
② 按客户切分:group by contact,每客户一条独立时间线
③ 清洗脱敏:去撤回/系统消息/表情占位,合并连续消息,手机号打码
④ 客户画像:每客户全量对话 → LLM → 结构化画像(称呼/预算/家庭/偏好/性格/顾虑/关键节点/意向分)
⑤ RAG/话术:画像 + 检索片段 → 生成个性化开场白(参考 welink 的关心/回忆/调侃/约见四型)
⑥(可选)微调:WeClone 的 LoRA 管线固化本人口吻#二、方向B:模拟真人操作 / 微信自动化
#结论(含 Mac 约束的现实判断)
Sonnet 审核首选 Windows UI 自动化(不碰注入/协议/内存,风险最低、社区最活):
| 路线 | 代表项目 | star | 风险 | 备注 |
|---|---|---|---|---|
| Windows UI 自动化 | cluic/wxauto · Hello-Mr-Crab/pywechat · claw-codes/wx4py | 7.2k·1.7k·677 | 最低 | 支持微信 4.x,Python 几行发消息;但 Windows-only |
| 安卓无障碍 | ven-coder/assists | 934 | 中 | 需绕 8.0.52+ 节点混淆,持续博弈 |
| Appium 群控 | openatx/uiautomator2 + DeviceFarmer/stf | 8.2k·4.5k | 中 | 通用驱动,无微信专用逻辑,需自拼三层 |
| Hook 注入 | WeChatFerry(已归档)· wxhelper(停更) | 6.8k·3.1k | 高 | 都卡 3.x,扛不住 4.0,放弃 |
| 协议层 | wechaty/puppet-xp | 551 | 高 | 锁死 3.9.2~3.9.10,付费 token 续命 |
#对你(Mac)的现实建议
Windows UI 自动化最省事但你 Mac 用不了。Mac 上要落地自动化,两条路:
- 一台安卓真机/云手机 + ven-coder/assists 无障碍(推荐,最像真人、抗风控)。
- Mac 版微信的 Accessibility/AppleScript(能力有限,仅能做简单收发)。
拟人化防风控要点:随机延迟(200ms~3s)、分时段作息、逐字打字、加人/群发限流、避免频繁登录、小号先测一周、只做实时收发、别碰批量解密历史库(那是腾讯 DMCA 重灾区)。
方向B 本次不强行实现——它需要额外安卓设备且非你此次重点。已给清晰路线,作为 demo 第二阶段。
#三、最终落地决策
- 前端:已 1:1 复刻并上线
fde.saveme505.help(第一阶段成果)。 - AI pipeline(本次落地):实现"聊天记录 → 按客户分区 → 清洗 → LLM 画像 → 个性化话术"全链路,见
wechat-ai-pipeline/,用云雾 LLM 真跑通,输出真实画像 JSON。 - 前端对接:新增「AI 落地 · 我的客户」页,读取 pipeline 真实生成的数据展示(证明链路跑通,非写死)。
- 真实数据替换:你在 Mac 上用 WechatExplorer 导出自己的记录,转成 pipeline 的标准输入格式即可替换 demo 数据,全程本地、不上传原始库。
- 自动化(方向B):给出路线,留作第二阶段(需安卓设备)。
合规边界(你的场景完全正当):自己的微信、自己的聊天记录、本地处理、自用 demo、不服务化/不分发。守住这条线即可。
来源:沉淀/FDE/调研2-微信记录导出喂AI.md;沉淀/FDE/调研3-终审与落地方案.md(整理于 2026-08-18)