📚 离职知识库

微信聊天记录导出 → 喂给 AI 调研报告

子任务二 · 如何导出微信记录并清洗成可喂 AI 的语料,做每客户个性化话术/画像

#一、被下架项目考据(核心结论)

用户记忆基本属实,但"被告下架"命中的是 PyWxDump 和 chatlog,而不是留痕 WeChatMsg。

事件经过:腾讯早在 2025 年 7 月就向 GitHub 投诉,GitHub 未认定侵权;2026 年 1 月腾讯升级为正式 DMCA 投诉,理由是这些工具"未经授权提取并解密微信本地数据库,绕过其专有加密算法、密钥和数据库协议"。GitHub 给开发者两个选择:1 天内删码,或提交反通知申辩。媒体报道波及范围从"30 多个"到"4000+ 个"仓库不等(后者含大量 fork)。多数原作者选择删库自保。

项目 作者 现状 曾经 star
PyWxDump xaoyaoo 已删库:收律师函后清空全部代码与提交历史 ~9.7k
chatlog sjzar 已删库:2025-10-20 收微信合规函,清空代码 ~9.2k
WeChatMsg / 留痕 LC044 仍在线但停更:README 明说不再更新,不支持 4.0 41.9k

留痕没被强制下架,但长期停更、不支持微信 4.0;真正"能打"的现代工具 PyWxDump 和 chatlog 反而被清掉。

#二、导出的技术方案

1. PC 本地数据库解密(主流、成功率最高)

  • 微信 3.x:核心库 MSG.db / MicroMsg.dbSQLCipher 加密。密钥不在磁盘,需从运行中的 WeChat.exe 进程内存搜出 32 字节 key。安卓老库 EnMicroMsg.db 密钥 = md5(IMEI + uin) 取前 7 位。
  • 微信 4.0:换成 SQLCipher4(更强 KDF),schema 大改,旧脚本全失效;仍靠从内存 dump key。chatlog 是少数适配 4.0 的工具。
  • 附件解密:语音 SILK/AMR,需 silk-v3-decoder 转码;图片 .dat 在 3.x 是简单 XOR4.0.3 后改 AES 且每用户独立 key

2. 手机端提取

  • 安卓 root:pull /data/data/com.tencent.mm/EnMicroMsg.db,IMEI+uin 算 key。
  • iOS:非加密 iTunes 备份 → 解析 MM.sqlite。门槛高、成功率不稳。

结论:To B 落地首选 PC 内存取 key + SQLCipher 解密,能拿全量历史。

#三、现存可用替代项目清单(已核实)

项目 GitHub star 4.0 支持 活跃度 说明
WeChatMsg(留痕) LC044/WeChatMsg 41.9k 停更 导出 HTML/Word/CSV/Excel + 年度报告
chatlog sjzar/chatlog 9.2k 原库已删 最新:TUI+HTTP API+MCP Server,找 fork
PyWxDump xaoyaoo/PyWxDump 9.7k 全版本 原库已删 取 key/解密/导出供 AI 训练,找 fork
WeClone xming521/WeClone 18.1k 依赖上游 活跃 聊天记录→LoRA 微调"数字分身"+声音克隆
wechat-decrypt ylytdeng/wechat-decrypt 4.0 专攻 内存抽 key 解 SQLCipher4,含实时监听
echotrace ycccccccy/echotrace 本地导出+分析+年度报告
WechatExplorer Wxw-Gu/WechatExplorer Mac 一键导出 Mac 微信+群聊总结

实操建议:原库虽删,fork 大量存活wo1261931780/fork-PyWxDumpOverTM/LC044.WeChatMsgWechatRagAgent/chatlog-new 等)。生产优先盯 chatlog 的 fork(支持 4.0 + 自带 HTTP/MCP 接口,最适合工程化对接)。

#四、聊天记录 → 喂 AI 的 Pipeline

1. 导出与结构化:用 chatlog(fork) 起 HTTP API 或 PyWxDump 导出,落统一 schema {contact_id, contact_name, sender(me/other), timestamp, msg_type, content}按联系人切分,每客户一条独立时间线——正是"每客户单独画像"的数据单元。

2. 清洗:剔除撤回/系统提示/表情占位;语音转文字,图片走 OCR/多模态;角色标注 me/other 保留时序;脱敏手机号地址支付信息(To B 合规红线)。

3A. RAG 路线(推荐做话术/画像,轻、可解释)

  • 每客户对话按时间窗切 chunk → 向量化入库(pgvector / Supabase)。
  • 跑"客户画像 prompt":输入该客户全量对话 → 输出结构化画像(需求/预算/顾虑/性格/决策阶段/称呼习惯)存表。
  • 生成话术:画像 + 最近 N 轮 RAG 检索 → 专属开场白/跟进话术。不需训练,改 prompt 即迭代,最适合 SaaS 多租户。

3B. 微调路线(做"数字分身",重)

  • 参考 WeClone(18.1k、活跃):(客户消息 → 商家回复) 组 QA 对,LoRA 微调让 AI 学"商家说话风格"。适合固化商家人设;每客户单独微调不现实,个性化仍放 RAG/prompt 层。

架构建议微调固化"商家口吻"(可选)+ RAG/画像 prompt 承载"每客户个性化" 是性价比最高组合。导出层直接复用 chatlog 的 API,不要自己啃 SQLCipher4。

#五、合规提醒(务必)

腾讯批量 DMCA 说明该方向法律风险高。做 To B 须确保:数据是商家自有记录、本地解密不上传原始 db、明确授权、脱敏;不要在产品里内置/分发解密 key 提取代码,避免踩腾讯"绕过技术保护措施"的投诉点。

来源:腾讯 DMCA 下架事件(知乎/博客园)· LC044/WeChatMsg · sjzar/chatlog · xaoyaoo/PyWxDump · xming521/WeClone · ylytdeng/wechat-decrypt · ycccccccy/echotrace


#终审与落地方案(调研3)

#终审报告 · 12-agent 深挖结论 + 落地方案

在「调研1/2」基础上,派了 12 个 agent(两方向各 5 搜索 + 1 Sonnet 审核)二次深挖 GitHub,本文件是终审 + 落地决策。关键约束:用户是 macOS,且为个人自用 demo(自己的微信、本地跑、不商业化)。

#一、方向A:记录导出 → 按客户分区 → 喂 AI

#结论

上一轮说的 PyWxDump / chatlog 原库确实已被腾讯 DMCA 删库,但有活的继任者。且很多 fork 是 AI 生成占位仓库 / 刷 star 假仓(已剔除)。

#可落地项目清单(按对 Mac 自用 demo 的优先级)

项目 star Mac/4.0 用途 落地定位
Wxw-Gu/WechatExplorer 131 实测 macOS 4.1.8 ✓ Electron 桌面应用,一键导出+群聊总结+本地 HTTP API Mac 首选数据抓取层
teest114514/chatlog_alpha 1.1k 实测 4.1.11 ✓ chatlog 活继任:语义检索+时间知识图谱+HTTP/MCP 数据引擎(Win 更成熟,Mac 需实测)
runzhliu/welink 210 需实测 联系人画像卡+FTS5/向量 RAG+话术生成 最贴合"按客户分区喂AI",可直接参考其画像/话术设计
xming521/WeClone 18.1k 靠桥接 聊天记录 LoRA 微调"数字分身" 想固化"你本人口吻"时的进阶路线
memodb-io/memobase · mem0ai/mem0 2.8k · 数万 通用 per-user 长期画像 / 每客户独立向量记忆库 画像/记忆层,套在导出工具之上

剔除(存疑/造假):wo1261931780/fork-PyWxDump(疑 AI 占位仓)、hicccc77/WeFlow(13k star 仅 12 commit,疑刷量)、ylytdeng/wechat-decrypt & 0xlane/wechat-dump-rs(已被 GitHub 451 封)。

#推荐落地 pipeline(本项目已实现前 3 段,见 wechat-ai-pipeline/

① 抓取:Mac 上用 WechatExplorer 导出 → 标准化 JSON
② 按客户切分:group by contact,每客户一条独立时间线
③ 清洗脱敏:去撤回/系统消息/表情占位,合并连续消息,手机号打码
④ 客户画像:每客户全量对话 → LLM → 结构化画像(称呼/预算/家庭/偏好/性格/顾虑/关键节点/意向分)
⑤ RAG/话术:画像 + 检索片段 → 生成个性化开场白(参考 welink 的关心/回忆/调侃/约见四型)
⑥(可选)微调:WeCloneLoRA 管线固化本人口吻

#二、方向B:模拟真人操作 / 微信自动化

#结论(含 Mac 约束的现实判断)

Sonnet 审核首选 Windows UI 自动化(不碰注入/协议/内存,风险最低、社区最活):

路线 代表项目 star 风险 备注
Windows UI 自动化 cluic/wxauto · Hello-Mr-Crab/pywechat · claw-codes/wx4py 7.2k·1.7k·677 最低 支持微信 4.x,Python 几行发消息;但 Windows-only
安卓无障碍 ven-coder/assists 934 需绕 8.0.52+ 节点混淆,持续博弈
Appium 群控 openatx/uiautomator2 + DeviceFarmer/stf 8.2k·4.5k 通用驱动,无微信专用逻辑,需自拼三层
Hook 注入 WeChatFerry(已归档)· wxhelper(停更) 6.8k·3.1k 都卡 3.x,扛不住 4.0,放弃
协议层 wechaty/puppet-xp 551 锁死 3.9.2~3.9.10,付费 token 续命

#对你(Mac)的现实建议

Windows UI 自动化最省事但你 Mac 用不了。Mac 上要落地自动化,两条路:

  1. 一台安卓真机/云手机 + ven-coder/assists 无障碍(推荐,最像真人、抗风控)。
  2. Mac 版微信的 Accessibility/AppleScript(能力有限,仅能做简单收发)。

拟人化防风控要点:随机延迟(200ms~3s)、分时段作息、逐字打字、加人/群发限流、避免频繁登录、小号先测一周、只做实时收发、别碰批量解密历史库(那是腾讯 DMCA 重灾区)。

方向B 本次不强行实现——它需要额外安卓设备且非你此次重点。已给清晰路线,作为 demo 第二阶段。

#三、最终落地决策

  1. 前端:已 1:1 复刻并上线 fde.saveme505.help(第一阶段成果)。
  2. AI pipeline(本次落地):实现"聊天记录 → 按客户分区 → 清洗 → LLM 画像 → 个性化话术"全链路,见 wechat-ai-pipeline/,用云雾 LLM 真跑通,输出真实画像 JSON。
  3. 前端对接:新增「AI 落地 · 我的客户」页,读取 pipeline 真实生成的数据展示(证明链路跑通,非写死)。
  4. 真实数据替换:你在 Mac 上用 WechatExplorer 导出自己的记录,转成 pipeline 的标准输入格式即可替换 demo 数据,全程本地、不上传原始库。
  5. 自动化(方向B):给出路线,留作第二阶段(需安卓设备)。

合规边界(你的场景完全正当):自己的微信、自己的聊天记录、本地处理、自用 demo、不服务化/不分发。守住这条线即可。

来源:沉淀/FDE/调研2-微信记录导出喂AI.md;沉淀/FDE/调研3-终审与落地方案.md(整理于 2026-08-18)