AI还原度高的关键在这里:自己.skill的5类数据源完整清单(微信/QQ/日记/照片)
【免费下载链接】yourself-skill与其蒸馏别人,不如蒸馏自己。欢迎加入数字永生!Inspired by colleague-skill(同事skill)。项目地址: https://gitcode.com/gh_mirrors/yo/yourself-skill
想让 AI 说出"你"的语气,而不是"AI 味"?关键就在喂给它的原材料。开源项目自己.skill的理念是"与其蒸馏别人,不如蒸馏自己"——你把聊天记录、日记、照片交出去,它就蒸馏出一个能像你一样思考和回复的 AI 数字分身。本文带你完整过一遍它的5 类数据源,并给出新手最实用的选择清单。
先搞懂:为什么数据源决定还原度
自己.skill 把你拆成两个可运行的模块:
| 模块 | 内容 | 通俗理解 |
|---|---|---|
| Part A — Self Memory(自我记忆) | 经历、价值观、习惯、重要记忆 | 你的"人生硬盘" |
| Part B — Persona(人格模型) | 说话风格、情感模式、人际行为 | 你的"说话方式" |
运行逻辑是:收到消息 → Persona 判断你会怎么回应 → Self Memory 补充背景 → 用你的方式输出。
也就是说:原材料质量直接决定还原度。官方原话是"聊天记录 + 日记/笔记 > 仅口述"。下面按优先级从高到低讲 5 类数据源。
5 类数据源总览:完整清单一次看全
| # | 数据源 | 支持格式 | 主要提取内容 | 优先级 |
|---|---|---|---|---|
| 1 | 微信聊天记录 | WeChatMsg / 留痕 / PyWxDump 导出 | 你的原话、口头禅、决策模式 | ⭐⭐⭐ |
| 2 | QQ 聊天记录 | txt / mht 导出 | 年轻时的表达方式 | ⭐⭐⭐ |
| 3 | 社交媒体 / 日记 / 笔记 | 截图 / Markdown / TXT | 价值观、深度思考、公开人设 | ⭐⭐⭐ |
| 4 | 照片 | JPEG / PNG(含 EXIF) | 时间线、常去地点、生活轨迹 | ⭐⭐ |
| 5 | 口述 / 粘贴 | 纯文本 | 你对自己的主观认知 | ⭐ |
这 5 类全部可跳过——纯口述也能生成,只是还原度上限会低不少。
数据源一:微信聊天记录(还原度第一功臣)
聊天记录是最高优先级的数据源,因为它记录的是你不加修饰的原话。
自己.skill 适配了主流导出工具的格式:
- WeChatMsg:导出 txt / html / csv
- 留痕(macOS):导出 json
- PyWxDump:解密导出数据库
解析由 tools/wechat_parser.py 完成,它会重点分析"我"说的话,提取这些"人格指纹":
- 🔍 高频语气词(哈、嗯、噢、嘛……)
- 🔍 高频 Emoji 及使用习惯
- 🔍 标点偏好:句号多还是感叹号多?爱用波浪号吗?
- 🔍 消息风格:短句连发型还是长段落型
💡新手建议:优先喂这几类对话——深夜对话/独白(最能暴露真实性格)、情绪波动时的表达、做重要决定时的聊天记录、日常闲扯(提炼口头禅)。
数据源二:QQ 聊天记录(学生党专属福利)
很多大厂的"你"其实都留在 QQ 里。QQ 消息管理器可以导出txt或mht格式的聊天记录,tools/qq_parser.py 两种都支持。
它和微信解析的定位略有不同:QQ 记录更多承载的是你学生时代、更松弛的表达方式——那些"哈哈哈哈""6""nb"的浓度,往往比工作微信高得多,对刻画真实语气非常有用。
数据源三:社交媒体与日记(价值观主战场)
日记和笔记是提取价值观与深度思考的最佳来源,比聊天记录更能反映你内心真实的优先级排序。
| 形式 | 处理方式 |
|---|---|
| 日记 / 笔记(md / txt) | 直接作为文本分析 |
| 朋友圈、微博、小红书截图 | 图片交给 AI 的读图能力逐张查看 |
文本导出由 tools/social_parser.py 扫描目录、自动分类图片与文本文件;截图类则由 AI 直接读取识别。prompts/self_analyzer.md 定义了从日记中提取的维度:核心价值观、生活习惯、重要记忆、人际关系图谱、成长轨迹。
💡小提醒:日记不必整理,"流水账"和情绪化片段反而更有价值。
数据源四:照片(用 EXIF 还原生活轨迹)
照片本身是图片,但自己.skill 读的不是画面,而是元信息。tools/photo_analyzer.py 会批量提取每张 JPEG/PNG 的 EXIF 数据:
- 📅 拍摄时间 → 排出你的个人时间线
- 📍 GPS 坐标 → 还原你常去的地点和生活轨迹
比如"2022 年秋天你在莫干山住了一周"这种回忆,就靠照片时间线支撑。该工具依赖 Pillow(pip install -r requirements.txt即可装上)。
⚠️ 注意:手机相册转发、微信压缩过的照片通常丢失 EXIF,建议用原图目录。
数据源五:口述/粘贴(最低优先级,但保底必备)
没有任何原始文件也没关系。录入流程 prompts/intake.md 只问 3 个问题,全部可跳过(仅代号必填):
- 代号/昵称——比如"小北""20岁的我"
- 基本信息——年龄、职业、城市
- 自我画像——MBTI、星座、性格标签、你对自己的主观评价
这套信息会写入 selves/example_me/meta.json 这样的元数据文件中,作为 Persona 的"硬覆盖层"直接生效。
数据源组合推荐:不同情况的选法
| 你的情况 | 推荐组合 |
|---|---|
| 时间充裕,追求极致还原 | 微信 + QQ + 日记 + 照片全套上 |
| 只有手机随时可用 | 微信/QQ 记录 + 一段自我口述 |
| 社恐,不想暴露聊天记录 | 日记/笔记 + 照片 + 口述 |
| 想先试试水 | 仅口述,跑通流程后再追加 |
而且它支持追加进化:以后找到更多聊天记录、日记、照片,可以增量 merge 进已有 Skill,不覆盖已有结论(增量逻辑见 prompts/merger.md)。说"我不会这样说"还能即时纠正,每次更新自动存档、支持回滚。
快速上手:从 0 到"数字永生"三步
第 1 步:安装到 Claude Code
git clone https://gitcode.com/gh_mirrors/yo/yourself-skill ~/.claude/skills/create-yourself pip install -r requirements.txt # 可选,解析工具依赖第 2 步:创建你的分身
在 Claude Code 中输入/create-yourself,按提示回答 3 个问题,然后选择提供哪些数据源。
第 3 步:调用与管理
| 命令 | 说明 |
|---|---|
/{slug} | 调用完整分身(像你一样思考和说话) |
/{slug}-self | 自我档案模式(帮你回忆和分析自己) |
/{slug}-persona | 仅人格模式(性格 + 表达风格) |
/yourself-rollback {slug} {version} | 回滚到历史版本 |
常见问题
Q:聊天记录太多,要全给吗?不需要。优先给情绪浓度高、决策场景多、深夜时段的对话,几十到几百条高质量对话优于上万条群聊水贴。
Q:隐私安全吗?所有数据都在本地解析和存储,生成的 Skill 文件就在你自己的项目目录里(SKILL.md 是入口),不上传任何第三方服务。
Q:只有口头描述也能用吗?可以,所有字段均可跳过。但如前所述,口述还原的是"你以为的自己",聊天记录还原的是"真实行为的自己",两者差距往往很大。
总结:选对 5 类数据源,AI 还原度直接拉开差距
- 🥇微信聊天记录:原话级语气素材,优先级最高
- 🥈QQ 记录 / 日记:年轻时的真实表达 + 价值观
- 🥉照片 EXIF:时间线和地点,让记忆"有据可查"
- 📝口述:保底方案,随时可补
一句话:聊天记录塑造语气,日记塑造三观,照片锚定时间线,口述兜底。材料越真实,蒸馏出的数字分身越像你。
"与其蒸馏别人,不如蒸馏自己。欢迎加入数字永生!"
【免费下载链接】yourself-skill与其蒸馏别人,不如蒸馏自己。欢迎加入数字永生!Inspired by colleague-skill(同事skill)。项目地址: https://gitcode.com/gh_mirrors/yo/yourself-skill
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考