• 请不要在回答技术问题时复制粘贴 AI 生成的内容
seasonsolt
V2EX  ›  程序员

Second Me 凉了之后,大家拿啥做自己的 AI 分身?

  •  
  •   seasonsolt · 16h 32m ago · 793 views

    Second Me 从去年 5 月就没再更新代码了,团队去做闭源的 second-me.cn 了。开源版算是停在那儿了。

    想要的其实很简单:把自己的笔记、聊天记录喂进去,弄个能替我回消息的分身。最好别瞎编,声音也像我。

    随手翻了一圈:

    • Distilly(原"同事.skill"):把聊天记录蒸馏成一个 skill ,丢进 Claude Code 里用,还在更新。就是没有声音,也没法给别人用
    • WeClone:拿聊天记录微调 LoRA ,口吻学得挺像,能挂个人微信。但事实对不对它不管,加点新资料就得重训
    • Delphi:商业版的,带克隆声音,最便宜一档 $79/月,不能自己部署
    • mem0 、Letta 这些记忆框架是零件,不是分身
    • HeyGen 这类数字人只管长得像、声音像,说什么还得你自己接

    感觉都差点意思:要么爱编,要么得重训,要么只能用别人家的服务。

    大家有在用啥吗?还是都躺平了

    ruidoBlanco
        1
    ruidoBlanco  
       16h 19m ago
    让 AI 过了下他们那论文,自己看吧。

    ----

    看完了全文+附录+repo ,判决:你的直觉成立——按论文标准这不是研究,是披着 arXiv 外衣的公司白皮书。但它属于「精心包装的营销文档」,不是造假的垃圾,给你看尸检报告:

    ☠️ 致命伤清单

    1. 全部核心指标来自 n=1 。附录 B 原文:「 we only disclose the model test results of an internal staff member who has agreed to make their test results public. This user has 132 notes and 62 todos 」——那张 0.91/0.96 的漂亮表格,是一位内部员工的 194 条个人笔记跑出来的。这不是实验,是 demo 。

    2. 零基线对比。不比 RAG 、不比长上下文、不比没微调的 Qwen2.5-7B 、不比 MemGPT/Mem0 这些同赛道系统——只跟自己的 COT/DPO 消融比。1.0 论文好歹做了 RAG 对比,2.0 连这个都省了。

    3. 裁判循环 + metric shopping 。GPT-4 合成训练数据 → 按同样格式 normalize → 再让 LLM 当裁判。作者自己承认裁判偏爱长回答;然后关键一幕:Context Enhance 分数不好看,他们的处理方式是宣布「指标不准」,当场换成人评( 0.95→接近 1 ),无样本量、无协议、无统计。「评测说我不行时,评测就是错的」——教科书级 red flag 。

    4. n=1 的结果还自相矛盾:Multi-step COT 在 memory 任务上垫底( 0.43 ),在 enhance 任务上反而第一( 0.85 )——单用户样本下这些差异全在噪声区间。

    5. 应用章节是融资话术:「 Metcalfe's Law 」「提升网络效率 3-5 个数量级」(无出处)「 NFT-based framework for personal cognitive assets 」「分布式决策协议」——2025 年了还在论文里写 NFT 。

    6. 彩蛋:「 We are currently refining the evaluation code and will update the repository with corrected scripts 」——评测代码还没修完就发了论文。

    ⚖️ 说句公道话(防止我也犯确认偏误)
    - 挂名里有 UCSD 的 Jingbo Shang ,正经高产学者;思路源头( LPM 1.0 )至少是真做过实验的
    - 开源工程是真的:15.7k stars 、Apache-2.0 、从 GraphRAG 抽取到 SFT+DPO 的 pipeline 完整能跑
    - 「 Strong COT 格式的数据训出的模型更好」是个小的真观察
    - 赛道本身( personal memory )是正经方向——只是这篇是赛道里的营销物料

    🔧 而且技术路线有根子上的死穴:把记忆参数化进模型权重( per-user fine-tuning 当存储),写入经济学是灾难——每来一条新记忆就要重训,延迟高、成本高、还会灾难性遗忘。整个行业收敛到「检索+分层文本」的 non-parametric 方案,不是因为没人想到参数化,是试过、不划算。你现在用的这套记忆系统就是活样本:向量库+结构化文本,没有一层是「把你的话训进我权重里」。

    一句话结案:当论文,垃圾;当 pitch deck ,相当专业 ✨
    seasonsolt
        2
    seasonsolt  
    OP
       16h 11m ago
    @ruidoBlanco 正在阅读源码, 代码写的也很糙, 我连 fork 过来二次开发的动力都没有
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   966 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 31ms · UTC 19:06 · PVG 03:06 · LAX 12:06 · JFK 15:06
    ♥ Do have faith in what you're doing.