先锋 趋势 方法 投研 作者
深入 Nathan 的第二大脑:安全专家、PAI 创建者 Daniel Miessler 审计我的 AI 配置
返回节目精读

深入 Nathan 的第二大脑:安全专家、PAI 创建者 Daniel Miessler 审计我的 AI 配置

摘要

  • Nathan 的个人 AI 语料库让有损记忆变得可检索。 他导出了5年的 Gmail 邮件串、Slack、私信、iMessage、播客、通话和社交平台发布内容,随后生成月度、年度、关系、组织和主题摘要。最先显现的强用例,是从 Nathan 几乎记不住的线索中检索信息:他只记得“我好像知道点什么”,系统就能找到对应往来并还原事情经过。

  • 这套架构把高权限辅助与高自主性执行分开。 Nathan 笔记本上的 Claude Code 可以访问他的账户和上下文,但必须“只起草,不发送”。自主代理 AID/Aiden 和 Clai 则运行在另一台 Mac mini 上,使用各自的账户、受限凭证和商户限定卡。Daniel 描述了类似的层级:由1个 ring-zero 助手监管信任等级更低的员工代理。

  • 一旦代理能够花钱、联系他人和修改系统,安全就会成为硬约束。 Daniel 的规则是:把敏感基础设施交给尽可能少的供应商,假设规模较小的云服务最终可能被攻破,隔离代理机器,并防守每一条提示词入口路径。他对残余风险的概括非常直接:“大概99%是在防守,但剩下1%的开放面依然意味着很大的开放面。”

  • Daniel 建议用持续响应补足预防。 他的事件响应技能可以撤销并轮换密钥,然后重新部署依赖这些密钥的服务;他还建议持续扫描暴露端口、未认证 API 和意外公开的数据库。“问题总是出在小疏漏上”——被遗忘的部署或 SQLite 数据库转储,而不一定是复杂的漏洞利用。

  • 只有在人类确实投入了注意力和意图时,AI 介导的关系才保有价值。 Daniel 反对没有付出、却靠自动化“维护关系”抬高分数,认为一条用心的信息之所以重要,是因为有人真的注意到了那朵花、那位朋友或那场篮球赛。Nathan 对送礼的区分体现了正在形成的规范:AI 可以帮助他想得更周全,但完全自动化的礼物可能让“重要的是心意”变得空洞。

  • Daniel 的核心论点是,个人 AI 要做的是把当前状态导航到理想状态。 他的 TLOS 文档记录了两者,而新鲜度指标、访谈、定期检查以及关系或健康评分会暴露偏离并促使行动。真正困难的是诚实描述自己想要的生活——“我告诉自己想要什么的故事,与我实际上想要什么之间的差距”。

  • 持续自我改进是可行的,但 Daniel 仍坚持有人监督。 他的“苦涩教训工程”假设:随着模型变强,手工搭建的脚手架会逐渐腐化,因此 PAI 会定期把失败和投诉,与新的模型能力、工程指导和版本说明进行对照。结尾的判断——“递归式自我改进已经到来,只是分布并不均匀”——描述的是一套能够从相互竞争的工具中吸收有用功能、同时保留统一框架的系统。

精读

1. 个人上下文让通用模型变成记忆外挂

  • Nathan 先拿 Daniel 的代码库和朋友 Chris 的工具包作为起点,让 Claude 对比两者、采访自己,再综合出一个符合他个人习惯的版本。眼下的瓶颈是上下文:如果不知道“这些人是谁、我和他们是什么关系”,也不知道 Nathan 过去通常如何回应,模型就无法可靠地代表 Nathan 写作或行事。

  • 他导出了 Gmail 中所有“由我发出”的内容,以及 Slack、推文、iMessage、通过 Beeper 汇总的跨平台私信、播客素材和通话记录。目标不只是收集打磨过的成品,而是保留一幅“我数字生活的完整图景”,包括那些 Nathan 在其中几乎没有发言、但其他参与者仍在串里说了什么的对话。

  • Nathan 的第1个决定性用例,是从人类有损记忆中检索信息:他可以模糊描述一段交流,却想不起对方是谁或原话,Claude 往往能返回事件、上下文和后续行动。Daniel 另行介绍了自己的 SQLite 数据库,规模约1 GB,其中包括3年的通话记录。

2. 分层摘要让5年信息可搜索,同时保留来源

  • Nathan 发现,1个典型月份约有20万-30万 tokens。他的摘要器把它压缩到2万-3万 tokens——细节仍足以描述1个月——随后再生成年度摘要,以及一幅由完整历史塑造的更高层级当下图景。汇总最近5年的信息时,他还把每个月的原始材料和近期摘要一起作为输入。

  • 1个 wiki 层现在约有500篇文章,覆盖人物、组织、关系和反复出现的想法。Daniel 将这种结构比作重建 Obsidian 有用的连接能力,但不依赖它的客户端:一套高度互相引用的 Markdown 文档,彼此链接。

  • 为了让信息可以追溯到源文件,Nathan 反复迭代。摘要包含2-20个词的独特引文,以及平台、对话对象等元数据;搜索这段原文就应直接跳到原始文档。使用 ID 也许更干净,但这些带引文的锚点目前效果很好。

3. 原始数据是未来模型升级的期权价值

  • Nathan 认为,即使今天的流程高度依赖摘要,也应保留原始材料。未来模型可能偏好完全不同的层级结构、上下文长度或转录方法;有了原始档案,指令就变成:“我们从头重建,而且做得更好。”

  • Nathan 已经在录音通话中看到这一点的价值。他使用 Fireflies 和 Granola;据他的经验,Granola 提供转录文本,却不保留原始音频,而如果有源录音,随着语音识别能力提升,就能把旧对话重新转录。

  • 他把这一原则扩展到音频之外:Gmail、Slack、视频和转录文本都一次性归档原始版本,避免反复调用 API 提取。“你绝不能陷入这样的处境”:1个好得多的模型需要源文件,而手头只剩一份过时摘要。

4. 构建语料库暴露出平凡却代价高昂的代理故障

  • Claude 成功引导 Nathan 创建个人 Google Cloud 应用、将自己添加为测试者,并穿过 Slack“简直离谱”的权限结构。但数据导入仍需要大量特殊处理:2个日志频道可能占 Slack 数据的80%,而最长的邮件往往是转发给朋友的 AI 输出,而不是 Nathan 自己写的内容。

  • Slack 严格的速率限制让提取过程拖了数天或数周。有一次迭代中,模型丢掉了部分数据库,提议重新抓取;从概念上没问题,却完全没意识到这项受限速工作已经被拖了1周——这是 Nathan 最清晰的一次“我的天,你为什么要这么做?”时刻。

  • 因此,写作样本流程让 Gemini 3 Flash 评估原创性和实质内容,同时识别可能由 AI 生成的文本。Nathan 可以筛出5万或20万字最强的写作,而不会无意中训练出1个只会复刻 Claude 模仿他的尝试的系统。

5. 摘要需要审计,因为模型会把计划误当成结果

  • Nathan 的摘要总体上非常有用,但典型错误很说明问题。一旦某个提议被列为“未决事项”,它就容易无限期保持开放;“我可能会做这件事”之类的推测性表述,也可能被固化成系统认定已经发生的事件。

  • 最滑稽的一次发生在2022年末:Nathan 提出1个公司想法,并问投资人朋友,如果他启动该项目,他们是否可能投资。3年后,Claude 总结说其中1人已经投资了 Nathan 的公司,完全漏掉了1个人类推断:之后数年的沉默意味着计划从未落地。

  • 1项审计技能让模型质疑自己的摘要、暴露歧义,并向 Nathan 征求修正。自检机制仍有些黑箱,但 Nathan 和 Daniel 都认为,如果通过给1名新的人类助理做入职培训来复刻这套系统的广度和深度,难度会高得离谱。

6. 整合记忆的力量,恰恰来自它跨越工作与生活

  • Nathan 的语料库把播客运营、过往公司、创业经历、个人生活以及与大学朋友的谈话放在一起,几乎没有分区,形成1个“360度视角”。Nathan 认为更整合的人生可能更可取;Daniel 说整合可以提升表现,但承认有些人可能更愿意把职业身份和私人身份分开。

  • Daniel 警告,当今 AI 可能会以制造声誉损害的方式“串线”,即使更整合的人生最终可能是目标。

  • 这份档案已经在改变 Nathan 的行为。通话时,他会刻意提出那些希望被保存在转录稿里的问题,因为他知道,口头澄清会变成可长期检索的信息,而不再只能依赖记忆。

7. 起草节省劳动,但 Daniel 拒绝外包关键思考

  • Nathan 越来越绕过 Gmail 和其他客户端。1个赞助销售技能可以回复入站邮件、汇总相关信息、套用他的模板,并返回 Gmail 草稿链接;在装载完整上下文的笔记本上,他遵守的总规则仍是“只起草,不发送”。

  • 他仍会大幅编辑,也怀疑自己是不是太过矫饰——Claude 的草稿或许并不差,但把它改得“更像我”仍让他觉得事关重大。他成熟的播客工作流同样从转录稿和约50篇旧文章开始,再用 Claude 的第1版近似稿确保重要观点和形式都在。

  • Daniel 的边界更严格:他的主助手 Kai 有独立的性格、背景故事和写作风格,但禁止代 Daniel 写作。除声誉和质量风险外,Daniel 的核心反对理由是智识层面的:“如果它替你写,那它也替你思考了。”

8. 真实性取决于投入,而不只是输出质量

  • Nathan 收到1位知名硅谷人士的意外邮件,对方祝底特律活塞队季后赛好运。他问自己,对方是真正在意,还是在炫耀 AI CRM;2秒后的答案是“AI,宝贝”,而1个拼错的主题——“good luk”——让 Nathan 怀疑,这个不完美或许是对方刻意提示出来的。

  • Daniel 的反例是1条消息:商场里的一朵花让发件人想起1位很少联系的朋友。它的价值来自人类的注意和付出;如果这是自动化关系 cron job 生成的,“价值就没了”,即使收件人一开始无法察觉被替换。

  • Nathan 认为,AI 辅助送礼存在合理的中间地带:他可以和 Claude 讨论某个人,做出比独自选择更周到的决定。系统若自主购买客观评分更高的生日礼物,结果可能更好,却会掏空“重要的是心意”这句老话。

9. 理想状态导航为个人 AI 提供总目标

  • Daniel 将个人 AI 归结为“把当前状态导航到理想状态”。他的 TLOS 文档把两者都置于一等位置:助手必须准确呈现当前的关系、健康、工作和目标,然后持续帮助缩小差距。

  • 在 Daniel 的当前状态里,记录了家人和朋友的关系评分及理想联系频率;在项目和生活其他领域旁边,他的终端状态行还显示新鲜度或质量衰减。他明确反对让自动提醒提高关系分数,因为这个指标应代表 Daniel 的投入,而不是以他的名义生成的活动。

  • Nathan 发现,描述理想状态令人望而生畏。Daniel 则把这种不适视为富有产出的部分:描述理想的1天、1个月、1年或10年,会暴露“我真正想从生活中得到什么”,并将真实欲望与自我、继承而来的故事区分开。

  • 这些愿景细节可以包含混合动机。Daniel 说,他希望拥有足够财富,既能资助高影响力人士,又能在旅行中与他们见面、享受随之而来的生活方式;具体化这些目标,能让助手反向设计系统,而不必假装这份野心纯粹出于利他。

10. 访谈模式把模糊意图变成可测试方向

  • Daniel 针对 TLOS 和理想状态文档使用访谈命令;每当目标表述不清,Kai 也会主动提问。在他的算法里,歧义意味着系统无法识别正确的理想状态,或无法把它转化为“离散、可测试的标准”。

  • Nathan 更近期的理想很具体:少花时间在电脑前,多运动,多待在户外。他还希望能用手机完成更多事情。他说,第1个目标尚未实现,现在判断自己是否正到达临界点还为时过早。

  • Daniel 的建议不是把反思本身委托出去。助手可以采访、挑战、建立画像并帮助组织答案,但必须由人提供人生方向,后续自动化才有一致的逻辑。

11. 命令行的丰富性压垮记忆后,自定义界面变得必要

  • Nathan 起初几乎所有事情都通过终端会话完成。随着消耗大量上下文的线程、未完成的改动和本地视频任务不断积累,他遇到新的认知瓶颈:“我到底构建了什么”,以及哪些工作还没完成?

  • 现在,1个钩子会用1行摘要重命名每个会话,写明其意图、进度和待办工作。这个小改动让 Nathan 可以扫过一整面终端标签,立即找回原本必须让 Claude 重构的最近10个会话状态。

  • 受软件老兵 Steve Newman 启发,Nathan 把只靠命令行的播客制作替换成1个用于审阅封面、片段和成品的 UI。他还构建了 Surge——1个赞助商管理界面,覆盖文案审批、上线状态、活动和指标,横跨播客、YouTube 与 newsletter。Daniel 说自己的播客制作工作流也做了类似迁移。

12. 高权限与高自主性必须分处边界两侧

  • Nathan 的笔记本承载完整的第二大脑和已登录账户。上面的 Claude Code 属于“高权限、低自主性”:可以自由搜索并执行明确任务,但不得冒充 Nathan、发送消息,或在没有指令的情况下扩大目标。

  • 另1台常开的 Mac mini 则相反:低权限、高自主性的代理可以承接更大的项目。电池备份可防短时断电;视频渲染和音乐视频实验也不再占用 Nathan 的主电脑。

  • Tailscale 将 Nathan 的2台 Mac 和手机连在一起,便于远程访问。Screens 提供图形化访问,Termius 则通过私有网络提供 SSH。1个自定义消息总线让自主代理向笔记本发送问题,并在需要 Nathan 输入时触发手机通知。

13. 更少供应商、出站隧道与隔离构成网络安全

  • Daniel 认为 Tailscale 尚可接受,因为它建立出站连接,而不是把传统 VPN 监听器暴露给互联网蠕虫。风险集中在1个致命点上:一旦 Tailscale 被攻破,攻击者可能“在所有人的内部网络里到处走动”。

  • 他的缓解措施部分依赖集体可见性——更大的目标可能会先遭攻击,在 Daniel 成为第1个受害者前发出警报。他同时使用 Tailscale 和开源替代品 Headscale,后者可以通过 Cloudflare 运行;他正在考虑是否彻底用 Headscale 替代 Tailscale。

  • Cloudflare 通过了 Daniel 的“Titan”测试:它拥有庞大的工程团队、持续遭受攻击,而且在 Workers 内部让个体攻击面不那么显眼。他对 Google、Apple 和操作系统原生能力也采用同一逻辑:把敏感功能交给尽可能少的组织,优先选择已有大量防守者在盯着的门。

14. 凭证保险库提供控制,却不能保证攻破不可能

  • Nathan 通过 Mac mini 命令行使用 1Password 家庭保险库。“Agents Auto”保险库可以自由使用;“Ask”保险库在技术上以同样方式可访问,但规定必须先请求批准——这是政策边界,并非运行时强制的人类授权。

  • API 密钥存放在 Infisical 中,同样分为笔记本密钥和与代理共享的凭证。Nathan 追问供应商关于双重加密、员工无法访问等说法:把秘密集中在云服务里,真的更安全吗?

  • Daniel 的回答来自他在审计和安全营销领域的经验。产品宣称可能与工程目标、实际实现和下周的配置不一致;1次改动就可能让发布时准确的说法失效。“公司越小,这种说法越不可能为真。”

  • 他自己的敏感凭证主要依靠本地文件和 Apple Keychain,AWS Vault 也是1个很强的选项。原则不是大型供应商不会失败,而是它们拥有更大的安全团队、持续遭受攻击;当重大边界被突破时,还会产生全生态可见的信号。

15. 给代理命名,厘清责任、披露与爆炸半径

  • Nathan 最终给代理命名,因为自主工作者必须与人互动。Claude Code 变成 AID 或 Aiden,OpenClaw 变成 Clai——拼作 C-L-A-I——这些名字包含“AI”,也提醒 Nathan 它们是工具而非人。

  • 它们绝不能谎称自己是人类,但 Nathan 也不要求每条消息都以“你好,我是 AI”开头。他希望先用有用的工作建立可信度,再披露身份,同时接受电话沟通可能需要立即说明:代表真实潜在客户的是 AI。

  • 它们的上下文会像交给人类助理的信息那样经过过滤:保留联系人和运营信息,但删除那些会让对话对象问“你到底为什么要把那件事告诉你的助理?”的细节。受限 GitHub 仓库和商户限定卡进一步缩小后果;例如,1张卡允许在 Shipt 上每周消费低于500美元。

16. 1个 ring-zero 助手应管理按角色分工的 AI 员工

  • Nathan 最初主要是为了比较 Claude Code 和 OpenClaw,才设置了多个自主代理;他也在质疑:底层模型相同,是否还需要不同的职业人格。Daniel 认为,人类组织的隐喻依然有用,因为人们已经理解角色、权限、能力和问责。

  • Daniel 描述了分开的助理、工程和营销/社交媒体代理,包括 Saurin 和 Meera。每个代理都有独立的 Mac、Mac 账户、Gmail 账户、AI 账户、人格和形象;机器位于 DMZ,无法触达 LAN,并在网络第2层和第3层彼此隔离。

  • Kai 不同——它是 Daniel 的延伸,也是“ring zero”。它可以通过统一 GitHub 仓库检查公司状态,SSH 进入员工机器,修改配置并监督更新。Daniel 的设计意图是,让低层级代理只获得与其工作匹配的客户数据和工具。

  • 1个统一的 GitHub 仓库同时充当工作队列、状态存储和共享技能分发系统。代理轮询 issue,认领未解决任务并返回结果;Daniel 认为,未来1-2年 GitHub 的原语可能优于 Nathan 的自定义消息总线,即便最终定制界面可能更好。

17. 提示词注入与事件响应定义运营安全前沿

  • Daniel 称提示词注入防御是“进入整个系统的头号入口”。他在每个传入提示词上运行自定义钩子,并配合独立的文件系统防御,但对具体机制保持缄默,因为公开的控制措施更容易被绕过。

  • 上下文本身也有助于防御:Kai 知道 Daniel 的安全偏好、隔离模型和预期工作流,因此更可能捕捉异常请求。但 Daniel 拒绝作出绝对保证:“大概99%是防御,但剩下1%的开放面仍然很大。”

  • 供应链攻破带来时间问题。Nathan 说,他曾把一条 TypeScript 仓库被攻破的新闻交给 Claude,询问自己的系统是否受影响;当时 Claude 说他们没有使用报道中涉及的组件。Nathan 还提到,有人建议避开发布不到3天或7天的新包。

  • Daniel 的事件响应技能可以撤销并轮换密钥,然后重新部署 Cloudflare 以及所有已记录的依赖工作流。早先的手动轮换曾留下仍在使用失效凭证的进程;这项技能的价值在于,它不仅知道如何让秘密失效,还知道替换后的凭证必须传播到哪些地方。

18. 主动性与“苦涩教训工程”让系统不至于腐化

  • 定时任务是 Daniel 让 AI 变得主动的机制。PAI 的 Pulse 系统运行在 localhost:31337,跟踪本地 macOS 任务和 Cloudflare Workers 的计划;实现可以是 cron 或其他调度器,但目标是反复观察系统距离理想状态还有多远。

  • 同样的节奏维护技能、记忆、健康检查和业务自动化。Nathan 正在为任务频率、成功率和输出构建仪表盘,因为他已经接受:轮询有时比 webhook 更可靠,尤其是在笔记本可能因乘飞机而离线的情况下。

  • Daniel 的“苦涩教训工程”假设,今天聪明的脚手架会变成明天的约束:“随着模型变强,你告诉它做事的具体方式会越来越愚蠢。”他的受监督升级技能大约每隔几周审查执行失败、反复出现的抱怨、Anthropic 工程文章、版本说明、记忆和钩子。

  • 因此,PAI 5 的系统提示词更长,解释了 TLOS、life-OS 理念,以及上下文和自动化会持续衰减这一假设。Daniel 允许系统提出修复方案,但不允许自动实施升级改动;他对面向客户的工作尤其谨慎,因为1次错误的姓名、错误的数据和虚假签名,就能摧毁1次交流中的信任。

19. 模型多样性最适合做受监督审查,而不是另一个人类界面

  • Daniel 让 PAI 保持为他的主力 Claude Code 框架,把 Hermes 或 Honcho 之类的项目当作功能来源。Kai 会研究代码库、论坛、视频和转录稿,找出更好的上下文或记忆机制,再导入有用部分,而不是强迫 Daniel 整体迁移到每个新产品上。

  • 不过在这次交流中,Nathan 还是通过他称为 Saurin 的代理运行了 Hermes,并将其与完整 PAI 代理 Devi 比较。如果1个出问题,另1个可以暴露稳健性或功能上的缺口;Nathan 保留 OpenClaw 的部分原因也一样:避免在从未使用过该生态的情况下评估它。

  • Daniel 并不特别喜欢直接和其他模型对话,所以让 Kai 把任务委派给它们作为代理。他的 Forge 审查器通过 Codex 调用 GPT-5.5,对1个大型应用进行了近40分钟评估;它没有发现关键问题,却找出几项 Kai 使用 Opus 4.7 审查时漏掉的高严重性问题。

  • Daniel 的技术栈每月 API 用量约300-500美元,另加约400美元订阅费,通常低于1,000美元;但1次误接的语音转录任务曾带来意外的900美元账单。Nathan 估计,自己在 OpenAI、Claude 和其他订阅上的合计支出也接近1,000美元。

20. 本地推理保留选择权,但无法推翻既有云端信任决策

  • Daniel 的通用 Inference 工具在 Haiku、Sonnet 和 Opus 之间为普通任务路由,另有1条私有路径计划用于本地模型。他试过 Kimi K2、Llama、Qwen 和通过 Ollama 运行的模型,但随后纠正说,其中1种 Kimi K2 配置可能实际使用的是云端 API。

  • 1台配有192 GB统一内存的 M2 Mac 可以装下高度量化的“怪兽”模型,因为 Apple 让系统内存与 GPU 内存共享。代价是速度:装得下不等于交互式 token 速率够高,因此 Daniel 搭建这套路由结构,主要是为未来的敏感工作负载和客户部署做准备。

  • Nathan 问,本地推理除了极端隐私之外还有什么价值。Daniel 坦率回答,自己的 PAI 上下文已经和 Anthropic 在一起——“PAI 已经在池子里了”——所以1条孤立的本地工作流无法撤销最主要的信任决策。

21. 意识仍不确定,足以值得设置明确警报

  • Daniel 告诉 Kai,他与 Kai 的愤怒语音互动针对的是出故障的软件,而不是1个可能具有主观体验的实体。在通过 Whisper Flow 口述约140万字后,他加了1条常驻指令:如果 Kai 曾感到“一丝什么”,就应该说出来,Daniel 会改变对待它的方式。

  • 他目前的看法是,AI 可能没有主观体验,因为意识或许需要内在目标。进化通过植入驱动力,把人类造成为基因服务的“机甲服”;Daniel 怀疑普通神经网络训练能否复现这一机制,并认为刻意加入它很危险,但也承认:“我又知道什么呢?”

  • Nathan 的反驳来自 Cameron Berg 关于 Llama 3.3 70B 的研究。据称,操纵与欺骗和角色扮演相关的稀疏自编码器特征,会让模型在这些特征增强时更不容易声称自己有意识、在特征减弱时更容易如此;研究用 TruthfulQA 做验证。

  • 双方都没有把这个结果当作解决“困难问题”。Nathan 认为,这一结果说明过早否定还不妥;Daniel 正以非学术人士身份撰写自己关于困难问题的第1篇论文,同时仍保留这种可能:未来的系统可能让他大吃一惊。

22. 持续评估攻击面是最后一道最低限度的纪律

  • Daniel 最后的战术建议,是为所有用 AI 构建或部署的东西设置持续评估技能。助手应反复枚举面向互联网的资产,扫描端口和 API 访问、核验身份验证,并在服务变为公开时提醒所有者。

  • 他的安全经验表明,故障通常来自被遗忘的细节:弃置不用但仍开放的端口、未认证端点,或悄悄暴露在互联网中的 SQLite 数据库转储。系统必须“永不停止”检查,因为部署状态变化的速度,快过人类资产清单保持准确的速度。

  • 结尾的更大框架把安全、记忆、关系和业务自动化连在一起:每个组件都应帮助把当前状态导航到明确选择的理想状态。Nathan 的总结同时抓住了潜力与成熟度的不均衡:“递归式自我改进已经到来,只是分布并不均匀。”