让 AI 记住偏好,第一次体验通常很直接:不用再说一遍了。但使用时间长了,另一个问题会出现——如果偏好变了,或者它从一开始就理解错了呢?
在我看来,长期记忆把一次对话中的判断,变成了以后许多任务的前提。它减少重复说明,也可能让一个错误被反复使用。
一句话,能代表多长时间?
设想用户说:“这次给客户的文案,写得正式一点。”如果系统把它记成“用户喜欢正式文风”,下一次写给朋友的消息也可能受到影响。
这个例子里的问题,是适用范围被扩大了。一次任务的要求、一个项目的惯例和长期偏好,不能仅仅因为表达相似,就获得同样的有效期。
所以,评价记忆时,我会先问:这条信息从哪里来,适用于什么情况,哪些变化会让它失效?存储和检索解决信息能不能被找到;这些问题决定找到之后该不该相信它。
纠正,也是一种日常操作
Arslan 会从对话中整理记忆,并在任务中检索它们。主代理更新记忆时,会保留被替代的内容,允许恢复;模型提出删除时,要先进入待处理列表;子代理对共享记忆提出的修改,也会交给用户查看。
这些机制让改动有一个可以检查的位置。它们并不能证明记忆一定正确,却能降低发现错误之后的处理难度。
我更在意的是这种处理能否足够轻:用户不应该为了纠正一句错误总结,重新解释整个项目。能看见哪里改了、恢复哪一条,以及之后的任务会怎样使用它,都是值得检验的体验。
留下历史,也会增加负担
保留旧信息有助于理解变化,但旧信息如果重新混进当前判断,也可能制造矛盾。保留多少、如何区分已经过时与仍然有效,本身就是取舍。
Arslan 的记忆图谱可以按生效时间筛选,但它还不是完整的历史回放。已删除的内容和原地修改,不一定留下可还原的记录。这个能力边界需要明确,不能因为界面上能选择时间,就让人以为任何过去的状态都可以恢复。
同样,“删除”也值得追问:如果一个错误已经影响了别的总结,删掉最初那条信息,是否足以消除后续影响?这是进一步评价记忆系统时需要面对的问题,我不会把现有功能当成完整答案。
衡量修正的成本
比起记忆条数,我更想观察三件事:旧信息多久会被发现不再适用,用户要花多少力气修正,以及同样的误解会不会再次出现。
这些问题把第二大脑从“替我多记一点”,推向“让我更容易继续工作”。长期使用的价值,也许就在这里:系统能够积累理解,同时给理解留下被修正的空间。