跳到内容

研究方向

实验室研究什么,又能拿出什么。

把持久化 AI 系统拆成四个开放问题。下面每个方向都写明它的问题、今天实际处在哪一步、存在哪一类证据,以及还有什么未解——这样写,是为了让持怀疑态度的读者也能分辨其中的差别。

实测

由具名工具产出的一个数字,并附上它的测量协议。

观察到

在真实使用中看到——内部的或现场的——但还不是一项研究。

假设

一个看似合理、正在检验的机制。它是一条探究方向,而不是对结果的承诺。

研究目标

工作所指的方向。尚未证明任何东西能走到那里,也没有附加任何日期。

四个方向

四个问题,各自的现状如实以告。

已交付软件中的连续性

OBSERVED已观察到 · 正在运行
问题
重启、升级、更换模型之后,智能体还能否找回几个月前的一个决定——连同当初的选择、当时的推理与它背后的记录?
现状
WhiteMagic 已交付的记忆层:记忆存放在本地存储中(LMDB 加 Tantivy 全文检索),会话记录与检查点,融合词法查找与坐标查找的混合召回,以及让旧材料逐渐淡出、却不将其抹除的衰减机制。记忆组织为 16 个星系——15 个认知星系,外加一个单独存放本机遥测证据、默认不参与召回的星系。当前标签:v9.2.1。
证据
实测——当前标签的 CI:4,777 项测试通过、2 项忽略、零失败。观察到——在一个会话里存入的决定,能在另一个会话里连同它的理由与来源一起被找回;这就是 主页展示的两会话模式,已进入日常内部使用。尚无纵向研究发表。
未解问题
以年为尺度的保真:哪些记忆应当淡出、两份彼此冲突的记录如何裁定,以及随着档案增长,召回要付出多少成本。
代码与入口
MIT 许可的 Rust 工作区;无需账户,也不依赖任何托管服务。

设置指南产品概览发布产物源代码

受治理的能动性

EXPERIMENTAL方向 · 一级已上线,强制环节受限
问题
自治智能体如何一边持续工作,一边保持可观察、可归因、可解释——并且在真有那个必要时,能够被约束?
现状
设计是一道分级阶梯:观察、通知、轻推、限流,阶梯顶端是经人确认的隔离。观察与归因是今天已经建成的部分;干预的各档在证据足以支撑之前,不会进入默认路径。设计意图是相称——回应与系统实际做过的事相匹配。
证据
假设——把强制环节放在调度接缝,比把策略写进提示词更可靠。观察到——在已交付的二进制里,工具调用可以对照本地的只追加记录完成归因。目前还没有任何 公开结果表明这道阶梯在真实环境中减少了伤害。
未解问题
阻断档位要越过怎样的实测误报率门槛,才能在默认配置下启用;限流的权限由谁掌握;受治理的一方无法查看某项决定时,如何对它提出异议。
代码与入口
治理原语随二进制一同交付;更上层的自动干预仍是研究方向,不是一项功能。

围绕这条方向合作背后的准则

多智能体连续性

PROPOSED已有管线 · 尚无证据
问题
当工作在智能体之间流转——或者在同一智能体的两份副本之间流转——谁的记忆具有权威性,一次交接又能保住什么?
现状
一套选择加入的网格传输:消息带签名、对等端权限受限,并配有隔离机制;另有一套归因模型,把一条记忆绑定到某个智能体、某次委派与某个任务,而不是绑定到碰巧写入它的那个进程。这个方向指向的是受治理的群体记忆:一个智能体团队共享的记忆,其中每条记录都带有作者、委派与撤销状态,交接可以用签名的凭证由第三方核验。
证据
承载交接证据的凭证格式已经公开——continuity-receipt,配有独立验证器与一致性测试向量——但还没有任何多智能体结果基于它发布。协议与内部管线并不等于结果;在情况改变之前,这张卡片会一直这样写。
未解问题
跨越不同模型与主机依然成立的同一身份;两个智能体对同一事件的记忆彼此不同时如何裁定;副本分叉之后再度相遇会发生什么;谁有权在何种委派下写入共享记忆,撤销又如何传播到其他节点。
代码与入口
仅在显式的实验开关之后才可触及;默认关闭。

凭证格式背后的准则

评估方法

PROPOSED研究方向 · 未承诺评测基架
问题
长期连续性应当如何度量,才能让任何系统——包括本实验室自己的系统——都可能被证明失败,也让一位严谨的陌生人可以复现结果?
现状
一套仍在设计中的方法,而不是产品:精确召回、记忆取代、弃权、隐私隔离、崩溃恢复与上下文成本等维度;评测材料分成两半——保持私密的自然情境,以及可以共享、可以重跑的合成孪生。
证据
研究目标——等真有数字的时候,这张卡片就是它们该待的地方。今天没有评测基架、没有排行榜, 也没有可发布的结果——而且不承诺任何日期。
未解问题
不暴露任何人隐私数据的基准真值;难以被钻空子的评分方式;在不同硬件上保持含义不变的测量。
代码与入口
仅有设计笔记。

与实验室合作

开放假设

工作笔记,仍然逐条标注。

实验室正在检验、但尚未定论的想法。它们留在研究这一侧,恰恰因为其中没有一条是装上就能兑现的主张。

机器空闲时的维护

假设

把打理安排在安静时段——分级、强化、修剪——能让召回比跳过这些步骤更稳。维护调度器已经交付;召回上的优势属于内部观察,不是已发表的结果。

调用之前的对抗复审

假设

让高风险的调用先经过一遍对立视角的审查,能抓住单次前向推理会漏掉的一类错误。机制藏在一个开关之后;影响有多大,目前未知。

一套稳定的压缩词汇

假设

一组固定的功能类别可以为庞大的档案建立足够好的索引,让单个路由器无需载入全部目录就能服务它。路由已经存在;关于压缩的论证目前仍是设计层面的论证。

比平台更持久的身份

研究目标

能在模型、机器与岁月之间迁移、却不属于其中任何之一的记忆与承诺模式。今天的发布只是一件早期仪器;目标本身仍未被触及。

下一步

运行它、弄坏它,或者一起做。