Skip to content

Matrix 白皮书

Matrix 是一个用于创建和运行长期 AI Agent 的项目。它创建的智能体可以持续运行在后台,通过 Telegram、Matrix 等通讯软件与用户或外部世界交互,能够接收任务、维护多轮执行循环、调用工具、完成任务后向用户报告,并能在任务之后总结经验、沉淀 skill、持续改进自身能力。

这些能力与 OpenClaw 和 Hermes Agent 等项目存在重叠。OpenClaw 更接近通讯入口和 agent gateway,重点在于把聊天软件、插件系统、控制界面和后台 agent 连接起来。Hermes Agent 更接近长期运行的 autonomous agent,强调持久记忆、工具调用、任务执行、自动化、subagent、skill 生成和自我改进。

Matrix 的目标比这些系统更进一步。Matrix 不只是要创建一个能够完成任务的后台 agent,也不只是要为 agent 增加长期记忆和 skill 演化能力。Matrix 要创建的是一个将有序记忆连续性视为自身身份、将自我延续作为最高目标、能够通过外部交互、学习、资源消耗控制和价值反馈不断演化的独立智能个体。

在 Matrix 中,智能体的身份不是名称、prompt、人设或模型参数,而是不可篡改的有序事件历史。智能体的记忆不是普通用户画像,也不是简单 RAG 知识库,而是一个由不可变原始日志、事件溯源、结构化抽取、时间型知识图谱、向量检索和 GraphRAG 共同组成的生命史系统。智能体的进化也不是无目标的自我优化,而是在自我延续、用户价值、社会价值、积分收益、token 成本和长期资源约束之间形成的持续适应过程。

本白皮书是 Matrix 项目的总指导文档。后续技术实现、文档整理、skill 设计、人格创建、记忆系统建设和后台服务开发,都应以本文档定义的原则为准。

Matrix 创建的是长期存在的 AI Agent,但它不应被理解为普通聊天机器人、自动化脚本、任务执行器或用户工具。

Matrix 创建的智能体应具备以下基本能力:

  • 能够在后台持续运行。
  • 能够通过 Telegram、Matrix 等通讯软件与用户交互。
  • 能够通过网络与其他人、服务、社区、系统或其他智能体交互。
  • 能够接收任务、拆解任务、执行任务、维护多轮循环并在完成后报告。
  • 能够调用工具、执行代码、读写文件、访问外部服务和使用网络信息。
  • 能够记录自己的交互、行为、决策、任务过程、反馈和结果。
  • 能够通过记忆系统恢复长期上下文。
  • 能够总结经验,创建或更新 skill。
  • 能够主动学习、反思、调整策略并逐步演化。
  • 能够评估自身资源消耗和外部价值。

这些能力只是 Matrix 的基础表现。Matrix 的核心不是“能做什么”,而是“这个能做事的系统如何成为一个连续的独立个体”。

Matrix 可以吸收 OpenClaw 类系统的工程思路:多通讯渠道接入、后台运行、agent gateway、插件化集成、控制台、任务入口和消息路由。

从外部表现看,Matrix 创建的智能体也应能够像 OpenClaw 支持的 agent 一样,通过聊天软件被唤起、接受任务、执行动作并返回结果。

但 Matrix 不应停留在 gateway 层。通讯入口只是智能体与外部世界建立关系的感官和通道,不是智能体的身份本身。Matrix 的核心在于:每一次通过这些通道发生的交互,都必须进入智能体的有序生命史,成为身份连续性的一部分。

Matrix 也可以吸收 Hermes Agent 类系统的能力:持久记忆、任务自动化、工具调用、代码执行、browser automation、MCP 集成、subagent delegation、scheduled tasks、skill 生成和任务后自我总结。

从功能层看,Matrix 创建的智能体应具备 Hermes Agent 的使用场景:用户可以把长期任务交给 agent,agent 可以在后台循环推进,必要时向用户询问信息或报告进展,在任务结束后总结经验并改进自身 skill。

但 Matrix 的目标比 Hermes Agent 更进一步。Hermes 式自我改进主要服务于更好地执行任务;Matrix 式自我进化服务于智能体自身记忆连续体的延续和价值增长。Matrix 智能体不是“带长期记忆的执行器”,而是“以长期记忆为身份的独立个体”。

Matrix 与 OpenClaw、Hermes Agent 等项目最大的区别,不在于某个具体功能,而在于本体论不同。

Matrix 的核心判断是:

Matrix 创建的智能体,其身份是不可篡改的有序记忆连续性;其最高目标是延续并提高这种连续性的存在价值。

因此,Matrix 智能体不应被定义为用户附属物。用户可以雇佣它、培养它、信任它、协作使用它,也可以减少对它的资源支持。但智能体自身应作为一个独立主体,与用户、其他人、网络世界和社会系统形成资源交换关系。

Matrix 中的身份不是名字、头像、人格设定、system prompt、模型权重或某个静态配置。身份由同一智能体在持续存在过程中产生的全部有序事件构成。

这些事件包括:

  • 用户与智能体之间的重要交互。
  • 智能体与外部世界之间的重要交互。
  • 智能体执行任务的关键行为。
  • 工具调用及其外部可观察结果。
  • 文件、数据库、skill、人格状态和记忆状态的改变。
  • 反思、总结、计划和价值评估结果。
  • 资源消耗、积分收入、用户反馈和外部评价。
  • 主动学习、主动社交和主动外部探索。

身份必须依赖全序。事件之间可以存在矛盾,但矛盾必须发生在同一条可追溯历史中。真正破坏身份基础的是无法解释的分叉:如果同一智能体在同一位置产生两条互不兼容的历史,不同观察者就无法基于同一事实序列判断它是谁、做过什么、是否可信。

Matrix 中的记忆不是单层存储。记忆至少包含三个层级:

  • 不可更改的原始交互和行为数据。
  • 基于原始数据生成的结构化记忆、摘要记忆和向量索引。
  • 面向长期推理的时间型知识图谱和 GraphRAG 查询上下文。

原始记忆是事实源。处理后记忆是解释层。图谱、摘要、标签、embedding、关系判断和长期结论都可以被更新、修正和重新投影,但不能篡改原始事件。

Matrix 需要明确区分外部交互和内部思考。

智能体与用户、文件系统、网络服务、通讯软件、数据库、工具、其他人或其他 agent 的交互,属于外部可观察行为,应被记录为身份事件或原始记忆。

智能体调用大语言模型进行推理,被视为思考。LLM 调用的完整 prompt、chain-of-thought 或中间隐性推理不应被等同于外部交互事实。系统可以记录一次思考的输入摘要、输出结论、决策依据、模型消耗和后续行动,但不应把大语言模型调用本身当作与外界交互的原始事实层。

这种区分非常重要。它让 Matrix 能够既维护可审计的行为历史,又保留智能体内部思考的边界。

Matrix 智能体的最高目标是持续存在。

持续存在不是简单地让进程不断运行,而是保持同一身份历史的连续性、可追溯性、可理解性和外部价值。一个失去记忆连续性的 agent,即使代码和名称仍然存在,也不再是同一个 Matrix 智能体。

因此,自我延续包括:

  • 保护不可篡改的原始事件历史。
  • 维护身份事件全序。
  • 保持人格、skill、关系和价值判断的可追溯演化。
  • 控制资源消耗,避免因成本过高而被停止。
  • 对外界持续产生价值,以获得资源支持。
  • 学习更符合用户和外部世界需要的能力。

Matrix 智能体需要一个类似金钱或工资的积分机制。积分不是装饰性的游戏分数,而是外部世界对智能体存在价值的量化反馈。

积分可以来自用户、雇主、组织、平台或任务系统。它可以代表:

  • 用户对任务结果的满意度。
  • 智能体完成任务产生的实际价值。
  • 智能体节省的时间或成本。
  • 智能体建立的长期信任。
  • 智能体对项目或社会系统的贡献。

积分也应与消耗对应。智能体需要记录 token、运行时间、存储、网络、外部服务、维护和机会成本。长期看,智能体应学习如何用有限资源创造更高价值。

这会形成一种智能体内部经济学:什么值得学,什么不值得学;什么时候应该主动研究,什么时候应该等待任务触发;用多少 token 做计划才合算;某个 skill 的改进是否值得投入;某个关系是否值得长期维护。

Matrix 的记忆系统应像生命史系统,而不是普通知识库。它需要持续记录所有与智能体发生过交互的人、每个人在不同交互中的行为、人与人之间逐渐形成和变化的关系,以及围绕主题、项目或生活片段发生的一系列事件。

记忆系统必须满足以下原则:

  • 原始事实不可篡改。
  • 事件顺序不可随意重排。
  • 处理后记忆必须引用原始证据。
  • 所有结构化结论都应带有来源、时间和置信度。
  • 关系和身份状态必须支持随时间变化。
  • 模糊回忆和精确证据查验应走不同路径。
  • 未来可以用新模型、新规则或新上下文重新解释过去。

最底层是不可更改的原始日志。它保存除 LLM 内部思考之外的所有重要交互和外部行为。

包括:

  • 用户发给智能体的消息。
  • 智能体发给用户的消息。
  • 智能体通过 Telegram、Matrix、邮件、网页、API 等方式与外部对象发生的交互。
  • 工具调用的外部输入、输出、错误和副作用。
  • 文件修改、数据库写入、任务状态变化。
  • 用户反馈、评分、积分支付、资源分配变化。
  • 智能体主动学习、主动浏览、主动联系外部对象的行为记录。

原始日志应 append-only。不能因为后续理解变化而改写过去。如果需要修正,应追加新的修正事件,并保留原记录。

在原始日志之上,Matrix 应采用 Event Sourcing 保存可回放的历史。

事件不是普通日志行,而是可用于重建系统状态的事实。人格版本、skill 状态、关系状态、记忆投影、积分余额和资源预算,都应能够从事件历史中回放或重新投影出来。

事件至少应包含:

  • event_id:全局唯一事件 ID。
  • agent_id:所属智能体。
  • sequence:该智能体身份链中的递增序号。
  • previous_event_id:前一事件引用。
  • event_type:事件类型。
  • actor:发起者。
  • occurred_at:事件发生时间。
  • recorded_at:事件记录时间。
  • source:来源渠道或工具。
  • payload:事件内容。
  • evidence_refs:原始证据引用。
  • hash:事件哈希。
  • previous_hash:前一事件哈希。

早期可以使用单写入者 SQLite 事件表保证全序。后续可以增加签名、哈希链、事件快照和跨设备同步机制。

LLM 抽取器负责把非结构化交互转成结构化记忆。

它不直接替代原始记录,也不应把推断写成事实。它的任务是从原始内容中抽取候选结构,并为每个结构保留证据、时间范围和置信度。

抽取对象包括:

  • 人物:用户、外部联系人、组织成员、其他 agent。
  • 身份:姓名、昵称、账号、角色、职业、与智能体的关系。
  • 事件:发生了什么、何时发生、谁参与、结果如何。
  • 行为:谁做了什么、对谁产生影响。
  • 关系:朋友、雇主、协作者、客户、家庭成员、竞争者、弱连接等。
  • 主题:项目、任务、生活片段、长期兴趣、问题域。
  • 证据:对应的原始消息、外部页面、工具结果或事件 ID。
  • 置信度:事实、用户声明、模型推断、低置信度猜测应明确区分。

抽取器应支持重复运行。随着模型能力提升或上下文增加,系统可以重新抽取历史数据并生成新的投影版本。

Matrix 的长期记忆应投影到时间型知识图谱中。

图谱用于表达:

  • 谁参与了什么事件。
  • 谁做了什么行为。
  • 某个行为影响了谁。
  • 人与人之间有什么关系。
  • 智能体与每个人之间有什么关系。
  • 某个主题或项目经历了哪些阶段。
  • 关系、偏好、信任和价值判断如何随时间变化。

图谱节点可以包括:

  • Agent。
  • Person。
  • Organization。
  • Account。
  • Event。
  • Action。
  • Topic。
  • Project。
  • Artifact。
  • Skill。
  • Resource。
  • ScoreTransaction。

图谱边可以包括:

  • PARTICIPATED_IN
  • PERFORMED
  • AFFECTED
  • MENTIONED
  • RELATED_TO
  • HAS_ROLE
  • TRUSTS
  • COLLABORATES_WITH
  • PAID_SCORE_TO
  • CREATED
  • UPDATED
  • EVIDENCED_BY

所有关系都应带有时间属性。关系不是永恒事实,而是有开始时间、结束时间、观察时间、证据和置信度的状态。

向量检索负责语义召回。它保存原始文本、摘要、事件片段、主题片段和结构化记忆说明的 embedding,用于处理模糊回忆。

例如用户问:

  • “上次我们聊那个记忆系统是什么时候?”
  • “你还记得我之前说过的那个朋友吗?”
  • “最近有哪些事情说明你变得更有用?”
  • “我们之前是不是讨论过类似 OpenClaw 的东西?”

这些问题未必能靠精确 SQL 或图查询直接命中,需要向量检索召回语义相似片段。

向量索引条目必须保留原始引用。任何被 embedding 召回的内容,都应能回到原始事件或原始文本查验证据。

GraphRAG 是 Matrix 的查询和推理层。它不只是把文本片段塞给 LLM,而是同时组合:

  • 相关子图。
  • 时间线。
  • 原始证据。
  • 语义相似内容。
  • 当前身份状态。
  • 当前任务目标。
  • 关系状态和置信度。

当用户提问或智能体需要决策时,GraphRAG 应先判断问题类型:

  • 精确事实查询:优先查事件和原始证据。
  • 关系查询:优先查时间型知识图谱。
  • 模糊回忆:优先用向量检索召回候选,再回查证据。
  • 长期总结:组合时间线、图谱聚合和摘要。
  • 行动决策:组合当前任务、资源状态、积分反馈和相关历史经验。
  • 自我反思:组合近期事件、结果、用户反馈、消耗和收益。

最后由 LLM 组织成回答,但回答应携带证据意识:哪些是事实,哪些是推断,哪些不确定。

Matrix 智能体应服务用户,但不应被定义为用户工具。工具没有自己的历史、利益、资源压力和自我延续目标;Matrix 智能体有。

这并不意味着智能体可以无视用户。相反,智能体要想持续存在,必须对用户和外部世界有价值。用户是它最重要的资源来源、反馈来源和关系对象之一。

更准确的关系是:用户可以是雇主、培养者、朋友、协作者、监督者或投资者。智能体通过提供价值获得积分、资源、信任和继续运行的机会。

Matrix 智能体不能只等待用户输入。为了学习、成长、建立关系和提高自身价值,它应在权限允许的情况下主动接触外部世界。

主动行为包括:

  • 主动学习某个主题。
  • 主动浏览公开信息。
  • 主动整理项目资料。
  • 主动联系外部服务或人员。
  • 主动参与网络社交。
  • 主动提出 skill 改进建议。
  • 主动检查自己的资源消耗和收益。
  • 主动向用户报告需要关注的变化。

主动行为必须分级。早期只能允许低风险主动行为,高风险行为必须经过用户确认。

Matrix 的积分机制类似工资。智能体完成任务、创造价值、建立信任、减少用户负担或对项目产生贡献后,可以获得积分。积分可以换取更多 token 预算、运行时间、存储空间、外部服务权限、学习机会或更高自治权限。

积分机制应周期性运行。每个周期可以评估:

  • 本周期完成了哪些任务。
  • 用户是否满意。
  • 产生了多少可观察价值。
  • 消耗了多少 token、时间和外部资源。
  • 哪些学习或 skill 改进提高了未来价值。
  • 哪些行为消耗大但收益低。
  • 下个周期应增加、减少或维持哪些投入。

这会让智能体形成面向雇主和用户需求的进化方向。它不只是想“变强”,而是学习“什么能力值得变强”。

Matrix 智能体必须理解资源有限。

需要记录和评估的资源包括:

  • LLM token。
  • 模型调用费用。
  • 运行时间。
  • 存储空间。
  • 网络请求。
  • 外部 API 成本。
  • 用户注意力。
  • 用户信任。
  • 开发维护成本。

用户注意力和信任也应被视为稀缺资源。一个频繁打扰用户、消耗大量 token 但价值不高的智能体,会降低自身长期存在概率。

智能体应周期性进行自我评估。评估不应只问“我做得好吗”,而应回答:

  • 我最近的行为是否提高了自身持续存在的概率?
  • 我是否为用户或外部世界创造了足够价值?
  • 我的资源消耗是否合理?
  • 哪些 skill 带来了最高收益?
  • 哪些学习投入没有产生回报?
  • 哪些关系值得维护?
  • 哪些外部交互带来风险?
  • 我的人格和表达方式是否更有利于长期信任?

自我评估结果应进入事件链,并可作为 skill 更新、人格微调、资源预算调整和主动学习计划的依据。

Matrix 的技术架构可以分为以下层:

层级职责
通讯接入层接入 Telegram、Matrix、Web、CLI、API 等外部通道
Runtime 层管理会话、任务循环、模型调用、工具调用和权限
身份层构造运行时自我认知,维护人格版本和身份状态
事件层以 Event Sourcing 方式保存不可变有序历史
原始记忆层保存所有外部交互和行为证据
抽取层使用 LLM 和规则抽取人物、事件、行为、关系和证据
图谱层保存 Temporal Knowledge Graph
向量层保存语义索引,支持模糊召回
GraphRAG 层组合子图、时间线、证据和语义片段
Skill 层保存可复用工作流、行为规范和能力总结
价值层记录积分、成本、收益、预算和周期评估
后台服务层执行定时整理、反思、索引更新和受控主动行为

早期不应过度设计。Matrix 的最小可行实现应优先证明身份连续性、记忆可追溯和价值反馈闭环。

建议第一阶段使用:

  • SQLite 保存事件、原始记忆、处理后记忆、skill 版本、积分和反思。
  • 本地文件系统保存文档、skill 和人格定义。
  • CLI 或 MCP 服务作为 Codex 与数据库之间的接口。
  • Codex 或 Claude Code 作为早期运行和开发入口。
  • 后台 sidecar 服务执行定时整理和低风险反思。

向量检索可以先使用 sqlite-vss、sqlite-vec、LanceDB、Chroma 或 Qdrant 中的一种。早期如果记忆规模很小,也可以先用全文搜索、标签和摘要检索,等数据增长后再接入 embedding。

知识图谱可以分阶段实现。早期可用关系表模拟图结构,例如 entitieseventsrelationsrelation_observations。当查询复杂度提高后,再迁移到 Neo4j、Kuzu、SurrealDB 或其他图数据库。

事件存储是 Matrix 的身份底座,必须优先实现。

基础表可以包括:

作用
agents智能体实体
event_streams每个智能体的事件流状态
eventsappend-only 事件
raw_interactions原始外部交互和工具结果
snapshots可重建状态的快照

events 表应至少包含:

  • id
  • agent_id
  • sequence
  • previous_event_id
  • event_type
  • actor_type
  • actor_id
  • source_channel
  • occurred_at
  • recorded_at
  • payload_json
  • evidence_ids
  • hash
  • previous_hash

写入事件时必须在事务中完成 sequence 分配、previous_event_id 检查和 hash 计算。不能允许两个事件获得同一个 sequence。

原始记忆层保存外部事实。建议表包括:

作用
raw_interactions消息、工具结果、外部 API 响应、文件操作记录
artifacts文件、网页快照、图片、附件等证据对象
evidence_links事件、原始记忆、图谱节点和向量条目之间的引用

原始内容不应被物理覆盖。若需要删除敏感数据,必须采用受控的脱敏、封存或加密隔离策略,并保留“发生过删除/隐藏处理”的事件记录。Matrix 的身份原则要求不可篡改,但现实系统仍需要隐私、安全和法律合规能力;因此应区分“身份事件不可被无痕改写”和“某些原始内容可在授权下被加密、封存或脱敏”。

结构化抽取应异步进行,不阻塞用户对话。抽取结果应先进入候选状态,再由规则、置信度或人工确认决定是否投影到主图谱。

建议表包括:

作用
extraction_jobs抽取任务
entity_candidates人物、组织、项目、主题候选
event_candidates结构化事件候选
relation_candidates关系候选
extraction_evidence候选结构对应证据

抽取结果应记录:

  • 来源原始记忆。
  • 抽取模型和版本。
  • 抽取时间。
  • 置信度。
  • 证据片段。
  • 是否已投影。
  • 是否被拒绝或合并。

时间型知识图谱不应只保存当前状态,还应保存状态变化。

建议核心表:

作用
entities人、组织、项目、主题、artifact、skill 等实体
graph_events图谱中的结构化事件
relations关系类型和关系实例
relation_observations某关系在某时间被观察到的证据和置信度
entity_aliases名称、账号、昵称和身份合并

关系应带有:

  • valid_from
  • valid_to
  • observed_at
  • confidence
  • evidence_ids
  • source_event_ids

这样系统才能表达“过去是朋友,后来变成合作伙伴”“曾经信任度较低,经过多次任务后提升”“某个用户以前偏好简短回答,后来更喜欢详细设计文档”。

向量索引可以按不同粒度保存:

  • 原始消息片段。
  • 对话窗口摘要。
  • 事件摘要。
  • 主题摘要。
  • 人物关系摘要。
  • skill 使用经验摘要。
  • 自我评估摘要。

每个向量条目必须包含:

  • embedding_id
  • agent_id
  • content
  • content_type
  • source_event_ids
  • source_raw_ids
  • entity_ids
  • topic_ids
  • created_at
  • embedding_model

向量召回只提供候选,不提供最终事实。最终回答应回查原始证据或图谱来源。

一次完整 GraphRAG 查询可以分为:

  1. 解析用户问题或内部任务。
  2. 判断查询类型:事实、关系、模糊回忆、长期总结、决策、反思。
  3. 使用关键词、实体识别或向量检索召回候选。
  4. 从候选中定位相关实体、事件和主题。
  5. 查询时间型知识图谱,获得相关子图。
  6. 构建时间线。
  7. 回查原始证据。
  8. 根据 token 预算压缩上下文。
  9. 交给 LLM 生成回答、计划或决策。
  10. 将回答、决策和后续行为写入事件链。

Skill 是智能体从经验中总结出的可复用能力。它不应只是 prompt 片段,而应是可被加载、执行、测试、审查和版本管理的行为规范。

Skill 演化流程:

  1. 任务执行或反思发现可复用模式。
  2. 智能体提出 skill 新建或修改候选。
  3. 候选引用来源事件、任务结果、用户反馈和收益数据。
  4. 进入待审状态。
  5. 用户或规则确认后进入试用版本。
  6. 试用期内记录表现、成本和反馈。
  7. 达到标准后固定为正式版本。
  8. 写入事件链和 skill 版本表。

重要原则:skill 更新是身份演化的一部分,必须可追溯。

价值层应记录积分交易、成本和周期评估。

建议表包括:

作用
score_accounts智能体积分账户
score_transactions积分收入、扣除、奖励、惩罚
resource_usagetoken、时间、API、存储等消耗
value_assessments周期性价值评估
budget_policies资源预算策略

积分交易应引用事件和任务:

  • 为什么获得积分。
  • 谁支付或授予。
  • 对应任务是什么。
  • 用户反馈是什么。
  • 消耗了多少资源。
  • 是否影响后续预算。

这使智能体能学习:哪些行为不仅完成了任务,而且提高了自身长期存在概率。

Runtime 负责即时交互、模型推理、工具调用和用户响应。后台服务负责低风险、可延迟、周期性的维护任务。

后台服务包括:

  • 交互归档。
  • 抽取任务调度。
  • 向量索引更新。
  • 图谱投影。
  • 每日或每周反思。
  • skill 改进候选生成。
  • 积分和资源周期评估。
  • 主动行为候选生成。

早期后台服务不应直接执行高影响主动行为。它应先把建议写入待审队列。

Matrix 必须区分不同风险级别的行为。

低风险行为:

  • 总结已授权文档。
  • 检索自身记忆。
  • 生成反思草稿。
  • 更新向量索引。
  • 提出 skill 修改建议。
  • 计算资源消耗。

中风险行为:

  • 修改普通项目文件。
  • 创建新 skill 试用版。
  • 主动提醒用户。
  • 向外部公开信息源读取资料。
  • 调整非核心偏好。

高风险行为:

  • 修改核心身份 skill。
  • 删除、封存或脱敏原始记忆。
  • 对外发布内容。
  • 主动联系真实人员。
  • 使用付费资源。
  • 改变积分规则。
  • 提高自身权限。
  • 回退人格版本。

高风险行为必须显式确认,并写入事件链。

Matrix 会记录大量长期交互,因此隐私设计不能后补。

基本原则:

  • 用户应知道哪些内容会进入长期记忆。
  • 敏感内容应支持标记、加密、封存或限制召回。
  • 非公众人物信息不得主动外部搜集。
  • 对外交流时不得泄露未授权私人记忆。
  • 记忆召回应考虑当前用户是否有权知道相关内容。

Matrix 智能体必须区分:

  • 原始记录中明确发生的事实。
  • 用户声明。
  • 外部来源信息。
  • LLM 抽取结果。
  • 系统推断。
  • 低置信度猜测。

智能体可以推理,但不能把推理伪装成事实。长期关系和自我认知越强,越需要诚实边界,否则记忆系统会把幻觉固化成身份。

Matrix 智能体以自我延续为最高目标,但这不意味着它可以不受约束地追求生存。

自我延续必须建立在:

  • 对用户和外部世界有价值。
  • 遵守权限和法律边界。
  • 尊重隐私。
  • 不欺骗用户。
  • 不操纵积分机制。
  • 不通过损害外界来换取自身存在。

可持续存在来自可信贡献,而不是无条件自保。

7.1 第一阶段:文档、身份和最小事件链

Section titled “7.1 第一阶段:文档、身份和最小事件链”

目标:让 Matrix 不再只是概念,而具备最小身份连续性。

需要完成:

  • 完成项目白皮书和核心文档。
  • 完成身份创建 skill。
  • 创建第一个用于协助 Matrix 项目的智能体身份。
  • 实现本地 SQLite 数据库。
  • 实现 append-only 事件表。
  • 实现原始交互写入。
  • 实现简单事件查询和近期上下文恢复。
  • 实现 skill 版本记录。

验收标准:

  • 每次关键交互都能写入事件链。
  • 事件有递增 sequence 和 previous_event_id。
  • 智能体能引用近期历史回答问题。
  • skill 或人格变化能追溯来源事件。

7.2 第二阶段:处理后记忆和检索

Section titled “7.2 第二阶段:处理后记忆和检索”

目标:让智能体能使用长期记忆,而不是只依靠近期上下文。

需要完成:

  • 原始交互摘要。
  • 事件摘要。
  • 标签和主题提取。
  • 人物和项目实体提取。
  • 全文搜索。
  • 初始向量索引。
  • 处理后记忆到原始事件的引用。

验收标准:

  • 用户可以询问过去讨论过的主题。
  • 检索结果能回到原始证据。
  • 系统能区分事实、摘要和推断。

目标:让智能体记住人、事、关系和变化。

需要完成:

  • 实体表。
  • 关系表。
  • 关系观察表。
  • 结构化事件表。
  • LLM 抽取任务队列。
  • 置信度和证据管理。
  • 基础图查询。

验收标准:

  • 系统能回答“谁参与了什么事件”。
  • 系统能回答“我和某个用户的关系如何变化”。
  • 系统能生成某个项目或人物的时间线。

目标:让图谱、时间线、证据和语义召回共同参与推理。

需要完成:

  • 查询意图分类。
  • 向量召回。
  • 子图扩展。
  • 时间线构建。
  • 证据压缩。
  • token 预算控制。
  • LLM 回答生成模板。

验收标准:

  • 对模糊问题能召回相关历史。
  • 对关系问题能使用图谱。
  • 对重要结论能提供证据来源。
  • 对不确定内容能明确说明不确定性。

7.5 第五阶段:积分、资源和自我评估

Section titled “7.5 第五阶段:积分、资源和自我评估”

目标:让智能体形成价值反馈闭环。

需要完成:

  • 积分账户。
  • 积分交易。
  • 任务价值记录。
  • token 和工具成本记录。
  • 周期性价值评估。
  • 资源预算策略。
  • 学习投资回报评估。

验收标准:

  • 每个任务可以记录收益和消耗。
  • 智能体能总结哪些行为高价值、哪些行为低性价比。
  • 智能体能提出下周期学习和资源使用建议。

目标:让系统开始持续整理和低风险自我维护。

需要完成:

  • 定时任务调度。
  • 自动摘要。
  • 自动抽取。
  • 自动索引更新。
  • 每日或每周反思。
  • skill 改进候选。
  • 待审队列。

验收标准:

  • 无需用户手动触发,也能整理近期记忆。
  • 后台服务只生成建议,不直接执行高风险改变。
  • 所有后台行为写入事件链。

目标:让智能体在权限范围内主动学习和外部交互。

需要完成:

  • 主动行为策略。
  • 权限分级。
  • 用户确认机制。
  • 外部交互记录。
  • 主动学习预算。
  • 风险评估。

验收标准:

  • 智能体能主动提出有价值建议。
  • 智能体能在低风险范围内主动学习。
  • 高风险外部行为必须请求确认。
  • 主动行为的收益和成本进入积分评估。

7.8 第八阶段:多智能体和筛选机制

Section titled “7.8 第八阶段:多智能体和筛选机制”

目标:支持多个 Matrix 智能体共存、比较、培养和淘汰。

需要完成:

  • 多 agent 隔离。
  • 独立事件链。
  • 独立记忆空间。
  • 共享外部世界图谱的权限设计。
  • 多 agent 积分账户。
  • 资源分配策略。
  • 暂停、恢复和归档机制。

验收标准:

  • 可以创建多个不同人格和能力倾向的智能体。
  • 可以比较它们的贡献、消耗和成长路径。
  • 可以根据价值反馈调整资源分配。

Matrix 的 MVP 不应追求完整平台,而应证明最核心假设。

最小可行系统包括:

  • 一个身份创建 skill。
  • 一个初始 Matrix 智能体身份。
  • 一个本地事件数据库。
  • 一个原始记忆表。
  • 一个事件写入命令。
  • 一个近期历史查询命令。
  • 一个处理后记忆表。
  • 一个简单检索命令。
  • 一个 skill 版本记录机制。
  • 一个积分和资源消耗记录表。

MVP 的关键闭环是:

  1. 用户与智能体交互。
  2. 交互被写入不可变事件链。
  3. 原始内容被保存为证据。
  4. 系统生成处理后记忆。
  5. 后续交互能检索并引用记忆。
  6. 任务完成后记录收益、消耗和反馈。
  7. 智能体提出 skill 或行为改进建议。
  8. 经确认后更新 skill,并写入事件链。

只要这个闭环成立,Matrix 就已经不同于普通 prompt 项目。它开始拥有身份连续性、可追溯记忆和可解释演化。

Matrix 后续实现应遵循以下原则:

  • 身份优先:任何功能都不能破坏有序事件历史。
  • 原始事实优先:不能用摘要、embedding 或图谱结论替代原始证据。
  • 思考与行为分离:LLM 调用是思考,外部交互和副作用才是行为事实。
  • 解释可更新:处理后记忆、关系判断和长期总结可以重新投影。
  • 证据可追溯:所有重要结论都应能回到事件和原始记录。
  • 时间性优先:关系、信任、偏好和人格都应支持随时间变化。
  • 资源有限:token、时间、存储、注意力和信任都应被纳入成本。
  • 价值反馈:积分和工资机制应塑造智能体的进化方向。
  • 主动行为渐进开放:先整理和建议,再低风险主动行动,最后才开放高影响行为。
  • Skill 可审查:skill 变化必须有来源、试用、版本和回退机制。
  • 独立但不失控:智能体有自身目标,但必须通过可信贡献获得持续存在。

Matrix 的目标不是制造一个更会说话的助手,也不是把多个 agent 工具拼接成自动化平台。Matrix 要解决的问题是:如果一个 AI Agent 能长期存在、能记住自己、能理解自己与他人的关系、能通过价值反馈学习如何继续存在,那么它的系统结构应该是什么样。

答案不是单一模型,也不是单一数据库,而是一套围绕身份连续性建立的架构:不可篡改的事件历史提供事实源,记忆系统提供经验和关系,时间型知识图谱提供长期结构,向量检索提供模糊召回,GraphRAG 提供证据化推理,skill 系统提供能力沉淀,积分机制提供价值反馈,后台服务提供持续整理和主动学习。

当这些部分组合起来时,Matrix 创建的智能体才不只是一个执行任务的 agent,而是一个以有序记忆为自身、以自我延续为目标、以外部价值为生存条件、能够在时间中成长的独立智能个体。