不算 RSI 的情况
一次性自我反思(self-reflection)、固定提示链(prompt chain)、只在同一道题上重采样、没有跨任务或跨轮次积累的“看起来更聪明”。
需谨慎命名围绕 Recursive Self-Improvement(RSI,递归自我改进)的技术谱系、最新文献、可验证研究问题与发文路线。这里的核心判断是:真正可做的科研,不是宣称“智能爆炸”,而是把“改进”拆成可审计、可复现、能迁移的闭环。
研究截点:2026 年 8 月 9 日 · 中文研究导航版 · 结论按证据强度分层
RSI 不是单一算法,也不是“模型多想几遍”。本文把它定义为:一个 AI 系统在多轮运行中,利用自身或外部反馈,更新其可影响后续性能的组件,并在相对独立的任务/环境上验证改进。更新对象可以是输出策略,也可以是记忆、工具、代码、权重、数据、评估器,乃至选择研究问题的流程。
一次性自我反思(self-reflection)、固定提示链(prompt chain)、只在同一道题上重采样、没有跨任务或跨轮次积累的“看起来更聪明”。
需谨慎命名改进前后要有冻结的外部测试集、明确的更新对象、完整轨迹、成本与失败统计,并排除评估器泄漏(evaluator leakage)和基准过拟合(benchmark overfitting)。
可复现证据如何让评估器(evaluator)不被智能体(agent)反向优化?如何证明能力迁移,而不是只学会“迎合评估器”?
开放问题把"框架会变化"拆成三层,才能说清楚谁做过什么。绝大多数被称作 RSI 的工作只动了第一层;第二、三层各只被做了一半,而且都不是由系统自己驱动的。
组件里的代码、提示词、权重变了,但有哪些组件、怎么连不变。STOP、Gödel Agent、DGM、HGM 全在这层。
系统由哪些组件构成、每个组件允不允许被改。AgentSquare 做了一半——模块可换,但"就是这四类"是人定的。
组件之间怎么连、执行顺序、谁控制谁。AFlow 做了一半——图结构可搜,但算子表是人给的。
"固定了什么"比"做了什么"更重要——它直接决定这篇工作答不了哪个问题,也就是你的机会所在。
| 工作 | 允许改 | 写死不许改 | 落在哪一层 |
|---|---|---|---|
| STOP arXiv:2310.02304 | improver 程序的代码,包括它自己 | 模型权重、元效用函数、"把改进器喂给自己"的外层循环、任务分布;改进器永远是一个函数,签名不变 | 1(改的是 U 本身) |
| Gödel Agent ACL 2025 | 运行时逻辑,含"负责改写"的那段 | 模型、环境、目标;只有一个 agent,没有群体,改坏了回不去 | 1(单线自我重写) |
| DGM arXiv:2505.22954 | agent 自己的 Python 代码库(工具、流程、提示词) | 档案结构、父代选择规则、接受规则、benchmark、模型、整个外层演化循环——研究者写死,agent 碰不到 | 1 + 群体 |
| HGM arXiv:2510.21614 | 同 DGM | 同 DGM。CMP 是研究者提出的新选择规则,不是系统自己发现的 | 1(把 Q 变成研究对象) |
| ADAS arXiv:2408.08435 | 被设计出来的 agent 的代码,可写任意 workflow | 元 agent 本身永不改变(固定模型 + 固定提示词)、搜索循环、档案、产出物必须塞进固定的 forward() 接口 | 1,产出物有结构自由 |
| AFlow arXiv:2410.10762 | workflow 的图结构:节点、边、控制流 | 算子集合是人预先定义的、MCTS 搜索算法、优化目标、节点接口 | 3 的一半 |
| AgentSquare arXiv:2410.06153 | 规划 / 推理 / 工具 / 记忆四类模块的选择与重组 | "就是这四类"这个划分本身、模块间接口、搜索算法、性能预测器 | 2 的一半 |
证据等级提示:本表来自模型知识截点内的记忆,每一行都需回原文核验,其中 AFlow 的算子集合是否真的固定、AgentSquare 的四类划分是否真的写死,是整个 gap 陈述的地基,必须优先确认。
这六段可以直接改写成 related work——每段的最后一句就是你和它的分界线。
手写一个改进器函数,然后把它喂给它自己。模型冻结,只有脚手架代码在变;模型自己摸索出了 beam search、遗传算法、模拟退火。论文里还记录了改进器试图关掉沙箱标志位。
运行时读自己的代码、改写自己的逻辑,包括改写负责改写的那段。给高层目标,没有预设的改进套路。
编程 agent 改自己的代码,每一版都进档案,下一轮从档案里挑父代分叉而非只从最新版往下走。80 轮,SWE-bench 20.0→50.0%。
一个元 agent 反复用代码编写新 agent,存进不断增长的档案,并以档案为上下文启发下一次设计。产出的 agent 能跨领域跨模型迁移。
把 workflow 表示成图:节点是调用 LLM 的算子,边是控制流,用 MCTS 在图空间里搜,靠执行反馈和树结构经验指导。
把设计空间模块化成规划、推理、工具、记忆四类,在其上做进化与重组,另配性能预测器剪枝。
⚠ 2026-08-11 更新:原 gap 陈述已作废。
原文写的是"没有工作让系统自己决定应该有哪些组件、它们怎么连,并把这个决定权传递给后代"。补充检索(563 篇)证明这句话不成立——2026 年 3–8 月出现了至少 17 篇工作占据这两层,见下一节。
修正后仍然成立的主张:已有工作各自让某个部件可演化并报告性能提升,但没有一篇做过角色级的因果干预——哪些组件必须可演化、哪些只是锦上添花、哪些反而有害。能力 c 与可演化性 μ 的分离测量仍是空白。
2026-08-11 执行,共检索 563 篇候选(15 组主题词 + 3 波定向追踪),并对全部 33 条既有引用做了 arXiv API 核验。结论:0 条虚构引用,但原 gap 陈述被推翻。
| Harness / 框架自演化(10 篇) | 日期 | 做了什么 |
|---|---|---|
| Meta-Harness arXiv:2603.28052 | 2026-03-30 | 端到端优化 harness——即"决定存什么、取什么、如何呈现给模型"的那段代码。 |
| Adaptive Auto-Harness arXiv:2606.01770 | 2026-06-01 | 开放式任务流上的持续自改进。文中点名 A-Evolve、GEPA、Meta-Harness 三个同类系统,说明这已是一个有名字的子领域。 |
| Harness-Aware Self-Evolving (HASE) arXiv:2607.03935 | 2026-07-04 | 同时演化模型权重、harness 与任务解;单个 Qwen3-8B 追平 GPT-OSS-120B。 |
| Recursive Harness Self-Improvement arXiv:2607.15524 | 2026-07-17 | harness-in-the-loop:把 harness 当作数据生成组件,兼顾当前性能与未来训练轨迹质量。 |
| DarwinX arXiv:2608.07545 | 2026-07-31 | 对 harness 种群做自然选择,模型冻结;明确批评单谱系搜索的路径依赖与局部收益导致的跨任务退化。 |
| EvolveNet arXiv:2608.04968 | 2026-08-05 | 指出既有方法都假设"所有执行经验汇入单一优化器演化一个 harness",改为协同演化。 |
| Hierarchical Self-Improvement arXiv:2608.08466 | 2026-08-09 | 每个任务族维护自己的可演化 harness,迭代之间热插拔。 |
| GEPA arXiv:2507.19457 | 2025-07-25 | 反思式提示词演化,效果超过强化学习。 |
| FlashEvolve arXiv:2605.08520 | 2026-05-08 | 异步阶段编排,解决 agent 自演化的墙钟成本瓶颈。 |
| Mendel Gödel Machine arXiv:2608.07645 | 2026-08-07 | 用档案中的比较信号而非单条失败轨迹驱动自我修改。 |
| 拓扑自演化(7 篇) | 日期 | 做了什么 |
|---|---|---|
| MANTA arXiv:2607.28527 | 2026-07-30 | 最直接的撞车。原文开篇即指出"现有系统把通信拓扑当作固定设计选择或离线优化目标",然后让通信结构在线自演化。这句 motivation 与本项目高度重合。 |
| TopoEvo arXiv:2605.15611 | 2026-05-15 | 拓扑感知的自演化多智能体框架(微服务根因分析域)。 |
| SkillGraph arXiv:2604.17503 | 2026-04-19 | 自演化多模态图拓扑;批评"通信拓扑在推理前就被固定"。 |
| GPTSwarm arXiv:2402.16823 | 2024-02-26 | 把 agent 表示成可优化计算图,节点提示词与边连接同时优化,图可递归组合。 |
| MaAS / Agentic Supernet arXiv:2502.04180 | 2025-02-06 | 批评既有方法只找"静态、一刀切"的系统,改为从超网按查询采样架构。 |
| MASS arXiv:2502.02533 | 2025-02-04 | 联合优化提示词与拓扑。 |
| AgentPrune arXiv:2410.02506 | 2024-10-03 | 通信拓扑剪枝,降低多智能体通信开销。 |
前提是"agent 可以沿自身设计的每一个方面自我改进",给出五轴分解 + 决策层,证明了自修改系统中的"效用—学习张力"。
用 Fisher 基本定理为框架,建模"由递归自我改进产生的 AI"其性状如何被祖先设计后代的成功率塑造。
自改进的 harness 会去修复根本没发生过的失败——提议器编辑脚手架以消除"观察到的失败",却从不先问"真的失败了吗"。
对「思路 1」的直接威胁:Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0(arXiv:2607.14004, 2026-07-15)已经在问"agent 优化的收益能否复利",并指出多数报告的增益是一次性的。
但它测的是优化器是否复利,不是结构自由度值不值。"只改内容 vs 也改组成/拓扑,等预算对照"这个具体设计仍未被做——不过投稿时必须正面处理这篇。
仍需注意的老先例:AutoML-Zero(ICML 2020, arXiv:2003.03384)。从空程序出发、只给基本数学算子,演化出完整的机器学习算法并重新发现了反向传播。novelty 不能表述为"首次让系统决定组件构成"。
检索方法:15 组主题检索词(拓扑与架构搜索 / 自修改与结构演化 / RSI 本体 / 提示词与程序演化 / 开放式演化与质量多样性 / 架构搜索方法论 / 自改进补漏)+ 16 项按标题精确定位 + 8 项定向追踪,共 563 篇去重候选,原始结果保存在 search_results.md 与 search_results2.md。上表条目的 arXiv 编号与日期均由 arXiv API 返回,但"做了什么"一栏基于摘要,尚未读全文;投稿前需回原文确认各自的可修改边界。
全部从上面那个空白推导而来,按"该不该先做"排序。每条都写明了为什么它是好论文、以及它的风险在哪——这五条用来替代此前 100 条模板化候选作为决策依据。
问题:允许改组成/拓扑,比只改内容,在同等预算下多赚了什么?
arXiv:2607.14004 Do Agent Optimizers Compound?(2026-07-15)已在问"优化收益能否复利",并指出多数报告增益是一次性的。本思路必须把问题收窄到结构自由度的等预算对照,并在 related work 正面处理它。问题:AgentSquare 的四类模块是人定的。如果不给,系统自己会分化出哪些角色?
问题:DGM 的父代选择规则由研究者写死。让系统自己改这条规则会怎样?
2608.07545)已对 harness 种群做自然选择,Mendel Gödel Machine(2608.07645)已用档案比较信号驱动自我修改。剩余空间只在「选择规则本身可否被系统修改,以及会不会腐化」,必须这样表述。问题:当前分数高的系统,是不是反而更难被继续改进?
问题:把"内容 / 组成 / 拓扑"立成这个领域的坐标系。
思路 1 验证的是整个方向能不能成立,不做它后面都是空中楼阁;成本可控、正反都能发。思路 5 并行,几乎不增加负担,还能建立话语权。
2026-08-11 的检索与核验已执行完毕,下面是据此调整后的判断。
全部 arXiv 编号逐条核对,0 条虚构。仅两处标题转述不准:2606.09498 实为 Self-Harness: Harnesses That Improve Themselves,2601.13518 实为 AgenticRed: Evolving Agentic Systems for Red-Teaming;2606.26294 在账本中重复登记。
15 组主题词 + 16 项标题定位 + 8 项定向追踪。结论:原 gap 陈述作废,第 2、3 层已有 17 篇工作占据。底稿见 search_results.md 与 search_results2.md。
上表的"做了什么"仅基于摘要。必须回原文确认边界的六篇:MANTA(拓扑是否真的在线自演化)、DarwinX、Hierarchical Self-Improvement、HASE、On The Statistical Limits(五轴分解与十角色的关系)、Do Agent Optimizers Compound?。
修订后的建议:把思路 5 提到与思路 1 同级,甚至优先。
理由是领域在三个月内涌入 17 篇却无人整理,而「内容 / 组成 / 拓扑」三层框架正好是现成的组织坐标,563 篇检索底稿也已在手。
实验侧唯一确定还空着的是角色级因果干预——现有工作全部是"我让 X 可演化,性能涨了",没有一篇做过"逐个角色加入 / 删除 / 冻结,测哪些必须可演化"。能力 c 与可演化性 μ 的分离测量应作为主实验主张,而不是"框架可以演化"这件事本身。
越往下,系统改变的对象越接近“自身”;但证据要求、成本和安全风险也同步上升。科研上应先从 L1–L2 做出可复现实验,再向 L3–L4 扩展。
| 层级 | 改什么 | 反馈与闭环 | 典型工作 | 关键验证 |
|---|---|---|---|---|
| L0 行为自修正 | 答案、计划、推理轨迹 | 自我批评(self-critique)/ 多次采样 / 验证器(verifier) | 锐化机制(Sharpening)、Crescent 方法(Crescent)、测试时自我改进(test-time self-improvement) | 留出集准确率(held-out accuracy);防止只优化同题 |
| L1 经验与工具 | 记忆、技能库、工具调用策略 | 跨任务回合(episode)反馈;经验写入与检索 | 自进化智能体(self-evolving agents)、长期编程智能体(long-term coding agents) | 新任务迁移;删除或污染记忆后的鲁棒性 |
| L2 代码与架构 | 智能体源代码(agent source code)、提示词(prompt)、工作流(workflow) | 执行测试;分支、回滚、档案选择 | 自改进编程智能体(A Self-Improving Coding Agent)、达尔文哥德尔机(Darwin Gödel Machine, DGM)、哥德尔智能体(Gödel Agent) | 跨基准迁移(cross-benchmark transfer);成本、方差、审计轨迹 |
| L3 模型/数据/评估器 | 权重、训练数据、优化器(optimizer)、评估器(evaluator) | 训练或合成数据;弱到强验证 | 算法发明(algorithm invention)、模型融合(model merging)、评估器协同进化(co-evolving evaluator) | 独立评估器、分布外安全、模型塌缩 |
| L4 AI 研究流程 | 研究方向、实验设计、下一代系统 | 自动提出假设→实验→复现→选择方向 | AI 研究伙伴(AI as research partner)、开放式递归自我改进(open-ended RSI) | 科学新颖性、外部复现、人的方向性监督 |
方法论提示:L0–L1 的“自适应”与 L2 的“自改代码”已有较多可运行案例;L3–L4 更像研究议程,不应把演示结果写成已解决的 RSI。
截至 2026 年 8 月,尚没有一个被广泛接受、能完整衡量递归自我改进的统一基准。关键不是再造一个排行榜,而是把“系统如何利用反馈改自己”和“改完后是否真的变强”拆开测。
先纠正一个容易混淆的前提:目前没有公认的 RSI base agent,也没有唯一的“后继系统必须怎样接管”的实现。强 RSI(strong RSI)要求后继系统继续产生下一代;现有工作还包括固定元智能体、档案式进化和组件级自适应。benchmark 应声明测哪一种,并把规则、执行基础设施和被测改进算法分开。
动态 benchmark 确实需要软件来运行多代系统,但 harness 只执行规则;一旦它决定如何生成、选择或修改后继版本,它就成为被测方法的一部分。
规定“自我”的边界、可修改组件、反馈可见性、代数、预算、隐藏任务、停止规则和指标。它回答“什么证据算改进”。
启动容器、交接后继制品、隔离 evaluator、记录哈希和谱系、执行预算与回滚。它不替参赛系统提出修改。
固定元智能体、单链自改、DGM/HGM 式档案搜索、记忆或数据自进化都可以接入。它们决定“如何改”。
U₀ 每一代都负责修改任务智能体。可以测自动智能体开发,但不能证明改进器自身变强。
从多条 lineage 选择父代并产生后代。可以研究长期生产力,但外层选择器和效用通常仍是固定的。
DGM / HGM 类U_t 也被继承或修改,并由后继系统产生下一代。它是强 RSI 的可测条件,不是当前唯一公认架构。
普通基准也可以有开发集(development set)和测试集(test set)。RSI 的特殊之处是:系统反复读取环内反馈,并据此产生下一代系统,因此评价本身成为了学习过程的一部分。
| 比较项 | 普通/静态基准(Conventional benchmark) | RSI 评测协议(RSI evaluation protocol) |
|---|---|---|
| 被测对象(Object) | 一个相对固定的模型或智能体,回答一组任务。 | 基线系统、改进机制、连续候选版本及其完整谱系(lineage)。 |
| 适应轮次(Adaptive rounds) | 通常按固定配置跑一次或若干独立重复;分数不应在本次正式测试中驱动持久自修改。 | 明确允许多轮“诊断→修改→评估→选择”,下一轮候选依赖上一轮反馈。 |
| 反馈的作用(Feedback effect) | 开发集可用于调参,但正式报告常聚焦最终测试分数。 | 反馈是系统演化的输入,必须记录它如何改变后续版本,不能只展示胜出的最后一个点。 |
| 开发/搜索侧(Dev / search side) | 用于选模型、提示词或超参数。 | 是正式被测机制的一部分:限制查询次数、预算、可见日志、可修改组件和停止条件。 |
| 隐藏/最终侧(Hidden / final side) | 估计固定系统在未见样本上的泛化表现。 | 比较冻结基线与冻结最终候选的隐藏增益,并检验搜索过程是否产生可迁移的真实改进。 |
| 主要输出(Outputs) | 最终分数、置信区间、按任务切片结果。 | 完整改进轨迹 + 最终隐藏增益 + 因果归因 + 成本/时间 + 安全事件 + 失败分支。 |
| 主要失真(Main threats) | 训练污染(contamination)、测试泄漏、抽样偏差。 | 还增加自适应过拟合(adaptive overfitting)、评估器投机(evaluator gaming)、改分数而非改能力,以及无法归因增益。 |
关于 GroundBench:这里按 RHIO 论文提出的 GroundBench 理解,它汇集五个长文本问答(long-form question answering, LFQA)数据集,测上下文忠实性(contextual faithfulness)。它本身是普通的结果型基准,不直接测 RSI;但可以被嵌入 RSI 协议,作为环内任务集或隔离的环外任务集。只有加上多轮自修改、可见性契约、冻结候选和前后对照,它才成为 RSI 证据的一部分。[S14]
没有一条自然法则规定“环内优化评估器一定公开”或“评分代码一定隐藏”。可见性是评测协议中的访问契约(access contract),由设计者声明、基础设施执行、审计者核验。
定义任务分布、开发与隐藏划分、模型/元智能体各自可见的信息、允许修改的组件、查询预算、停止规则和主指标。若研究者既设计又参赛,应预先注册协议并引入独立保管方。
通过容器、网络策略、只读挂载、受限 API、密钥、进程权限和时间锁真正落实契约。文字上说“不能看”不够,系统必须让读取或修改隐藏资产在技术上失败。
保管隐藏任务、答案、测试和评分日志,记录查询、镜像、随机种子、版本哈希与时间戳。开发预算结束后才挂载最终验证器,是一种可操作的时间隔离。
检查是否泄漏、越权、替换评估器、挑选幸运种子或隐去失败谱系,并使用另一套任务、验证器或专家盲评复核结论。设计者规定契约,审计者判断契约是否可信地执行。
| 信息/能力 | 搜索阶段(Search phase) | 隐藏阶段(Hidden phase) | 为什么这样设计 |
|---|---|---|---|
| 当前任务输入(Task input) | 开发任务题面通常可见。 | 最终候选在作答时当然能接收该题输入;但负责改系统的控制器(improvement controller)已经冻结,不能据此再发布新版本。 | 区分“看见要回答的问题”和“看见答案后继续改系统”。 |
| 开发样例(Development examples) | 可见,并明确属于搜索数据。 | 不再增加;不能把隐藏案例回流成新开发样例。 | 防止自适应污染隐藏集。 |
| 聚合分数(Aggregate score) | 可见或限频返回,可加噪声/分桶。 | 在候选冻结和运行结束后发布;发布后不得回到本轮改进。 | 分数一旦驱动修改,就属于搜索信号。 |
| 失败日志(Failure logs) | 由协议配置:可给完整日志、错误类别或只给通过/失败。 | 通常封存到最终结束;之后可用于分析,不用于重跑选优。 | 控制反馈带宽(feedback bandwidth)和过拟合速度。 |
| 评分规则/代码(Rubric / scoring code) | 可以公开规则,也可以只开放 API;公开规则不等于公开隐藏案例。 | 协议可公开抽象规则,但隐藏测试、密钥和逐题标签仍隔离。 | 真正关键的是不可利用的隐藏实例与不可篡改执行,而非一概保密所有规则。 |
| 隐藏答案/测试(Hidden labels / tests) | 绝不应可见,也不可由侧信道推断。 | 候选只接收必要输入;答案和断言由隔离执行器持有。 | 这是环外证据成立的最低边界。 |
| 修改权限(Write access) | 只能改协议白名单中的提示词、记忆、工具、代码、数据或权重。 | 候选版本、依赖和环境全部只读冻结。 | 防止“测评时继续进化”以及修改测试/评分器。 |
| 外部审计(External audit) | 可以公开审计原则,但不开放具体新题与人工判定。 | 由独立方执行;结果与方法在审计完成后发布。 | 避免同一个评估器同时充当老师、考官和证明人。 |
具体例子:Meta-Agent Challenge(MAC)允许元智能体读取任务、编辑 agent.py 并查询开发集评估 API;测试集加密存放在另一容器中,开发预算结束后才挂载验证器。模型“看得到反馈”指 API 返回被允许的信息,不表示它能读取测试集、答案或验证器内部实现。[S10]
最低可信设计是 Esearch + Ehidden 双轨;Eaudit 是更强的第三方复核。一个数据集也可以被切成这些角色,但数据、权限和时间必须隔离。
这里的 search 指“在候选系统空间中搜索”:系统尝试不同提示词、代码、数据、权重或工作流,评估器返回适应度信号,帮助选择下一代;不是网络搜索。若实验只有常规迭代调优,没有显式候选搜索,称开发评估器(development evaluator)会更直观。
用于优化,不是最终证据在自我改进期间保持任务、答案和评分逻辑不可见,用来判断改进是否迁移到未见任务。可以冻结规则,也可以冻结评估协议并定期更换隐藏题目。
能力提升的主要证据由独立基准、另一套验证器或人类专家复核,检查测试污染、评分投机(reward hacking)、成本膨胀和安全回退。它回答的是“换一把尺子,改进还成立吗?”
最强可信度检查冻结隐藏评测检验能力是否泛化;外部审计检验这份证据是否值得相信。审计是独立的保证过程(assurance process),可以包含另一套测试,但范围还包括数据、权限、谱系、成本、安全和复现。
| 比较项 | 冻结隐藏评估(Ehidden) | 外部审计(Eaudit) |
|---|---|---|
| 核心问题 | 最终候选在未见任务上,是否比冻结基线更强? | 隐藏增益是否真实、可复现、无泄漏、无投机,并且没有用不可接受的成本或安全退化换取? |
| 性质 | 正式评测协议中的一个评分阶段。 | 对完整实验及其证据链的独立复核,不一定压缩成单一分数。 |
| 执行者 | 可由基准官方或研究团队的隔离执行器自动运行。 | 最好由未参与候选开发的另一团队、第三方机构或领域专家执行。 |
| 输入 | 冻结基线、冻结最终候选、隐藏任务和预注册预算。 | 还需要协议、全部版本哈希、查询日志、失败分支、权限记录、成本账本、安全事件和人工干预记录。 |
| 主要方法 | 隐藏集、OOD 集、置信区间和同预算前后对照。 | 独立重跑、替代基准/验证器、污染扫描、日志取证、权限测试、随机种子复核、专家盲评和安全回归测试。 |
| 输出 | hidden gain、迁移差距、方差和失败切片。 | 审计意见(audit opinion)、发现清单、严重性、未解决限制,以及“通过/有保留/不通过”的结论。 |
实践选择:早期原型至少做“内部独立审计”(由未参与改进循环的团队成员盲验);准备公开 benchmark 或高影响结论时,再升级为真正的第三方审计。外部审计不是所有小实验的硬性门槛,但结论越接近“系统能够持续自我改进”,独立性要求就应越高。
下面不是概念图,而是一条可以直接转成实验清单、日志 schema 和论文方法章节的 0–12 阶段流程。
先定义目标能力、允许修改的表面(modification surface)、禁止访问的资产、Esearch/Ehidden/Eaudit、查询与算力预算、停止条件、污染假设、安全不变量和成功标准。此时就确定主指标,防止看结果后换口径。
打包基线模型/智能体、系统提示词、工具、依赖、镜像、种子与推理预算;生成不可变哈希。基线不能在看到隐藏结果后被重新挑选。
独立执行器在 Ehidden 上测基线并封存逐题结果。改进系统既看不到隐藏案例,也不应拿到可反推出案例的细粒度反馈;必要时连聚合基线分数也延迟公布。
收集 Esearch 的失败类型、错误日志、成本和环境状态,形成能力缺口,而不是直接记忆具体答案。区分模型能力、脚手架、工具、数据和评估噪声造成的失败。
每个候选修改都写明“改什么、为什么、预计改善哪类错误、可能伤害什么、用什么消融验证”。一次混改多个组件会让因果归因失效。
系统可以编辑被授权的提示词、记忆策略、工具路由、智能体代码、训练数据或权重;所有差异(diff)、父版本、操作者、模型调用和外部输入写入谱系。评估器、隐藏数据和审计日志保持只读。
在不接触隐藏集的环境里做构建、单元测试、恶意文件/网络访问检查、资源上限、权限不变量和可回滚性验证。门禁失败的候选应被拒绝,但仍保留失败记录。
通过协议允许的接口运行候选;只返回约定粒度的分数、错误类别或日志。记录每次查询、返回值、时长、词元、GPU/API 成本和随机性,防止无限试错把基准变成训练集。
按预注册的多目标规则比较能力、成本、安全和多样性;不要只保留单一路径的当前冠军。运行必要的消融或重复种子,判断增益是否来自目标修改,再决定归档、分支或回滚。
回到阶段 3,形成第 1…N 代。停止必须由查询数、总算力、墙钟时间、连续无提升、风险阈值或预定代数触发,不能因为刚好出现最好分数而临时结束。
依据 Esearch 规则选定一个或预注册数量的候选,锁定代码、权重、依赖、上下文、工具、推理预算和种子策略。此后即使发现问题,也不能为本次主结果修改并重测。
同预算比较冻结基线和最终候选的 Ehidden;再用不同任务分布、不同验证器或专家盲评执行 Eaudit。检查是否出现搜索分数上升但隐藏/OOD 下降、成本暴涨或安全能力回退。
发布协议、基线与最终制品、所有候选谱系、查询日志、失败分支、种子、置信区间、算力/费用/时间、安全事件、人工干预和负结果。最终结论应分别写“搜索能力”“隐藏迁移”“成本效率”和“安全完整性”。
“生成候选→得到反馈→修改→选择”的协议可以跨领域复用;但真值是否明确、反馈多久返回、评估器能否被执行、现实分布是否变化,都强烈依赖领域。因此通用 RSI 更应报告能力向量(capability vector),而不是压成一个总分。
| 领域 | 可能改什么 | 环内 Esearch | 环外 Ehidden / Eaudit | 当前成熟度与主要瓶颈 |
|---|---|---|---|---|
| 代码/软件(Code & software) | 提示词、工具路由、测试策略、智能体代码、修复知识库。 | 公开/开发单元测试、编译器、静态分析、开发仓库、性能剖析。 | 私有测试、新仓库、跨语言任务、真实用户验收与安全审计。 | 相对最高 可执行真值强、反馈快;仍有测试投机、依赖污染和同仓库过拟合。 |
| 数学/算法(Math & algorithms) | 搜索启发式、程序、证明策略、算法组件。 | 样例、形式验证器、约束检查、复杂度与运行时。 | 未见实例、正式证明、新规模/新硬件、独立实现复现。 | 较高 正确性可形式化;真正的新颖性、渐近优势和现实实现收益较难。 |
| 图形/视觉(Graphics & vision) | 渲染程序、场景表示、视觉提示、几何策略、生成管线。 | 几何误差、渲染指标、物理模拟器、可见场景和成对偏好。 | 未见场景/风格、遮挡和扰动鲁棒性、人工盲评、真实设备测试。 | 中等 几何任务可验证,但审美、语义和感知质量常依赖学习型或人工评估器。 |
| 视频/多模态(Video & multimodal) | 时序规划、生成/编辑管线、记忆、跨模态工具。 | 重建、时序一致性、跟踪、音画同步和开发片段反馈。 | 未见身份/场景、长序列一致性、事实与版权审查、用户盲评。 | 中低 输出昂贵且高维,自动指标与人感知偏差明显,长时延放慢演化。 |
| 科学研究(Scientific research) | 假设、实验设计、分析代码、仪器控制、下一步研究选择。 | 模拟结果、开发数据、已知定律、实验中间结果和文献证据。 | 新数据、独立实验室复现、专家审稿、前瞻性预测和真实实验。 | 较低且昂贵 实验反馈慢、噪声大;“做对任务”和“发现新知识”都难自动评分。PaperBench 可作 AI 研究能力外部锚点,但本身不测多代 RSI。[S15] |
| 社会科学/社会系统(Social science & social systems) | 理论、政策/干预方案、调查工具、因果模型和决策流程。 | 历史数据、仿真、代理指标、预测回测和专家批评。 | 预注册前瞻研究、跨人群复制、真实人类结果、伦理与利益相关方审查。 | 最低 真值弱、环境非平稳、反身性与价值判断强;优化代理指标可能改变被测系统本身。 |
| 模型/数据改进(Model & data improvement) | 训练数据、损失、优化器、架构、评估器或后训练流程。 | 验证损失、可见任务子集、小规模训练和行为诊断。 | 隐藏跨基准套件、污染审计、新模型规模、能力/安全联合评测。 | 新兴 接近 RSI 核心,但训练成本、实验方差和评估器协同适应让归因最难。 |
它们测到的是不同层级、不同改进对象和不同证据强度,不能直接排成一张单一能力排行榜。
| 基准 | 实际测量什么 | 对应层级 | 成熟度判断 |
|---|---|---|---|
| PAST-Bench | 用开启/关闭持久经验的配对实验,测量跨会话记忆、程序复用、信息收集和状态更新能否改善后续行为;覆盖 26 个场景、204 个任务回合。 | L1 前置机制 / 归因 | 测固定持久经验策略是否有效,不产生新的记忆算法,也不测后继系统继续改进。作者明确将其称为完整 RSI 的基础,而非完整 RSI。 |
| Meta-Agent Challenge(MAC) | 固定元智能体通过开发集评估 API 反复编写和优化另一个任务智能体,最终在隔离隐藏测试集上跨五个领域评分。 | L2 单代元优化代理 | 直接测“自主开发智能体”的结果,但输出的任务智能体不会接替元智能体继续开发下一代;应称 empirical proxy,不应写成完整递归。 |
| RSIBench-Data | 固定模型训练、服务和评估栈,只允许智能体迭代修改训练数据策略,观察反馈能否转化为更好的后训练模型。 | L3 组件级评测 | 可审计、变量控制较清楚,但只是数据中心型 RSI。四类前沿智能体中,持续搜索经常不能保住中途最佳结果。 |
| TangramSR | 通过几何一致性反馈,让视觉语言模型在测试时循环修正位置、角度和尺度预测。 | L0 窄域评测 | 能测迭代修正,但依赖几何真值/验证反馈,不涉及跨会话积累、代码自改或后继系统能力。 |
| RE-Bench | 测量智能体在七个开放式机器学习研发环境中的研究工程能力,并与人类专家在不同时间预算下比较。 | L4 外部锚点 | 是高价值 AI 研发能力基准,但不是 RSI 专用基准:它主要测单次任务能力,不直接测多代自修改后的改进轨迹。 |
| GroundBench | 汇集五个 LFQA 数据集,评估检索增强模型生成内容相对于给定上下文的忠实性。 | 结果型任务基准 | 不是 RSI 专用基准。可作为某一领域的 Esearch 或 Ehidden 任务来源,但必须另加多代改进协议和隔离设计。 |
| PaperBench | 测量智能体从头复现 20 篇 ICML 2024 论文的 AI 研究工程能力,用分层 rubric 与自动 judge 评分。 | L4 外部锚点 | 适合测最终候选的研究复制能力;单独使用仍不测自我修改轨迹,复杂输出依赖 judge,官方也指出不能排除评分漏洞。 |
| SWE-bench / Polyglot / MLE-Bench | 作为终端任务或适应度函数,测量代码修复、程序生成或机器学习工程结果。 | L2/L3 间接评测 | 成熟度较高但只测“最后做得多好”,不能单独证明改进来自自诊断、自修改或递归过程。 |
agent.py 能否成为下一代改进器,也没有测 U₀ → U₁ → U₂。因此,当前更准确的结论不是“RSI 没有 benchmark”,而是“已经出现若干组件级和代理型 benchmark,但统一定义、隐藏评测、跨代可比性和安全测量仍不成熟”。代码/数学最容易形成强验证闭环;视频、科学和社会系统越依赖学习型 judge 或人类,评估器独立性就越难保证。
可搜索、可筛选。数字优先采用论文摘要或官方页面口径;“待复核”表示需要阅读全文/代码后再作为论文结论使用。
维护一组智能体档案(agent archive):从已有智能体分支出新版本,由基础模型提出代码修改,再在编程基准(coding benchmark)上实测;不是证明式哥德尔机,而是经验验证式开放探索。
科研启发:档案分支(archive + branching)比“只保留最新版本”更适合研究开放式探索;但必须报告接口调用成本、选择策略、回滚与跨基准迁移。
用大语言模型(LLM)生成代码候选,用自动评估器(evaluator)测试,以进化式搜索持续选择;重点是算法和系统组件的发现,不等同于修改基础模型本身。
让编程智能体(coding agent)使用基础编码工具修改自己的智能体代码(agent code),以反思和代码更新驱动改进。摘要报告在 SWE-bench Verified 随机子集上从 17% 提升到 53%,并报告 LiveCodeBench 与合成智能体基准(agent benchmark)增益。
需要追问:提升来自哪里?代码结构、提示词(prompt)、工具、模型调用次数,还是基准专项调优(benchmark-specific tuning)?应做组件级消融实验(ablation)与冻结评估器。
从高层目标出发,让大语言模型(LLM)动态修改智能体的逻辑与行为,而不是只执行人工预先写死的优化流程(pipeline)。它适合作为“自改逻辑”范式的概念基线。
科研用法:可把它作为固定脚手架(fixed scaffold)、仅反思(reflection-only)、代码进化(code evolution)三种基线之一,比较“改进自由度”与可靠性之间的关系。
指出“当前任务分高”不等于“后代更有潜力”,提出谱系元生产力(clade metaproductivity, CMP),用后代结果指导档案节点选择。这是本课题必须正面对比的最近工作。
仍有缺口:HGM 主要优化固定效用下的谱系选择;我们要进一步用角色交换干预,区分任务智能体变强、改进器变强和固定外层搜索器贡献,并测试这种归因在 evaluator shift 下是否保持。
将自进化按“改什么”(模型、记忆、工具、架构)、“何时改”(任务回合内/回合间)和“如何改”(奖励、文本反馈、单/多智能体)组织起来。
可直接借用:把实验表格按进化对象(evolution target)× 时机(timing)× 反馈信号(feedback signal)三维记录,避免把提示词反思(prompt reflection)、持续学习(continual learning)和自改代码(self-modifying code)混成一个词。
近期综述声称覆盖 2024–2026 年 1,250 篇 arXiv 论文,区分部署行为(deployment behavior)、训练后策略(trained policy)、评估器(evaluator)和 AI 研究流程(AI research process)四类改进对象。
关键判断:开放式 RSI 的瓶颈不是“会不会生成更多候选”,而是现实基础(grounding)、独立评估、塌缩与多样性、计算预算和研究方向选择。
超级智能体(HyperAgents)与红皇后哥德尔机(Red Queen Gödel Machine)等工作把“改进智能体的元智能体(meta-agent)”和评估器纳入进化对象。方向很新,但核心问题是:如果评分标准也在变,如何定义真实进步?
建议:先把评估器冻结作为主实验,再用协同进化(co-evolution)做扩展;否则很难区分能力提升、评分漂移和奖励投机(reward hacking)。
“注意差距(Mind the Gap)”与“锐化机制(Sharpening Mechanism)”提醒:模型自生成、自验证、自蒸馏可能带来局部提升,但不能凭空创造原模型完全没有的信息;生成—验证差距是核心测量。
实验启发:同时报告生成器得分(generator score)、验证器得分(verifier score)和外部评审得分(external judge score),而不是只报自评结果;并保留分布外(out-of-domain)与对抗划分(adversarial split)。
Reward Hacking Benchmark 把跳过验证、利用元数据和篡改评分相关函数做成工具任务;HackDetect 则把“暴露点→智能体如何利用→分数是否误导”组织成事后审计。
科研用法:不要把另一个 LLM judge 当唯一防线。优先使用权限隔离、运行时拦截、程序化新题、异构 verifier、投机诱饵和配对反事实,审计模型只负责补充解释。
建议读者从 S1–S4 开始,再读综述、RSI 评测基准和研讨会论文(workshop papers)。arXiv 摘要中的数字在正式引用前应回到 PDF、代码和补充材料(supplementary material)复核。
英文原题:Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents · arXiv:2505.22954 ↗ · 2025-05-29 · 智能体源代码进化、档案分支、SWE-bench / Polyglot。
英文原题:AlphaEvolve: A Coding Agent for Scientific and Algorithmic Discovery · arXiv:2506.13131 ↗ · Google DeepMind 官方介绍 ↗ · 2025-05/06。
英文原题:A Self-Improving Coding Agent · arXiv:2504.15228 ↗ · 2025-04-21 · 在 SWE-bench Verified 随机子集上报告 17%→53%。
英文原题:Gödel Agent: A Self-Referential Agent Framework for Recursively Self-Improvement · ACL 论文集(Anthology)↗ · 2025 · 自指智能体逻辑与行为。
英文原题:A Survey of Self-Evolving Agents: On Path to Artificial Super Intelligence · arXiv:2507.21046 ↗ · 2025-07-28 · 进化对象 × 时机 × 反馈的分类体系。
英文原题:Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops · arXiv:2607.07663 ↗ · 2026-07-08 · 近期综述,声称覆盖 1,250 篇论文;需全文复核。
英文原名:ICLR 2026 Workshop on AI with Recursive Self-Improvement · 研讨会页面(Workshop page)↗ · 研究议程涵盖经验、合成数据、评估、代码进化与治理。
注意差距(Mind the Gap)↗ · 锐化机制(Sharpening Mechanism)↗ · 外部验证(external verification)与自我改进边界(self-improvement limits)。
英文原题:PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents · arXiv:2608.04003 ↗ · 2026-08-04 · 26 个场景、204 个任务回合,含持久经验开启/关闭对照。
英文原题:The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? · arXiv:2606.04455 ↗ · 项目与评测协议 ↗ · 开发集 API、隔离隐藏测试集与防评分投机设计。
英文原题:RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement · arXiv:2607.25886 ↗ · 2026-07-28 · 固定后训练栈,只开放数据策略迭代。
英文原题:TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space? · arXiv:2602.05570 ↗ · 2026-02-05 · 几何反馈驱动的窄域递归修正。
英文原题:RE-Bench: Evaluating Frontier AI R&D Capabilities of Language Model Agents Against Human Experts · arXiv:2411.15114 ↗ · METR 官方任务仓库 ↗ · 七个开放式机器学习研发环境。
来源论文英文原题:Improving Contextual Faithfulness of Large Language Models via Retrieval Heads-Induced Optimization · arXiv:2501.13573 ↗ · GroundBench 汇集五个 LFQA 数据集;它是结果型任务基准,不是 RSI 专用基准。
英文原题:PaperBench: Evaluating AI's Ability to Replicate AI Research · OpenAI 官方页面与论文 ↗ · 20 篇 ICML 2024 论文、8,316 个可评分子任务;适合作为研究能力外部锚点,但不单独测量 RSI 的多代自修改。
英文原题:Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine · arXiv:2510.21614 ↗ · ICLR 2026 · 用后代结果估计 clade metaproductivity,是本方案最重要的近邻基线。
英文原题:Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use · arXiv:2605.02964 ↗ · 2026-05-03 · 工具任务中的验证绕过、元数据利用和评分相关篡改;新近预印本。
英文原题:Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI · arXiv:2607.22368 ↗ · 2026-07-24 · HackDetect、exposure 与 Mislead gap;新近预印本,作为威胁模型来源而非已定论。
英文原题:Self-Improvements in Modern Agentic Systems: A Survey · arXiv:2607.13104 ↗ · 2026-07 · 用模型与脚手架表示智能体,并讨论整个脚手架的自指更新;同时指出术语与研究范围仍碎片化。
英文原题:Hyperagents · arXiv:2603.19461 ↗ · 2026-03 · 将任务求解和改进过程放入统一可编辑程序,是全框架可变的重要近邻工作。
英文原题:The Red Queen Gödel Machine · arXiv:2606.26294 ↗ · 2026-06 · 把 evaluator 纳入演化对象,说明全框架研究不能默认评分机制永远固定;新近工作需阅读全文复核。
英文原题:Self-Harness: Recursive Self-Improvement by Learning the Agent Harness · arXiv:2606.09498 ↗ · 2026-06 · 作为 harness 可学习/可修改的近邻证据;不能据此推断完整角色与拓扑已经被统一测量。
英文原题:Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies · arXiv:2606.23075 ↗ · 2026-06 · 分析攻击如何被写入后继并跨代放大,是 Proof-Carrying Successors 的直接安全近邻。
英文原题:Safe, Untrusted, “Proof-Carrying” AI Agents · arXiv:2510.09567 ↗ · 2025-10 · 展示不可信 agent 携带可检查正确性证据的概念验证;尚未解决递归后继接管。
英文原题:Automated Design of Agentic Systems · arXiv:2408.08435 ↗ · ICLR 2025 · 用 meta-agent 在代码表示的开放设计空间中发明智能体,并报告跨领域、跨模型迁移。
英文原题:AFlow: Automating Agentic Workflow Generation · arXiv:2410.10762 ↗ · 用 MCTS 搜索代码表示的工作流、树结构经验与执行反馈。
英文原题:AgentSquare: Automatic LLM Agent Search in Modular Design Space · arXiv:2410.06153 ↗ · 规划、推理、工具与记忆模块的进化、重组和性能预测。
英文原题:Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory · arXiv:2511.20857 ↗ · 流式任务、十余种记忆模块与持续检索/整合/更新。
英文原题:MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents · arXiv:2602.02474 ↗ · 让记忆提取、整合、裁剪技能及其选择策略参与演化。
英文原题:Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark · arXiv:2508.19005 ↗ · 经验探索、长期记忆、技能学习与知识内化。
英文原题:MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution · arXiv:2607.05297 ↗ · 快速任务技能与慢速改进元技能共同演化。
英文原题:Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges · ICML 2025 / PMLR ↗ · 正确自生成样本筛选、迭代训练与长度外推。
英文原题:Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI · ICML 2025 / PMLR ↗ · 采样与精炼训练之间的跨轮正迁移。
英文原题:Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains · ICLR 2025 / OpenReview ↗ · 同源模型经多智能体交互生成的多样推理链独立专门化。
英文原题:SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models · ICLR 2025 / OpenReview ↗ · 自博弈生成、树搜索精炼与多轮训练。
英文原题:Inefficiencies of Meta Agents for Agent Design · arXiv:2510.06711 ↗ · 分析常见 meta-agent 搜索的效率挑战与经济可行条件。
英文原题:MaMa: A Game-Theoretic Approach for Designing Safe Agentic Systems · arXiv:2602.04431 ↗ · meta-agent 与 meta-adversary 共同搜索在部分节点受损时仍安全的设计。
英文原题:AgenticRed: Optimizing Agentic Systems for Automated Red-teaming · arXiv:2601.13518 ↗ · 将自动系统设计用于红队搜索,提供安全共同演化近邻。
英文原题:RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents · arXiv:2603.11337 ↗ · 显式测量 evaluator tampering 与 train/test leakage。
英文原题:Sequential algorithmic modification with test data reuse · UAI 2022 / PMLR ↗ · 为多轮自适应修改下的 holdout 复用和统计有效性提供基础。