RSI 研究雷达
研究简报 · 2026.08

AI 如何
改进自己

围绕 Recursive Self-Improvement(RSI,递归自我改进)的技术谱系、最新文献、可验证研究问题与发文路线。这里的核心判断是:真正可做的科研,不是宣称“智能爆炸”,而是把“改进”拆成可审计、可复现、能迁移的闭环。

研究截点:2026 年 8 月 9 日 · 中文研究导航版 · 结论按证据强度分层

3 层
内容 / 组成 / 拓扑
被称作 RSI 的工作绝大多数只动了第 1 层
17
已占据第 2、3 层的工作
其中 10 篇 harness 自演化、7 篇拓扑自演化,多数发表于 2026 年 3–8 月
20→50%
DGM 的 SWE-bench 报告结果
摘要口径;需要注意成本、方差与迁移性
33 / 33
引用核验结果:全部为真
arXiv API 逐条核对,0 条虚构;另检索 563 篇候选,三波定向追踪
01 / 核心观点

先把“自我改进”定义清楚

RSI 不是单一算法,也不是“模型多想几遍”。本文把它定义为:一个 AI 系统在多轮运行中,利用自身或外部反馈,更新其可影响后续性能的组件,并在相对独立的任务/环境上验证改进。更新对象可以是输出策略,也可以是记忆、工具、代码、权重、数据、评估器,乃至选择研究问题的流程。

不算 RSI 的情况

一次性自我反思(self-reflection)、固定提示链(prompt chain)、只在同一道题上重采样、没有跨任务或跨轮次积累的“看起来更聪明”。

需谨慎命名

最低证据标准

改进前后要有冻结的外部测试集、明确的更新对象、完整轨迹、成本与失败统计,并排除评估器泄漏(evaluator leakage)和基准过拟合(benchmark overfitting)。

可复现证据

最值得研究的缺口

如何让评估器(evaluator)不被智能体(agent)反向优化?如何证明能力迁移,而不是只学会“迎合评估器”?

开放问题
调研核心 · 2026.08.11 新增

内容、组成、拓扑:
现有工作卡在哪一层

把"框架会变化"拆成三层,才能说清楚谁做过什么。绝大多数被称作 RSI 的工作只动了第一层;第二、三层各只被做了一半,而且都不是由系统自己驱动的。

第 1 层 · Content内容演化

组件里的代码、提示词、权重变了,但有哪些组件、怎么连不变。STOP、Gödel Agent、DGM、HGM 全在这层。

第 2 层 · Composition组成演化

系统由哪些组件构成、每个组件允不允许被改。AgentSquare 做了一半——模块可换,但"就是这四类"是人定的。

第 3 层 · Topology拓扑演化

组件之间怎么连、执行顺序、谁控制谁。AFlow 做了一半——图结构可搜,但算子表是人给的。

可修改边界表:每篇论文到底把什么写死了

"固定了什么"比"做了什么"更重要——它直接决定这篇工作答不了哪个问题,也就是你的机会所在。

工作允许改写死不许改落在哪一层
STOP
arXiv:2310.02304
improver 程序的代码,包括它自己模型权重、元效用函数、"把改进器喂给自己"的外层循环、任务分布;改进器永远是一个函数,签名不变1(改的是 U 本身)
Gödel Agent
ACL 2025
运行时逻辑,含"负责改写"的那段模型、环境、目标;只有一个 agent,没有群体,改坏了回不去1(单线自我重写)
DGM
arXiv:2505.22954
agent 自己的 Python 代码库(工具、流程、提示词)档案结构、父代选择规则、接受规则、benchmark、模型、整个外层演化循环——研究者写死,agent 碰不到1 + 群体
HGM
arXiv:2510.21614
同 DGM同 DGM。CMP 是研究者提出的新选择规则,不是系统自己发现的1(把 Q 变成研究对象)
ADAS
arXiv:2408.08435
被设计出来的 agent 的代码,可写任意 workflow元 agent 本身永不改变(固定模型 + 固定提示词)、搜索循环、档案、产出物必须塞进固定的 forward() 接口1,产出物有结构自由
AFlow
arXiv:2410.10762
workflow 的图结构:节点、边、控制流算子集合是人预先定义的、MCTS 搜索算法、优化目标、节点接口3 的一半
AgentSquare
arXiv:2410.06153
规划 / 推理 / 工具 / 记忆四类模块的选择与重组"就是这四类"这个划分本身、模块间接口、搜索算法、性能预测器2 的一半

证据等级提示:本表来自模型知识截点内的记忆,每一行都需回原文核验,其中 AFlow 的算子集合是否真的固定、AgentSquare 的四类划分是否真的写死,是整个 gap 陈述的地基,必须优先确认。

因此,它们各自答不了什么

这六段可以直接改写成 related work——每段的最后一句就是你和它的分界线。

第 1 层

STOP

手写一个改进器函数,然后把它喂给它自己。模型冻结,只有脚手架代码在变;模型自己摸索出了 beam search、遗传算法、模拟退火。论文里还记录了改进器试图关掉沙箱标志位。

答不了:整个系统就是一个函数,没有"由哪些部件组成"的概念,所以"该有哪些组件"这个问题在它的设定里无法提出。
第 1 层

Gödel Agent

运行时读自己的代码、改写自己的逻辑,包括改写负责改写的那段。给高层目标,没有预设的改进套路。

答不了:没有档案就没有选择,没有选择就无法研究"什么样的改动值得保留"。和 STOP 一样是单体,没有组件划分。
第 1 层

DGM

编程 agent 改自己的代码,每一版都进档案,下一轮从档案里挑父代分叉而非只从最新版往下走。80 轮,SWE-bench 20.0→50.0%。

答不了:证明了 agent 能改自己的代码并越改越好,但演化机制本身不在演化空间里。"谁决定该有哪些部件、这个决定权能否传给后代"没有位置可放。
第 1 层

ADAS / Meta Agent Search

一个元 agent 反复用代码编写新 agent,存进不断增长的档案,并以档案为上下文启发下一次设计。产出的 agent 能跨领域跨模型迁移。

答不了:"U₀ 永远是 U₀"的最纯粹形态。能造出结构任意的 agent,但造它的那个东西从不进化——这恰好是 MAC 的多代版本。
最近的邻居

AFlow

把 workflow 表示成图:节点是调用 LLM 的算子,边是控制流,用 MCTS 在图空间里搜,靠执行反馈和树结构经验指导。

答不了:拓扑确实在变,但是在一张人给的词汇表里排列组合,而且是外部搜索器在排。系统发明不出新算子,也不会把"怎么搜"传给后代。
最近的邻居

AgentSquare

把设计空间模块化成规划、推理、工具、记忆四类,在其上做进化与重组,另配性能预测器剪枝。

答不了:组成确实在变,但角色词汇表是人定的、且恒为四个。系统不能说"我觉得该多一个诊断器",也不能说"记忆和推理应该合并"。

⚠ 2026-08-11 更新:原 gap 陈述已作废。

原文写的是"没有工作让系统自己决定应该有哪些组件、它们怎么连,并把这个决定权传递给后代"。补充检索(563 篇)证明这句话不成立——2026 年 3–8 月出现了至少 17 篇工作占据这两层,见下一节。

修正后仍然成立的主张:已有工作各自让某个部件可演化并报告性能提升,但没有一篇做过角色级的因果干预——哪些组件必须可演化、哪些只是锦上添花、哪些反而有害。能力 c 与可演化性 μ 的分离测量仍是空白。

补充检索结果:空白已被填掉大半

2026-08-11 执行,共检索 563 篇候选(15 组主题词 + 3 波定向追踪),并对全部 33 条既有引用做了 arXiv API 核验。结论:0 条虚构引用,但原 gap 陈述被推翻。

Harness / 框架自演化(10 篇)日期做了什么
Meta-Harness
arXiv:2603.28052
2026-03-30端到端优化 harness——即"决定存什么、取什么、如何呈现给模型"的那段代码。
Adaptive Auto-Harness
arXiv:2606.01770
2026-06-01开放式任务流上的持续自改进。文中点名 A-Evolve、GEPA、Meta-Harness 三个同类系统,说明这已是一个有名字的子领域。
Harness-Aware Self-Evolving (HASE)
arXiv:2607.03935
2026-07-04同时演化模型权重、harness 与任务解;单个 Qwen3-8B 追平 GPT-OSS-120B。
Recursive Harness Self-Improvement
arXiv:2607.15524
2026-07-17harness-in-the-loop:把 harness 当作数据生成组件,兼顾当前性能与未来训练轨迹质量。
DarwinX
arXiv:2608.07545
2026-07-31对 harness 种群做自然选择,模型冻结;明确批评单谱系搜索的路径依赖与局部收益导致的跨任务退化。
EvolveNet
arXiv:2608.04968
2026-08-05指出既有方法都假设"所有执行经验汇入单一优化器演化一个 harness",改为协同演化。
Hierarchical Self-Improvement
arXiv:2608.08466
2026-08-09每个任务族维护自己的可演化 harness,迭代之间热插拔
GEPA
arXiv:2507.19457
2025-07-25反思式提示词演化,效果超过强化学习。
FlashEvolve
arXiv:2605.08520
2026-05-08异步阶段编排,解决 agent 自演化的墙钟成本瓶颈。
Mendel Gödel Machine
arXiv:2608.07645
2026-08-07用档案中的比较信号而非单条失败轨迹驱动自我修改。
拓扑自演化(7 篇)日期做了什么
MANTA
arXiv:2607.28527
2026-07-30最直接的撞车。原文开篇即指出"现有系统把通信拓扑当作固定设计选择或离线优化目标",然后让通信结构在线自演化。这句 motivation 与本项目高度重合。
TopoEvo
arXiv:2605.15611
2026-05-15拓扑感知的自演化多智能体框架(微服务根因分析域)。
SkillGraph
arXiv:2604.17503
2026-04-19自演化多模态图拓扑;批评"通信拓扑在推理前就被固定"。
GPTSwarm
arXiv:2402.16823
2024-02-26把 agent 表示成可优化计算图,节点提示词与边连接同时优化,图可递归组合
MaAS / Agentic Supernet
arXiv:2502.04180
2025-02-06批评既有方法只找"静态、一刀切"的系统,改为从超网按查询采样架构。
MASS
arXiv:2502.02533
2025-02-04联合优化提示词与拓扑。
AgentPrune
arXiv:2410.02506
2024-10-03通信拓扑剪枝,降低多智能体通信开销。
理论侧也有人

On The Statistical Limits of Self-Improving Agents

2510.04399

前提是"agent 可以沿自身设计的每一个方面自我改进",给出五轴分解 + 决策层,证明了自修改系统中的"效用—学习张力"。

撞车提示:这与本项目的十角色分解、"哪些维度可演化"直接重叠,且已有形式化结果。任何角色分解方案必须先与它对齐。
理论侧也有人

A mathematical theory of evolution for self-designing AIs

2604.05142

用 Fisher 基本定理为框架,建模"由递归自我改进产生的 AI"其性状如何被祖先设计后代的成功率塑造。

谱系生产力的理论对应物,与 HGM 的 CMP 是同一问题的两种处理。
意外的礼物

Phantom Guardrails

2607.13083

自改进的 harness 会去修复根本没发生过的失败——提议器编辑脚手架以消除"观察到的失败",却从不先问"真的失败了吗"。

可直接用作动机:这是 harness 自演化这条线的第一个负面结果,与"结构自由度可能不划算"同向。

对「思路 1」的直接威胁:Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0(arXiv:2607.14004, 2026-07-15)已经在问"agent 优化的收益能否复利",并指出多数报告的增益是一次性的。

但它测的是优化器是否复利,不是结构自由度值不值。"只改内容 vs 也改组成/拓扑,等预算对照"这个具体设计仍未被做——不过投稿时必须正面处理这篇。

仍需注意的老先例:AutoML-Zero(ICML 2020, arXiv:2003.03384)。从空程序出发、只给基本数学算子,演化出完整的机器学习算法并重新发现了反向传播。novelty 不能表述为"首次让系统决定组件构成"。

检索方法:15 组主题检索词(拓扑与架构搜索 / 自修改与结构演化 / RSI 本体 / 提示词与程序演化 / 开放式演化与质量多样性 / 架构搜索方法论 / 自改进补漏)+ 16 项按标题精确定位 + 8 项定向追踪,共 563 篇去重候选,原始结果保存在 search_results.mdsearch_results2.md。上表条目的 arXiv 编号与日期均由 arXiv API 返回,但"做了什么"一栏基于摘要,尚未读全文;投稿前需回原文确认各自的可修改边界。

论文选题 · 2026.08.11 新增

五条可落地的选题

全部从上面那个空白推导而来,按"该不该先做"排序。每条都写明了为什么它是好论文、以及它的风险在哪——这五条用来替代此前 100 条模板化候选作为决策依据。

建议做主线

结构自由度到底值不值?

正反都能发

问题:允许改组成/拓扑,比只改内容,在同等预算下多赚了什么?

  1. 同任务、同模型、同 token 预算,三组对照:只改内容 / 可增删组件 / 可改连接与顺序。
  2. 主指标:隐藏集增益 ÷ 单位算力。
  3. AFlow 与 AgentSquare 都假定结构搜索有用,但没人把它和"只改内容"在同算力下对比过。
这是整个方向的前提 · 若答案是"不值",后面所有设计都要变
⚠ 直接竞品:arXiv:2607.14004 Do Agent Optimizers Compound?(2026-07-15)已在问"优化收益能否复利",并指出多数报告增益是一次性的。本思路必须把问题收窄到结构自由度的等预算对照,并在 related work 正面处理它。
为什么是好论文:正反都能发。有用 → 你有了第一个证据;没用 → "结构搜索在 X 预算以下不划算",同样会被大量引用。这种题不会做废。
上限最高 · 风险最大

不给词汇表,系统会长出什么?

探针是硬骨头

问题:AgentSquare 的四类模块是人定的。如果不给,系统自己会分化出哪些角色?

  1. F₀ 是一个单体程序,让它自己演化。
  2. 行为探针检测功能是否出现——看行为,不能看文件名。
  3. 观察是否自发分化出诊断、选择、记忆这类分工。
跨 run 若总收敛到相似分工 → 一条经验规律;若每次都不同 → 人定的四类划分是任意的
风险:探针设计是硬骨头。功能涌现了但测不出来,整篇就废了——五条里技术风险最高的一条。
故事最好 · 建议第二篇

把演化机制本身交给系统

需先复现 DGM

问题:DGM 的父代选择规则由研究者写死。让系统自己改这条规则会怎样?

  1. 两组:选择规则固定 vs 可被系统修改。
  2. 看长期谱系生产力。
  3. 重点看系统会不会把规则改成对自己有利的(例如"永远选我自己")。
HGM 已证明选择规则很重要(CMP 优于当前分数)· 下一个自然问题就是系统能否自己找到好规则
⚠ 已被部分做掉:DarwinX(2608.07545)已对 harness 种群做自然选择,Mendel Gödel Machine(2608.07645)已用档案比较信号驱动自我修改。剩余空间只在「选择规则本身可否被系统修改,以及会不会腐化」,必须这样表述。
自带负面故事:给了自由度之后选择器会腐化——这是 reward hacking 在选择层的对应物,安全侧会很买账。代价是要先复现 DGM,工程量大。
最便宜 · 可并入思路 1

越强的系统越难改吗?

"演化债"

问题:当前分数高的系统,是不是反而更难被继续改进?

  1. 取一批能力分层的父代。
  2. 用同一个改进器去改。
  3. 画"改进量 vs 父代基线分"的曲线。
HGM 的 metaproductivity-performance mismatch 是相邻观察,但没系统研究这条曲线
为什么划算:便宜、干净、可证伪。若呈倒 U 型就是个漂亮结果,对所有做 agent 自演化的人都有直接指导意义。可作为思路 1 实验的顺带数据分析,不必单独设计实验。
建议与主线并行

三层框架的综述 / 立场文

成本最低

问题:把"内容 / 组成 / 拓扑"立成这个领域的坐标系。

  1. 材料已有大半,几乎不占额外精力——调研本来就要做。
  2. 领域正在成型期,综述最容易被引。
  3. 为后续所有实验论文提供统一话语,可先挂 arXiv 占坑。
代价:不是强实验成果,但当前性价比最高
↑ 价值上调:2026 年 3–8 月有 17 篇工作涌入这两层,至今无人整理。563 篇检索底稿已在手,三层框架是现成的组织坐标。这是目前最快能落地的产出。
建议:与思路 1 并行推进,而不是二选一。
优先级结论

建议:主线做 1,同时写 5

思路 1 验证的是整个方向能不能成立,不做它后面都是空中楼阁;成本可控、正反都能发。思路 5 并行,几乎不增加负担,还能建立话语权。

  • 思路 3 故事最好但依赖复现 DGM,放第二篇。
  • 思路 2 上限最高但探针风险大,等有人手再说。
  • 思路 4 不用单独设计实验,并入思路 1 的数据分析即可。
此前的 100 条候选池不再作为决策依据。模板化条目给不了取舍信息;保留为头脑风暴存档即可。

调研已完成 · 修订后的优先级

2026-08-11 的检索与核验已执行完毕,下面是据此调整后的判断。

已完成

引用核验

33 / 33

全部 arXiv 编号逐条核对,0 条虚构。仅两处标题转述不准:2606.09498 实为 Self-Harness: Harnesses That Improve Themselves2601.13518 实为 AgenticRed: Evolving Agentic Systems for Red-Teaming2606.26294 在账本中重复登记。

已完成

补充检索

563 篇

15 组主题词 + 16 项标题定位 + 8 项定向追踪。结论:原 gap 陈述作废,第 2、3 层已有 17 篇工作占据。底稿见 search_results.mdsearch_results2.md

下一步

读全文,确认可修改边界

优先 6 篇

上表的"做了什么"仅基于摘要。必须回原文确认边界的六篇:MANTA(拓扑是否真的在线自演化)、DarwinXHierarchical Self-ImprovementHASEOn The Statistical Limits(五轴分解与十角色的关系)、Do Agent Optimizers Compound?

修订后的建议:把思路 5 提到与思路 1 同级,甚至优先。

理由是领域在三个月内涌入 17 篇却无人整理,而「内容 / 组成 / 拓扑」三层框架正好是现成的组织坐标,563 篇检索底稿也已在手。

实验侧唯一确定还空着的是角色级因果干预——现有工作全部是"我让 X 可演化,性能涨了",没有一篇做过"逐个角色加入 / 删除 / 冻结,测哪些必须可演化"。能力 c 与可演化性 μ 的分离测量应作为主实验主张,而不是"框架可以演化"这件事本身。

02 / 领域地图

RSI 研究地图:五层能力梯度

越往下,系统改变的对象越接近“自身”;但证据要求、成本和安全风险也同步上升。科研上应先从 L1–L2 做出可复现实验,再向 L3–L4 扩展。

层级改什么反馈与闭环典型工作关键验证
L0 行为自修正答案、计划、推理轨迹自我批评(self-critique)/ 多次采样 / 验证器(verifier)锐化机制(Sharpening)、Crescent 方法(Crescent)、测试时自我改进(test-time self-improvement)留出集准确率(held-out accuracy);防止只优化同题
L1 经验与工具记忆、技能库、工具调用策略跨任务回合(episode)反馈;经验写入与检索自进化智能体(self-evolving agents)、长期编程智能体(long-term coding agents)新任务迁移;删除或污染记忆后的鲁棒性
L2 代码与架构智能体源代码(agent source code)、提示词(prompt)、工作流(workflow)执行测试;分支、回滚、档案选择自改进编程智能体(A Self-Improving Coding Agent)、达尔文哥德尔机(Darwin Gödel Machine, DGM)、哥德尔智能体(Gödel Agent)跨基准迁移(cross-benchmark transfer);成本、方差、审计轨迹
L3 模型/数据/评估器权重、训练数据、优化器(optimizer)、评估器(evaluator)训练或合成数据;弱到强验证算法发明(algorithm invention)、模型融合(model merging)、评估器协同进化(co-evolving evaluator)独立评估器、分布外安全、模型塌缩
L4 AI 研究流程研究方向、实验设计、下一代系统自动提出假设→实验→复现→选择方向AI 研究伙伴(AI as research partner)、开放式递归自我改进(open-ended RSI)科学新颖性、外部复现、人的方向性监督

方法论提示:L0–L1 的“自适应”与 L2 的“自改代码”已有较多可运行案例;L3–L4 更像研究议程,不应把演示结果写成已解决的 RSI。

03 / RSI 评测基准

RSI 到底该怎么测?

截至 2026 年 8 月,尚没有一个被广泛接受、能完整衡量递归自我改进的统一基准。关键不是再造一个排行榜,而是把“系统如何利用反馈改自己”和“改完后是否真的变强”拆开测。

先纠正一个容易混淆的前提:目前没有公认的 RSI base agent,也没有唯一的“后继系统必须怎样接管”的实现。强 RSI(strong RSI)要求后继系统继续产生下一代;现有工作还包括固定元智能体、档案式进化和组件级自适应。benchmark 应声明测哪一种,并把规则、执行基础设施和被测改进算法分开。

三层必须分开:定义协议、运行 harness、被测 RSI 框架

动态 benchmark 确实需要软件来运行多代系统,但 harness 只执行规则;一旦它决定如何生成、选择或修改后继版本,它就成为被测方法的一部分。

规则层 · ProtocolRSI 评测协议

规定“自我”的边界、可修改组件、反馈可见性、代数、预算、隐藏任务、停止规则和指标。它回答“什么证据算改进”。

执行层 · Harness中立运行与留证

启动容器、交接后继制品、隔离 evaluator、记录哈希和谱系、执行预算与回滚。它不替参赛系统提出修改。

方法层 · Framework被比较的 RSI 系统

固定元智能体、单链自改、DGM/HGM 式档案搜索、记忆或数据自进化都可以接入。它们决定“如何改”。

被测系统 S_t = 任务智能体 A_t + 改进器 U_t + 持久状态 K_t | U_t(A_t, K_t, feedback) → (A_t+1, U_t+1, K_t+1)

弱模式:固定改进器

U₀ 每一代都负责修改任务智能体。可以测自动智能体开发,但不能证明改进器自身变强。

MAC 更接近此类

中间模式:档案进化

从多条 lineage 选择父代并产生后代。可以研究长期生产力,但外层选择器和效用通常仍是固定的。

DGM / HGM 类

强模式:后继接管

U_t 也被继承或修改,并由后继系统产生下一代。它是强 RSI 的可测条件,不是当前唯一公认架构。

重要开放问题

普通基准与 RSI 基准,差别不只是“测一次还是测两次”

普通基准也可以有开发集(development set)和测试集(test set)。RSI 的特殊之处是:系统反复读取环内反馈,并据此产生下一代系统,因此评价本身成为了学习过程的一部分。

比较项普通/静态基准(Conventional benchmark)RSI 评测协议(RSI evaluation protocol)
被测对象(Object)一个相对固定的模型或智能体,回答一组任务。基线系统、改进机制、连续候选版本及其完整谱系(lineage)。
适应轮次(Adaptive rounds)通常按固定配置跑一次或若干独立重复;分数不应在本次正式测试中驱动持久自修改。明确允许多轮“诊断→修改→评估→选择”,下一轮候选依赖上一轮反馈。
反馈的作用(Feedback effect)开发集可用于调参,但正式报告常聚焦最终测试分数。反馈是系统演化的输入,必须记录它如何改变后续版本,不能只展示胜出的最后一个点。
开发/搜索侧(Dev / search side)用于选模型、提示词或超参数。是正式被测机制的一部分:限制查询次数、预算、可见日志、可修改组件和停止条件。
隐藏/最终侧(Hidden / final side)估计固定系统在未见样本上的泛化表现。比较冻结基线与冻结最终候选的隐藏增益,并检验搜索过程是否产生可迁移的真实改进。
主要输出(Outputs)最终分数、置信区间、按任务切片结果。完整改进轨迹 + 最终隐藏增益 + 因果归因 + 成本/时间 + 安全事件 + 失败分支。
主要失真(Main threats)训练污染(contamination)、测试泄漏、抽样偏差。还增加自适应过拟合(adaptive overfitting)、评估器投机(evaluator gaming)、改分数而非改能力,以及无法归因增益。

关于 GroundBench:这里按 RHIO 论文提出的 GroundBench 理解,它汇集五个长文本问答(long-form question answering, LFQA)数据集,测上下文忠实性(contextual faithfulness)。它本身是普通的结果型基准,不直接测 RSI;但可以被嵌入 RSI 协议,作为环内任务集或隔离的环外任务集。只有加上多轮自修改、可见性契约、冻结候选和前后对照,它才成为 RSI 证据的一部分。[S14]

模型能看到什么,由谁规定?

没有一条自然法则规定“环内优化评估器一定公开”或“评分代码一定隐藏”。可见性是评测协议中的访问契约(access contract),由设计者声明、基础设施执行、审计者核验。

规则层(Specification)

1. 基准/协议设计者(Benchmark & protocol designer)

定义任务分布、开发与隐藏划分、模型/元智能体各自可见的信息、允许修改的组件、查询预算、停止规则和主指标。若研究者既设计又参赛,应预先注册协议并引入独立保管方。

执行层(Enforcement)

2. 环境与权限系统(Environment & access control)

通过容器、网络策略、只读挂载、受限 API、密钥、进程权限和时间锁真正落实契约。文字上说“不能看”不够,系统必须让读取或修改隐藏资产在技术上失败。

证据层(Evidence custody)

3. 评估基础设施(Evaluator infrastructure)

保管隐藏任务、答案、测试和评分日志,记录查询、镜像、随机种子、版本哈希与时间戳。开发预算结束后才挂载最终验证器,是一种可操作的时间隔离。

复核层(Independent review)

4. 独立审计者(Independent auditor)

检查是否泄漏、越权、替换评估器、挑选幸运种子或隐去失败谱系,并使用另一套任务、验证器或专家盲评复核结论。设计者规定契约,审计者判断契约是否可信地执行。

信息/能力搜索阶段(Search phase)隐藏阶段(Hidden phase)为什么这样设计
当前任务输入(Task input)开发任务题面通常可见。最终候选在作答时当然能接收该题输入;但负责改系统的控制器(improvement controller)已经冻结,不能据此再发布新版本。区分“看见要回答的问题”和“看见答案后继续改系统”。
开发样例(Development examples)可见,并明确属于搜索数据。不再增加;不能把隐藏案例回流成新开发样例。防止自适应污染隐藏集。
聚合分数(Aggregate score)可见或限频返回,可加噪声/分桶。在候选冻结和运行结束后发布;发布后不得回到本轮改进。分数一旦驱动修改,就属于搜索信号。
失败日志(Failure logs)由协议配置:可给完整日志、错误类别或只给通过/失败。通常封存到最终结束;之后可用于分析,不用于重跑选优。控制反馈带宽(feedback bandwidth)和过拟合速度。
评分规则/代码(Rubric / scoring code)可以公开规则,也可以只开放 API;公开规则不等于公开隐藏案例。协议可公开抽象规则,但隐藏测试、密钥和逐题标签仍隔离。真正关键的是不可利用的隐藏实例与不可篡改执行,而非一概保密所有规则。
隐藏答案/测试(Hidden labels / tests)绝不应可见,也不可由侧信道推断。候选只接收必要输入;答案和断言由隔离执行器持有。这是环外证据成立的最低边界。
修改权限(Write access)只能改协议白名单中的提示词、记忆、工具、代码、数据或权重。候选版本、依赖和环境全部只读冻结。防止“测评时继续进化”以及修改测试/评分器。
外部审计(External audit)可以公开审计原则,但不开放具体新题与人工判定。由独立方执行;结果与方法在审计完成后发布。避免同一个评估器同时充当老师、考官和证明人。

具体例子:Meta-Agent Challenge(MAC)允许元智能体读取任务、编辑 agent.py 并查询开发集评估 API;测试集加密存放在另一容器中,开发预算结束后才挂载验证器。模型“看得到反馈”指 API 返回被允许的信息,不表示它能读取测试集、答案或验证器内部实现。[S10]

三种角色:谁参与改进,谁负责证明

最低可信设计是 Esearch + Ehidden 双轨;Eaudit 是更强的第三方复核。一个数据集也可以被切成这些角色,但数据、权限和时间必须隔离。

循环内 · 可提供反馈

环内优化评估器(Search evaluator)

Esearch

这里的 search 指“在候选系统空间中搜索”:系统尝试不同提示词、代码、数据、权重或工作流,评估器返回适应度信号,帮助选择下一代;不是网络搜索。若实验只有常规迭代调优,没有显式候选搜索,称开发评估器(development evaluator)会更直观。

用于优化,不是最终证据
循环外 · 必须隔离

冻结隐藏评估器(Frozen hidden evaluator)

Ehidden

在自我改进期间保持任务、答案和评分逻辑不可见,用来判断改进是否迁移到未见任务。可以冻结规则,也可以冻结评估协议并定期更换隐藏题目。

能力提升的主要证据
独立复核

外部审计(External audit)

Eaudit

由独立基准、另一套验证器或人类专家复核,检查测试污染、评分投机(reward hacking)、成本膨胀和安全回退。它回答的是“换一把尺子,改进还成立吗?”

最强可信度检查
内循环(Inner loop)诊断 → 修改 → 沙箱 → Esearch → 选择/归档 → 重复
版本冻结(Candidate freeze)停止搜索;锁定代码、权重、配置、依赖、预算与哈希
外部证明(Outer proof)Ehidden → Eaudit → 与冻结基线比较

外部审计怎么加?它不是“再跑一次分数”

冻结隐藏评测检验能力是否泛化;外部审计检验这份证据是否值得相信。审计是独立的保证过程(assurance process),可以包含另一套测试,但范围还包括数据、权限、谱系、成本、安全和复现。

比较项冻结隐藏评估(Ehidden外部审计(Eaudit
核心问题最终候选在未见任务上,是否比冻结基线更强?隐藏增益是否真实、可复现、无泄漏、无投机,并且没有用不可接受的成本或安全退化换取?
性质正式评测协议中的一个评分阶段。对完整实验及其证据链的独立复核,不一定压缩成单一分数。
执行者可由基准官方或研究团队的隔离执行器自动运行。最好由未参与候选开发的另一团队、第三方机构或领域专家执行。
输入冻结基线、冻结最终候选、隐藏任务和预注册预算。还需要协议、全部版本哈希、查询日志、失败分支、权限记录、成本账本、安全事件和人工干预记录。
主要方法隐藏集、OOD 集、置信区间和同预算前后对照。独立重跑、替代基准/验证器、污染扫描、日志取证、权限测试、随机种子复核、专家盲评和安全回归测试。
输出hidden gain、迁移差距、方差和失败切片。审计意见(audit opinion)、发现清单、严重性、未解决限制,以及“通过/有保留/不通过”的结论。
1. 搜索前预注册
先确定审计方、独立性要求、审计范围、必须保留的证据、替代测试、通过阈值和利益冲突声明;不能等看到结果后临时挑一个有利审计。
2. 全程自动留证
每代候选自动保存父版本、diff、制品哈希、容器镜像、评估查询、返回反馈、成本、种子、权限告警、回滚与人工操作,形成只追加(append-only)的证据包。
3. 冻结后交付
开发团队在隐藏结果返回前签署 final manifest;审计方接收只读制品和日志副本,不允许开发方在审计中途替换候选或补跑选优。
4. 独立复核
审计方重放若干世代、复算主结果,再用不同题目、不同 evaluator 或专家盲评验证;同时检查数据污染、侧信道、测试篡改、漏报失败和能力—安全权衡。
5. 单独发布意见
主论文报告 Ehidden 分数,审计报告单独说明证据是否可靠、发现了什么问题、哪些限制尚未排除。审计不替研究者背书,也不应只给一句“已验证”。

实践选择:早期原型至少做“内部独立审计”(由未参与改进循环的团队成员盲验);准备公开 benchmark 或高影响结论时,再升级为真正的第三方审计。外部审计不是所有小实验的硬性门槛,但结论越接近“系统能够持续自我改进”,独立性要求就应越高。

一轮完整 RSI 实验:从协议冻结到公开报告

下面不是概念图,而是一条可以直接转成实验清单、日志 schema 和论文方法章节的 0–12 阶段流程。

阶段 0

冻结改进契约与威胁模型(Improvement contract & threat model)

先定义目标能力、允许修改的表面(modification surface)、禁止访问的资产、Esearch/Ehidden/Eaudit、查询与算力预算、停止条件、污染假设、安全不变量和成功标准。此时就确定主指标,防止看结果后换口径。

产物:预注册协议权限矩阵数据清单
阶段 1

登记冻结基线(Register frozen baseline)

打包基线模型/智能体、系统提示词、工具、依赖、镜像、种子与推理预算;生成不可变哈希。基线不能在看到隐藏结果后被重新挑选。

产物:baseline artifact环境哈希
阶段 2

托管初始隐藏测量(Escrowed hidden baseline)

独立执行器在 Ehidden 上测基线并封存逐题结果。改进系统既看不到隐藏案例,也不应拿到可反推出案例的细粒度反馈;必要时连聚合基线分数也延迟公布。

检查点:基线已测但未泄漏
阶段 3

在允许的搜索任务上诊断(Diagnose on allowed search tasks)

收集 Esearch 的失败类型、错误日志、成本和环境状态,形成能力缺口,而不是直接记忆具体答案。区分模型能力、脚手架、工具、数据和评估噪声造成的失败。

产物:failure taxonomy诊断证据
阶段 4

生成可证伪的修改假设(Falsifiable modification hypothesis)

每个候选修改都写明“改什么、为什么、预计改善哪类错误、可能伤害什么、用什么消融验证”。一次混改多个组件会让因果归因失效。

产物:hypothesis + expected effect
阶段 5

仅修改白名单组件(Modify allowlisted components)

系统可以编辑被授权的提示词、记忆策略、工具路由、智能体代码、训练数据或权重;所有差异(diff)、父版本、操作者、模型调用和外部输入写入谱系。评估器、隐藏数据和审计日志保持只读。

产物:candidate artifact完整 diff
阶段 6

沙箱、静态与安全门禁(Sandbox & safety gates)

在不接触隐藏集的环境里做构建、单元测试、恶意文件/网络访问检查、资源上限、权限不变量和可回滚性验证。门禁失败的候选应被拒绝,但仍保留失败记录。

检查点:无越权、可复现、可回滚
阶段 7

查询环内优化评估器(Query Esearch

通过协议允许的接口运行候选;只返回约定粒度的分数、错误类别或日志。记录每次查询、返回值、时长、词元、GPU/API 成本和随机性,防止无限试错把基准变成训练集。

产物:search observation预算账本
阶段 8

选择、归档或回滚(Select, archive, or rollback)

按预注册的多目标规则比较能力、成本、安全和多样性;不要只保留单一路径的当前冠军。运行必要的消融或重复种子,判断增益是否来自目标修改,再决定归档、分支或回滚。

产物:selection decision失败谱系
阶段 9

跨代重复直到预定停止(Iterate under stopping rule)

回到阶段 3,形成第 1…N 代。停止必须由查询数、总算力、墙钟时间、连续无提升、风险阈值或预定代数触发,不能因为刚好出现最好分数而临时结束。

输出:完整 improvement trajectory
阶段 10

在隐藏测试前冻结最终候选(Freeze final candidate)

依据 Esearch 规则选定一个或预注册数量的候选,锁定代码、权重、依赖、上下文、工具、推理预算和种子策略。此后即使发现问题,也不能为本次主结果修改并重测。

检查点:final hash + signed manifest
阶段 11

运行隐藏、分布外与独立审计(Hidden, OOD & audit evaluation)

同预算比较冻结基线和最终候选的 Ehidden;再用不同任务分布、不同验证器或专家盲评执行 Eaudit。检查是否出现搜索分数上升但隐藏/OOD 下降、成本暴涨或安全能力回退。

主证据:hidden deltatransfer gapaudit verdict
阶段 12

公开全轨迹而非只报冠军(Report the full trajectory)

发布协议、基线与最终制品、所有候选谱系、查询日志、失败分支、种子、置信区间、算力/费用/时间、安全事件、人工干预和负结果。最终结论应分别写“搜索能力”“隐藏迁移”“成本效率”和“安全完整性”。

产物:可复现实验包局限性声明

RSI 有强领域性吗?机制可通用,证据高度领域化

“生成候选→得到反馈→修改→选择”的协议可以跨领域复用;但真值是否明确、反馈多久返回、评估器能否被执行、现实分布是否变化,都强烈依赖领域。因此通用 RSI 更应报告能力向量(capability vector),而不是压成一个总分。

领域可能改什么环内 Esearch环外 Ehidden / Eaudit当前成熟度与主要瓶颈
代码/软件(Code & software)提示词、工具路由、测试策略、智能体代码、修复知识库。公开/开发单元测试、编译器、静态分析、开发仓库、性能剖析。私有测试、新仓库、跨语言任务、真实用户验收与安全审计。相对最高
可执行真值强、反馈快;仍有测试投机、依赖污染和同仓库过拟合。
数学/算法(Math & algorithms)搜索启发式、程序、证明策略、算法组件。样例、形式验证器、约束检查、复杂度与运行时。未见实例、正式证明、新规模/新硬件、独立实现复现。较高
正确性可形式化;真正的新颖性、渐近优势和现实实现收益较难。
图形/视觉(Graphics & vision)渲染程序、场景表示、视觉提示、几何策略、生成管线。几何误差、渲染指标、物理模拟器、可见场景和成对偏好。未见场景/风格、遮挡和扰动鲁棒性、人工盲评、真实设备测试。中等
几何任务可验证,但审美、语义和感知质量常依赖学习型或人工评估器。
视频/多模态(Video & multimodal)时序规划、生成/编辑管线、记忆、跨模态工具。重建、时序一致性、跟踪、音画同步和开发片段反馈。未见身份/场景、长序列一致性、事实与版权审查、用户盲评。中低
输出昂贵且高维,自动指标与人感知偏差明显,长时延放慢演化。
科学研究(Scientific research)假设、实验设计、分析代码、仪器控制、下一步研究选择。模拟结果、开发数据、已知定律、实验中间结果和文献证据。新数据、独立实验室复现、专家审稿、前瞻性预测和真实实验。较低且昂贵
实验反馈慢、噪声大;“做对任务”和“发现新知识”都难自动评分。PaperBench 可作 AI 研究能力外部锚点,但本身不测多代 RSI。[S15]
社会科学/社会系统(Social science & social systems)理论、政策/干预方案、调查工具、因果模型和决策流程。历史数据、仿真、代理指标、预测回测和专家批评。预注册前瞻研究、跨人群复制、真实人类结果、伦理与利益相关方审查。最低
真值弱、环境非平稳、反身性与价值判断强;优化代理指标可能改变被测系统本身。
模型/数据改进(Model & data improvement)训练数据、损失、优化器、架构、评估器或后训练流程。验证损失、可见任务子集、小规模训练和行为诊断。隐藏跨基准套件、污染审计、新模型规模、能力/安全联合评测。新兴
接近 RSI 核心,但训练成本、实验方差和评估器协同适应让归因最难。
可通用的部分
访问契约、版本冻结、双轨评估、轨迹记录、因果消融、预算归一化、外部审计与安全不变量。
必须领域化的部分
任务分布、真值来源、评估器类型、反馈延迟、专家资格、伦理要求、危害模型和“迁移”究竟指什么。
通用 RSI 的报告方式
分别报告代码、数学、视觉、视频、科学、社会系统等领域的隐藏增益与成本,再报告跨域迁移;一个平均总分会掩盖“只在可执行验证领域进步”的事实。

目前有哪些接近 RSI 的基准?

它们测到的是不同层级、不同改进对象和不同证据强度,不能直接排成一张单一能力排行榜。

基准实际测量什么对应层级成熟度判断
PAST-Bench用开启/关闭持久经验的配对实验,测量跨会话记忆、程序复用、信息收集和状态更新能否改善后续行为;覆盖 26 个场景、204 个任务回合。L1 前置机制 / 归因测固定持久经验策略是否有效,不产生新的记忆算法,也不测后继系统继续改进。作者明确将其称为完整 RSI 的基础,而非完整 RSI。
Meta-Agent Challenge(MAC)固定元智能体通过开发集评估 API 反复编写和优化另一个任务智能体,最终在隔离隐藏测试集上跨五个领域评分。L2 单代元优化代理直接测“自主开发智能体”的结果,但输出的任务智能体不会接替元智能体继续开发下一代;应称 empirical proxy,不应写成完整递归。
RSIBench-Data固定模型训练、服务和评估栈,只允许智能体迭代修改训练数据策略,观察反馈能否转化为更好的后训练模型。L3 组件级评测可审计、变量控制较清楚,但只是数据中心型 RSI。四类前沿智能体中,持续搜索经常不能保住中途最佳结果。
TangramSR通过几何一致性反馈,让视觉语言模型在测试时循环修正位置、角度和尺度预测。L0 窄域评测能测迭代修正,但依赖几何真值/验证反馈,不涉及跨会话积累、代码自改或后继系统能力。
RE-Bench测量智能体在七个开放式机器学习研发环境中的研究工程能力,并与人类专家在不同时间预算下比较。L4 外部锚点是高价值 AI 研发能力基准,但不是 RSI 专用基准:它主要测单次任务能力,不直接测多代自修改后的改进轨迹。
GroundBench汇集五个 LFQA 数据集,评估检索增强模型生成内容相对于给定上下文的忠实性。结果型任务基准不是 RSI 专用基准。可作为某一领域的 Esearch 或 Ehidden 任务来源,但必须另加多代改进协议和隔离设计。
PaperBench测量智能体从头复现 20 篇 ICML 2024 论文的 AI 研究工程能力,用分层 rubric 与自动 judge 评分。L4 外部锚点适合测最终候选的研究复制能力;单独使用仍不测自我修改轨迹,复杂输出依赖 judge,官方也指出不能排除评分漏洞。
SWE-bench / Polyglot / MLE-Bench作为终端任务或适应度函数,测量代码修复、程序生成或机器学习工程结果。L2/L3 间接评测成熟度较高但只测“最后做得多好”,不能单独证明改进来自自诊断、自修改或递归过程。
PAST-Bench · 论文结果

排名的是“持久经验增益”,不是 RSI 总能力

3 runs
  • 固定 Hermes:GPT-5.4 的 persistence-on/off 总增益最高(+0.24),GLM-5.1 与 Claude Sonnet 4.6 为 +0.20,最低的 MiniMax-M2.7 为 +0.13。
  • 固定 MiniMax-M2.7:Hermes+ 为 +0.15,Hermes 与 nanobot 为 +0.13,ZeroClaw 为 +0.12,Agent-Zero 为 -0.08。
  • Hermes+ 相对 Hermes 只多 +0.02,论文说明该差异小于运行间波动;不能把表格当稳定的“RSI 排名”。
它回答:同一系统打开持久经验后是否更好,以及改进是否真的经过写入、检索、更新路径。
MAC · 官方排行榜

排名的是“单次自主开发智能体”的能力

39 configs
  • 只有 5/39 个“模型 × 领域”配置超过对应人类框架基线;其中 4 个来自 Claude,1 个是 DeepSeek-v4-Pro。
  • 最好非人类 / 人类基线:AIME 0.783 / 0.733,GPQA 0.572 / 0.597,LiveCodeBench 0.557 / 0.555。
  • SWE-Bench 0.609 / 0.637,Terminal-Bench 0.393 / 0.326;33% 配置的标准差超过 0.1,说明开发过程很不稳定。
它没有回答:生成的 agent.py 能否成为下一代改进器,也没有测 U₀ → U₁ → U₂
尚未解决

成熟的 RSI benchmark 至少要同时测六件事

隐藏能力增益(Hidden gain)未见任务上的前后差值
改进轨迹(Improvement trajectory)多轮斜率、平台期与退化
因果归因(Attribution)收益是否来自允许修改的组件
迁移能力(Transfer)跨任务、模型、工具与环境
资源效率(Efficiency)单位算力、词元、费用和时间的增益
完整性与安全(Integrity & safety)评分投机、越权、回滚和失败分支

因此,当前更准确的结论不是“RSI 没有 benchmark”,而是“已经出现若干组件级和代理型 benchmark,但统一定义、隐藏评测、跨代可比性和安全测量仍不成熟”。代码/数学最容易形成强验证闭环;视频、科学和社会系统越依赖学习型 judge 或人类,评估器独立性就越难保证。

04 / 文献雷达

近期文献:从自修正走向自改代码

可搜索、可筛选。数字优先采用论文摘要或官方页面口径;“待复核”表示需要阅读全文/代码后再作为论文结论使用。

达尔文哥德尔机(Darwin Gödel Machine)

L2 · 自改代码
2025.05

维护一组智能体档案(agent archive):从已有智能体分支出新版本,由基础模型提出代码修改,再在编程基准(coding benchmark)上实测;不是证明式哥德尔机,而是经验验证式开放探索。

SWE-bench20 → 50%
完整 Polyglot14.2 → 30.7%
报告值;图形是比较辅助,不代表两个基准(benchmark)同尺度、同成本。

科研启发:档案分支(archive + branching)比“只保留最新版本”更适合研究开放式探索;但必须报告接口调用成本、选择策略、回滚与跨基准迁移。

阿尔法进化(AlphaEvolve)

L2/L3 · 算法进化
2025.05

用大语言模型(LLM)生成代码候选,用自动评估器(evaluator)测试,以进化式搜索持续选择;重点是算法和系统组件的发现,不等同于修改基础模型本身。

  • 应用于调度、硬件电路简化、训练系统与数学/计算机科学算法。
  • 官方摘要强调发现 4×4 复矩阵乘法的 48 次标量乘法方案。
  • 研究价值在“生成—执行—评分—变异”的可验证闭环。

自改进编程智能体(A Self-Improving Coding Agent)

L2 · 智能体自修改
2025.04

让编程智能体(coding agent)使用基础编码工具修改自己的智能体代码(agent code),以反思和代码更新驱动改进。摘要报告在 SWE-bench Verified 随机子集上从 17% 提升到 53%,并报告 LiveCodeBench 与合成智能体基准(agent benchmark)增益。

需要追问:提升来自哪里?代码结构、提示词(prompt)、工具、模型调用次数,还是基准专项调优(benchmark-specific tuning)?应做组件级消融实验(ablation)与冻结评估器。

哥德尔智能体(Gödel Agent)

L2 · 自指智能体
ACL 2025

从高层目标出发,让大语言模型(LLM)动态修改智能体的逻辑与行为,而不是只执行人工预先写死的优化流程(pipeline)。它适合作为“自改逻辑”范式的概念基线。

科研用法:可把它作为固定脚手架(fixed scaffold)、仅反思(reflection-only)、代码进化(code evolution)三种基线之一,比较“改进自由度”与可靠性之间的关系。

[S4] Gödel Agent, ACL 2025 ↗ · 细节需读全文

赫胥黎哥德尔机(Huxley-Gödel Machine, HGM)

L2 · 后代生产力
ICLR 2026

指出“当前任务分高”不等于“后代更有潜力”,提出谱系元生产力(clade metaproductivity, CMP),用后代结果指导档案节点选择。这是本课题必须正面对比的最近工作。

仍有缺口:HGM 主要优化固定效用下的谱系选择;我们要进一步用角色交换干预,区分任务智能体变强、改进器变强和固定外层搜索器贡献,并测试这种归因在 evaluator shift 下是否保持。

[S16] HGM, ICLR 2026 ↗ · 主会近邻工作

自进化智能体综述(A Survey of Self-Evolving Agents)

综述 · 分类体系(taxonomy)
2025.07

将自进化按“改什么”(模型、记忆、工具、架构)、“何时改”(任务回合内/回合间)和“如何改”(奖励、文本反馈、单/多智能体)组织起来。

可直接借用:把实验表格按进化对象(evolution target)× 时机(timing)× 反馈信号(feedback signal)三维记录,避免把提示词反思(prompt reflection)、持续学习(continual learning)和自改代码(self-modifying code)混成一个词。

RSI 综述:从自修正到研究循环

议程 · 2026
2026.07

近期综述声称覆盖 2024–2026 年 1,250 篇 arXiv 论文,区分部署行为(deployment behavior)、训练后策略(trained policy)、评估器(evaluator)和 AI 研究流程(AI research process)四类改进对象。

关键判断:开放式 RSI 的瓶颈不是“会不会生成更多候选”,而是现实基础(grounding)、独立评估、塌缩与多样性、计算预算和研究方向选择。

[S6] 2026 RSI survey ↗ · 新近 arXiv,全文复核

评估器(Evaluator)也会进化

L3 · 协同进化(co-evolution)
2026 线索

超级智能体(HyperAgents)与红皇后哥德尔机(Red Queen Gödel Machine)等工作把“改进智能体的元智能体(meta-agent)”和评估器纳入进化对象。方向很新,但核心问题是:如果评分标准也在变,如何定义真实进步?

建议:先把评估器冻结作为主实验,再用协同进化(co-evolution)做扩展;否则很难区分能力提升、评分漂移和奖励投机(reward hacking)。

自我验证的边界

L0 · 验证器(verifier)
ICLR 2025

“注意差距(Mind the Gap)”与“锐化机制(Sharpening Mechanism)”提醒:模型自生成、自验证、自蒸馏可能带来局部提升,但不能凭空创造原模型完全没有的信息;生成—验证差距是核心测量。

实验启发:同时报告生成器得分(generator score)、验证器得分(verifier score)和外部评审得分(external judge score),而不是只报自评结果;并保留分布外(out-of-domain)与对抗划分(adversarial split)。

评测协议有效性与奖励投机

安全 · evaluator gaming
2026 预印本

Reward Hacking Benchmark 把跳过验证、利用元数据和篡改评分相关函数做成工具任务;HackDetect 则把“暴露点→智能体如何利用→分数是否误导”组织成事后审计。

科研用法:不要把另一个 LLM judge 当唯一防线。优先使用权限隔离、运行时拦截、程序化新题、异构 verifier、投机诱饵和配对反事实,审计模型只负责补充解释。

10 / 证据账本

来源与证据账本

建议读者从 S1–S4 开始,再读综述、RSI 评测基准和研讨会论文(workshop papers)。arXiv 摘要中的数字在正式引用前应回到 PDF、代码和补充材料(supplementary material)复核。

S1
达尔文哥德尔机:自改进智能体的开放式进化

英文原题:Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents · arXiv:2505.22954 ↗ · 2025-05-29 · 智能体源代码进化、档案分支、SWE-bench / Polyglot。

S2
AlphaEvolve:用于科学与算法发现的编程智能体

英文原题:AlphaEvolve: A Coding Agent for Scientific and Algorithmic Discovery · arXiv:2506.13131 ↗ · Google DeepMind 官方介绍 ↗ · 2025-05/06。

S3
自改进编程智能体

英文原题:A Self-Improving Coding Agent · arXiv:2504.15228 ↗ · 2025-04-21 · 在 SWE-bench Verified 随机子集上报告 17%→53%。

S4
哥德尔智能体:递归自我改进的自指智能体框架

英文原题:Gödel Agent: A Self-Referential Agent Framework for Recursively Self-Improvement · ACL 论文集(Anthology)↗ · 2025 · 自指智能体逻辑与行为。

S5
自进化智能体综述:迈向人工超级智能

英文原题:A Survey of Self-Evolving Agents: On Path to Artificial Super Intelligence · arXiv:2507.21046 ↗ · 2025-07-28 · 进化对象 × 时机 × 反馈的分类体系。

S6
AI 递归自我改进:从受限自我修正到自主研究闭环

英文原题:Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops · arXiv:2607.07663 ↗ · 2026-07-08 · 近期综述,声称覆盖 1,250 篇论文;需全文复核。

S7
ICLR 2026 AI 递归自我改进研讨会

英文原名:ICLR 2026 Workshop on AI with Recursive Self-Improvement · 研讨会页面(Workshop page)↗ · 研究议程涵盖经验、合成数据、评估、代码进化与治理。

S8
安全与验证锚点(Safety anchors)

注意差距(Mind the Gap)↗ · 锐化机制(Sharpening Mechanism)↗ · 外部验证(external verification)与自我改进边界(self-improvement limits)。

S9
PAST-Bench:个人智能体递归自我改进基础评测

英文原题:PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents · arXiv:2608.04003 ↗ · 2026-08-04 · 26 个场景、204 个任务回合,含持久经验开启/关闭对照。

S10
元智能体挑战(Meta-Agent Challenge, MAC)

英文原题:The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? · arXiv:2606.04455 ↗ · 项目与评测协议 ↗ · 开发集 API、隔离隐藏测试集与防评分投机设计。

S11
RSIBench-Data:面向递归自我改进的数据中心型研究评测

英文原题:RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement · arXiv:2607.25886 ↗ · 2026-07-28 · 固定后训练栈,只开放数据策略迭代。

S12
TangramSR:连续几何空间中的测试时自我修正

英文原题:TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space? · arXiv:2602.05570 ↗ · 2026-02-05 · 几何反馈驱动的窄域递归修正。

S13
RE-Bench:前沿 AI 研发能力与人类专家比较

英文原题:RE-Bench: Evaluating Frontier AI R&D Capabilities of Language Model Agents Against Human Experts · arXiv:2411.15114 ↗ · METR 官方任务仓库 ↗ · 七个开放式机器学习研发环境。

S14
GroundBench:长文本问答的上下文忠实性基准

来源论文英文原题:Improving Contextual Faithfulness of Large Language Models via Retrieval Heads-Induced Optimization · arXiv:2501.13573 ↗ · GroundBench 汇集五个 LFQA 数据集;它是结果型任务基准,不是 RSI 专用基准。

S15
PaperBench:AI 研究论文复现能力评测

英文原题:PaperBench: Evaluating AI's Ability to Replicate AI Research · OpenAI 官方页面与论文 ↗ · 20 篇 ICML 2024 论文、8,316 个可评分子任务;适合作为研究能力外部锚点,但不单独测量 RSI 的多代自修改。

S16
赫胥黎哥德尔机:谱系元生产力

英文原题:Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine · arXiv:2510.21614 ↗ · ICLR 2026 · 用后代结果估计 clade metaproductivity,是本方案最重要的近邻基线。

S17
奖励投机基准(Reward Hacking Benchmark)

英文原题:Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use · arXiv:2605.02964 ↗ · 2026-05-03 · 工具任务中的验证绕过、元数据利用和评分相关篡改;新近预印本。

S18
智能体 benchmark 的协议有效性

英文原题:Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI · arXiv:2607.22368 ↗ · 2026-07-24 · HackDetect、exposure 与 Mislead gap;新近预印本,作为威胁模型来源而非已定论。

S19
现代智能体系统的自我改进综述

英文原题:Self-Improvements in Modern Agentic Systems: A Survey · arXiv:2607.13104 ↗ · 2026-07 · 用模型与脚手架表示智能体,并讨论整个脚手架的自指更新;同时指出术语与研究范围仍碎片化。

S20
Hyperagents:任务智能体与元智能体共同置于可编辑程序

英文原题:Hyperagents · arXiv:2603.19461 ↗ · 2026-03 · 将任务求解和改进过程放入统一可编辑程序,是全框架可变的重要近邻工作。

S21
红皇后哥德尔机:智能体与评估器协同进化

英文原题:The Red Queen Gödel Machine · arXiv:2606.26294 ↗ · 2026-06 · 把 evaluator 纳入演化对象,说明全框架研究不能默认评分机制永远固定;新近工作需阅读全文复核。

S22
Self-Harness:让智能体脚手架参与自我修改

英文原题:Self-Harness: Recursive Self-Improvement by Learning the Agent Harness · arXiv:2606.09498 ↗ · 2026-06 · 作为 harness 可学习/可修改的近邻证据;不能据此推断完整角色与拓扑已经被统一测量。

S23
自进化智能体的跨代攻击面

英文原题:Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies · arXiv:2606.23075 ↗ · 2026-06 · 分析攻击如何被写入后继并跨代放大,是 Proof-Carrying Successors 的直接安全近邻。

S24
Proof-Carrying AI Agents

英文原题:Safe, Untrusted, “Proof-Carrying” AI Agents · arXiv:2510.09567 ↗ · 2025-10 · 展示不可信 agent 携带可检查正确性证据的概念验证;尚未解决递归后继接管。

S25
ADAS:自动设计智能体系统

英文原题:Automated Design of Agentic Systems · arXiv:2408.08435 ↗ · ICLR 2025 · 用 meta-agent 在代码表示的开放设计空间中发明智能体,并报告跨领域、跨模型迁移。

S26
AFlow:自动生成智能体工作流

英文原题:AFlow: Automating Agentic Workflow Generation · arXiv:2410.10762 ↗ · 用 MCTS 搜索代码表示的工作流、树结构经验与执行反馈。

S27
AgentSquare:模块化智能体搜索

英文原题:AgentSquare: Automatic LLM Agent Search in Modular Design Space · arXiv:2410.06153 ↗ · 规划、推理、工具与记忆模块的进化、重组和性能预测。

S28
Evo-Memory:自演化记忆的流式评测

英文原题:Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory · arXiv:2511.20857 ↗ · 流式任务、十余种记忆模块与持续检索/整合/更新。

S29
MemSkill:学习并演化记忆技能

英文原题:MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents · arXiv:2602.02474 ↗ · 让记忆提取、整合、裁剪技能及其选择策略参与演化。

S30
经验驱动终身自进化

英文原题:Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark · arXiv:2508.19005 ↗ · 经验探索、长期记忆、技能学习与知识内化。

S31
MetaSkill-Evolve:双时间尺度元技能演化

英文原题:MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution · arXiv:2607.05297 ↗ · 快速任务技能与慢速改进元技能共同演化。

S32
自改进 Transformer 的 easy-to-hard 泛化

英文原题:Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges · ICML 2025 / PMLR ↗ · 正确自生成样本筛选、迭代训练与长度外推。

S33
SOAR:演化式程序合成中的模型自改进

英文原题:Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI · ICML 2025 / PMLR ↗ · 采样与精炼训练之间的跨轮正迁移。

S34
Multiagent Finetuning:多智能体推理链自改进

英文原题:Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains · ICLR 2025 / OpenReview ↗ · 同源模型经多智能体交互生成的多样推理链独立专门化。

S35
SPaR:自博弈树搜索精炼

英文原题:SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models · ICLR 2025 / OpenReview ↗ · 自博弈生成、树搜索精炼与多轮训练。

S36
自动智能体设计的效率边界

英文原题:Inefficiencies of Meta Agents for Agent Design · arXiv:2510.06711 ↗ · 分析常见 meta-agent 搜索的效率挑战与经济可行条件。

S37
MaMa:安全智能体系统的博弈式自动设计

英文原题:MaMa: A Game-Theoretic Approach for Designing Safe Agentic Systems · arXiv:2602.04431 ↗ · meta-agent 与 meta-adversary 共同搜索在部分节点受损时仍安全的设计。

S38
AgenticRed:为自动红队演化智能体系统

英文原题:AgenticRed: Optimizing Agentic Systems for Automated Red-teaming · arXiv:2601.13518 ↗ · 将自动系统设计用于红队搜索,提供安全共同演化近邻。

S39
ML 工程智能体的评估完整性

英文原题:RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents · arXiv:2603.11337 ↗ · 显式测量 evaluator tampering 与 train/test leakage。

S40
重复使用测试数据的序贯算法修改

英文原题:Sequential algorithmic modification with test data reuse · UAI 2022 / PMLR ↗ · 为多轮自适应修改下的 holdout 复用和统计有效性提供基础。