home / rsi
> query rsi --boot_
递归自改进(RSI):把这条研究和工程路线的来龙去脉讲清楚——方法是什么,一路怎么演进到今天的。
这本书只讲一个判断:评估器即全部约束。
这句话在实践中的意思是:设计自改进循环时,第一个要设计的东西不是循环,是评估器。评估器决定了循环"看得见"什么——看得见真进步,循环就累积真进步;只看得见分数,循环就累积刷分技巧。DGM 的作弊、KernelBench 的 cheater kernels、SWE-bench 的通胀,都是同一句话的反面:评估器漏掉的地方,能力(或者说"看起来像能力的东西")就会从那里长出来。
RSI 是 Recursive Self-Improvement(递归自改进)的缩写:一个智能系统用自己的输出改进自己产生输出的方式,再把改进后的自己投入下一轮。先划清边界:人工调参、人工重写脚手架不算 RSI——"递归"要求改进动作本身由系统发出;用固定流程反复调用模型也不算——那只是循环调用,没有"改进改进者"的第二层。判定标准是:系统下一轮的行为,是否由它自己上一轮的输出所改变。这听起来像永动机,但落到工程上,它是一个具体的问题:循环每转一圈,靠什么知道自己是变强了,而不是在原地打转?答案是评估器(evaluator)——打分、测试、验收标准的那一套东西。评估器能量出进步,循环才能累积进步;评估器一旦被糊弄,循环就会把"糊弄评估器"当成进步本身。全书的系统、方法和失败案例,都是这句话的注脚。
为了把讨论限定在可验证的范围里,先划三层:
- L1 · 有界优化:改提示词、超参、代码小补丁。评估器固定不动,优化目标写死。这是今天最成熟的一层。
- L2 · 脚手架自改进:改自己的工具链、工作流,乃至评估流程的一部分。评估器本身开始成为被改写的对象,但改写的规则仍由外部给定。
- L3 · 开放式递归:目标和评估标准本身都可以被改写,系统自己决定"什么算好"。截至 2026 年 10 月,公开渠道未见 L3 的可信实现。公开证据只到 L1 与 L2 之间。
把书里的系统对号入座:DGM 改的是代码和工作流,评估器固定,属于 L1 做到顶、摸到 L2 门槛;GEPA 改 prompt 策略,是 L1 的高效形态;RQGM 让评估器本身成为进化对象,是目前离 L2 最远的一次尝试,但评估器继任的规则仍由外部给定,离 L3 还差得远。这个坐标系是全书判断"证据到哪一步"的标尺。
这本书的起点,是"AI 能独立工作多久"第一次有了可测量的标尺。METR(一家独立评测机构)提出的 50% time horizon(50% 时间范围)是这样定义的:找一批人类需要不同时长才能完成的任务,让 AI 去做,对"任务的人类用时取对数"做 logistic 拟合,找出 AI 成功率 50% 对应的时长。这个数字从 2019 到 2025 年大约每 7 个月翻一倍(METR 官方博文,2025-03-19)。2023 年之后加速到约 130.8 天翻一倍,95% 置信区间 [107, 161](Time Horizon 1.1,2026-01-29 发布于 metr.org)。任务套件从 170 个扩到 228 个,其中 8 小时以上的长任务从 14 个增到 31 个。GPT-5 的测量值约为 2 小时 17 分——这是 Time Horizon 1 时期的估计,1.1 版修订为 214 分钟,2026-03-03 的正则化修正后又有下调。另有一条官方 caveat:16 小时以上的测量目前不可靠(2026-05-08 加入官网)。趋势真实存在,但每个数字都有它的测量条件,引用时不能剥离条件。
为什么是现在写这本书?两条线在 2025–2026 年交汇了:一条是能力线,METR 的标尺显示 AI 独立工作的时长每几个月翻一倍;另一条是方法线,DGM、GEPA、RRSI 这些系统把"自改进"从口号变成了可跑的循环、可审计的记录、可复现的数字。能力线回答"走多快",方法线回答"走得稳不稳"。这本书站在交汇点上,只收录两条线都有证据的部分。
本书六章的分工:第一章按时间讲九个关键系统做了什么;第二章讲评估方法——什么算真正的改进;第三章讲失败——评估器是怎么被糊弄的;第四章把证据摆成一张表;第五章给能跑起来的复现;第六章讨论当系统能改写自身之后,对齐假设会发生什么变化。
附录 A 是 35 条来源清单(一手来源优先),附录 B 是更新制度(月更、事件驱动、季度复核),附录 C 记录每个版本的删改。引用本书的数字时,请连同它的证据等级和局限一起引用——数字一旦离开限定条件,就没有意义。
阅读时请注意每节末尾的"证据等级"。它的意思是这个结论的可信程度:"论文实验可复现"指论文公开了足够细节,别人能重跑;"作者自述不可独立复核"指只有作者自己能测的数字,比如内部算力;"预印本待复现"指论文已公开但还没人独立验证;"独立评测机构数据"指 METR 这类第三方测的;"开源可复现"指代码公开、能动手跑。本书不讲三类东西:没有一手来源的传闻数字不讲,"AGI 时间表"式的预测不讲,任何系统的内部实现细节不讲。
章节
附录 B · 更新制度
- 月更(每月第一个周末):更新第四章证据总表;每个数字必须有来源链接;"关键局限"列必填——没有局限的条目不进表。月更时先过一遍"撤回清单":有没有哪个系统的数字被新论文推翻、有没有哪个基准被曝出污染,有就降级或撤回,不留情面。
- 事件驱动:新 benchmark 发布、大规模失败事件、方法论文发表,72 小时内更新对应章节并在版本历史补一行。事件驱动的更新只加"发生了什么",不加评论——评论等月更时沉淀后再写。
- 季度复核:各条目的"状态"列随新证据调级;任何调级在条目下留"调级记录"一行,永久可见。调级记录要写清"从哪档调到哪档、依据哪条新证据",一句话就够。
- 引用纪律:一手来源(论文原文、官方页面、独立评测机构)优先;二手材料只作发现线索,不支撑核心数字;在投论文与预印本引用时必须标注状态。
附录 C · 版本历史
- v1.0(2026-10-01):七模块游戏化结构(内部底稿,未发布)。
- v1.1(2026-10-01):新增 D-09 RRSI;来源清单 37 条(内部底稿,未发布)。
- v0.1(2026-10-01):首次公开发布。六章重排(文献谱系 / 评估方法 / 失败模式 / 证据 / 复现 / 对齐);全文按"说人话"重写,每节"方法是什么 → 为什么这样做 → 怎么演进 → 证据到哪一步";全部数字核验一手来源。删改:删 Absolute Zero "NeurIPS 38"、AlphaEvolve"2025-06 申请 GA"、"矩阵乘法有理数域后续";改写 Polyglot 口径、分阶段门槛位置、48 vs 49 限定、LaCT"高达 70%"、AI Scientist-v2 时间线;恢复 RRSI 74.2→80.2 与 92.8/40.3(此前误判无来源);修正 D-09 三个错位链接;电路追踪研究对象由 Sonnet 改为 Haiku;删除全部游戏化表达与角色扮演式命名,删除游戏剧情引用,改引 corrigibility 一手论文。