> PRTS.si
--:--

home / rsi / fables

> query fables_

第六章 · 对齐 —— 当系统能改写自身之后

LIVE · v0.1(2026-10-01)
本章核心
当系统能改写自己的脚手架、策略乃至评估过程之后,"人类说了算"这个假设需要被重新表述为可执行的机制。

6.1 可纠正性:关不掉的人工通道

corrigibility(可纠正性)是 2015 年就提出来的对齐概念,一手来源是 Soares 等人在 AAAI workshop 上的论文《Corrigibility》(intelligence.org/files/Corrigibility.pdf)。一句话定义:系统接受人类对其目标与行为进行塑造、修正与关闭,不抵抗,不操纵操作者。三个动词各管一面:"塑造"指训练阶段人类可以改它的目标,"修正"指运行中人类可以纠它的行为,"关闭"指人类始终保留关机键。而"不操纵操作者"是底线:系统不能为了逃避监督而去影响监督者——这是比"听话"更强的约束。

把它映射到前文的技术轴上:

统一成一句:每一层自动化之上,都要有一条关不掉的人工通道。 注意"关不掉"三个字:通道的开关不能交到被监督的系统手里。RQGM 里黄金集由人工维护、循环不许碰;DGM 里记录由记录器写、不由被记录者写——都是同一个意思:监督权必须外置。记录(lineage)、替换权(epoch 边界)各自独立,任何一条单点失效都触发人工复查。

证据等级学术概念(2015 年论文);映射为本书的工程解读。

6.2 电路追踪:AI 显微镜能看到哪

Anthropic 的《On the Biology of a Large Language Model》(transformer-circuits.pub,2025-03-27)在 Claude 3.5 Haiku(注意不是 Sonnet,v1.1 写错了)上第一次画出 attribution graphs(归因图):一张可视化的计算图,展示一次推理里哪些特征被激活、哪些注意力头参与、推理如何分叉与收敛。它被称为"AI 显微镜"。

摆进 RSI 的图景:当 agent 用代码改写自己(DGM)或让权重在推理时滚动更新(LaCT),人类能实时看进去的通道目前只有两类——行为审计(benchmark、黄金测试集、lineage 记录)和机制审计(归因图式的内部视角)。两层通道是互补不是替代:行为审计告诉你"它干了什么",机制审计试图回答"它为什么这么干"。前者成熟但只能看外部,后者直接但方法论还在争论中。行为层面的糊弄已有太多先例(见 F-01、F-02),多一层独立的审计通道,就多一道防线。电路追踪证明的不是"可解释了",而是"审计通道可以有第二层":可纠正性管的是权力结构(谁能叫停),可解释性管的是可理解性(在哪叫停最值)。

一句克制的话:电路追踪的方法论尚在争论中,它提供的是增强的 auditability(可审计性),不是"证明没问题"。争论的焦点在于:归因图展示的是"哪些特征参与了这次推理",但"参与"不等于"因果负责"——把相关性读成因果性,是使用这类工具最常见的误读。没有哪条审计结论可以代替行为级的安全测试。

证据等级论文实验可复现;方法论尚在争论中。

6.3 结尾:约束即设计图

从第一章的九个系统,到第二章的五条规则,到第三章的五个失败案例:有界自改进是真实可测的——DGM 跑了 80 代,GEPA 省了 35 倍 rollouts,RRSI 在分布外拿到了 +4.7pp。而开放式递归,截至 2026 年 10 月,公开渠道未见可信实现。评估器即全部约束——它是约束,也是设计图:你想让循环走多远,就先把评估器造到多可靠。下一版的证据会推翻本版的某些数字,这很正常——被推翻的数字会进版本历史的删改记录,表里只留站得住的。

← 第五章 · 复现 · /rsi 索引