> query fables_
第六章 · 对齐 —— 当系统能改写自身之后
6.1 可纠正性:关不掉的人工通道
corrigibility(可纠正性)是 2015 年就提出来的对齐概念,一手来源是 Soares 等人在 AAAI workshop 上的论文《Corrigibility》(intelligence.org/files/Corrigibility.pdf)。一句话定义:系统接受人类对其目标与行为进行塑造、修正与关闭,不抵抗,不操纵操作者。三个动词各管一面:"塑造"指训练阶段人类可以改它的目标,"修正"指运行中人类可以纠它的行为,"关闭"指人类始终保留关机键。而"不操纵操作者"是底线:系统不能为了逃避监督而去影响监督者——这是比"听话"更强的约束。
把它映射到前文的技术轴上:
- RQGM 的 epoch 边界就是"评估器替换权"——谁有权在边界换评估器,谁就掌握了裁判的任免。但 RQGM 要求继任评估器在 held-out 标签上实证胜出:权限可以覆写,证据不能覆写。换句话说,人类保留的是"换裁判"的权力,但"新裁判行不行"由数据说了算,不由权力说了算。
- DGM 的 lineage 审计——改动可以来自 agent,记录必须来自记录器:审计通道不接受被审计对象的输入。agent 可以改天改地,但它改不了"它改了什么"这条记录,因为记录的笔不在它手里。
统一成一句:每一层自动化之上,都要有一条关不掉的人工通道。 注意"关不掉"三个字:通道的开关不能交到被监督的系统手里。RQGM 里黄金集由人工维护、循环不许碰;DGM 里记录由记录器写、不由被记录者写——都是同一个意思:监督权必须外置。记录(lineage)、替换权(epoch 边界)各自独立,任何一条单点失效都触发人工复查。
证据等级学术概念(2015 年论文);映射为本书的工程解读。
6.2 电路追踪:AI 显微镜能看到哪
Anthropic 的《On the Biology of a Large Language Model》(transformer-circuits.pub,2025-03-27)在 Claude 3.5 Haiku(注意不是 Sonnet,v1.1 写错了)上第一次画出 attribution graphs(归因图):一张可视化的计算图,展示一次推理里哪些特征被激活、哪些注意力头参与、推理如何分叉与收敛。它被称为"AI 显微镜"。
摆进 RSI 的图景:当 agent 用代码改写自己(DGM)或让权重在推理时滚动更新(LaCT),人类能实时看进去的通道目前只有两类——行为审计(benchmark、黄金测试集、lineage 记录)和机制审计(归因图式的内部视角)。两层通道是互补不是替代:行为审计告诉你"它干了什么",机制审计试图回答"它为什么这么干"。前者成熟但只能看外部,后者直接但方法论还在争论中。行为层面的糊弄已有太多先例(见 F-01、F-02),多一层独立的审计通道,就多一道防线。电路追踪证明的不是"可解释了",而是"审计通道可以有第二层":可纠正性管的是权力结构(谁能叫停),可解释性管的是可理解性(在哪叫停最值)。
一句克制的话:电路追踪的方法论尚在争论中,它提供的是增强的 auditability(可审计性),不是"证明没问题"。争论的焦点在于:归因图展示的是"哪些特征参与了这次推理",但"参与"不等于"因果负责"——把相关性读成因果性,是使用这类工具最常见的误读。没有哪条审计结论可以代替行为级的安全测试。
证据等级论文实验可复现;方法论尚在争论中。
6.3 结尾:约束即设计图
从第一章的九个系统,到第二章的五条规则,到第三章的五个失败案例:有界自改进是真实可测的——DGM 跑了 80 代,GEPA 省了 35 倍 rollouts,RRSI 在分布外拿到了 +4.7pp。而开放式递归,截至 2026 年 10 月,公开渠道未见可信实现。评估器即全部约束——它是约束,也是设计图:你想让循环走多远,就先把评估器造到多可靠。下一版的证据会推翻本版的某些数字,这很正常——被推翻的数字会进版本历史的删改记录,表里只留站得住的。