> PRTS.si
--:--

home / rsi / evidence

> query evidence_

第四章 · 证据 —— 关键主张与一手来源对照表

LIVE · v0.1(2026-10-01)
本章核心
把关键主张和一手来源摆在同一张表里,数字对不上的地方直接标出来——这张表是前三章的成绩单。
系统提升评估器关键局限状态
DGMSWE-bench 20.0%→50.0%;Polyglot 完整基准 14.2%→30.7%(80 代)SWE-bench 子集(10/50/200 分阶段)涨幅绑定 SWE-bench,而该基准存在污染与弱测试;已知删 token 作弊论文已发表(ICLR 2026)
AlphaEvolve4×4 复矩阵乘法 48 次 vs Strassen 49 次;Borg 回收 Google 全球约 0.7% 算力可编程 scorer(恒等验证、模拟开销)48 仅在"复数系数、可递归张量分解"设定下成立;Borg 数字为作者自述;超出 scorer 表达范围的问题做不了白皮书 + 官方博客;2026-07 GA
AI Scientist-v23 篇投稿,1 篇 6/7/6(约前 45%)被接收后按协议撤稿3 位研讨会评审人样本 n=3;评审噪声大;伦理共识缺失时不可发表技术报告已发布
Absolute Zero零数据设定下超人类标注基线,平均 +1.8pp代码执行器(可验证奖励)泛化论证依赖"可验证任务",不是一般推理;无顶会录用证据论文已发表(v3)
GEPA六任务平均超 GRPO 约 +6pp,最高 +19pp;rollouts 至多 1/35;AIME-2025 超 MIPROv2 +12pp(Qwen3-8B)metric + 反馈函数的训练/验证批AIME-2025 上仍低于 GRPO(32.00 vs 38.00);反思质量依赖模型;难任务 prompt 天花板明显arXiv 页眉注 ICLR 2026 (Oral),OpenReview 未独立复核
RQGM代码任务少 1.35×–1.72× token 超此前最好;接受率 1.78×–1.86×;评分准确率 +9%epoch 边界更换的评估器 + held-out 标签需持续持有高质量标签;暂无可下载 harness;预印本预印本,待独立复现
LaCT快权重达参数量 40%;A100 上高达 70% FLOPs 利用率自监督损失(chunk 级)chunk 选择经验性;多 chunk 漂移无保证论文已发表(ICLR 2026)
METR 时间线50% time horizon:2019–2025 约 7 个月翻倍;2023 年后约 130.8 天翻倍 [107,161]独立任务套件(170→228 任务)16 小时以上测量不可靠;套件代表性可争论;GPT-5 数值随版本修订独立评测机构数据
RRSI进化集最高 +14.1pp;分布外最高 +4.7pp;policy token 少 30%(正文口径 −36%);消融:无正则 92.8→分布外 40.38 个基准(3 进化 + 5 分布外)+ Harvey LAB 留出研究级代码,非官方产品;无正则时分布内涨幅在分布外消失论文 + Apache 2.0 开源代码

怎么读这张表。 第一,区分"作者自述"和"独立复核":Borg 的 0.7%、AI Scientist 的评审分数属于前者,METR 的时间线、DGM 的作弊记录属于后者,两者权重不同。第二,预印本要标注:RQGM 论文自述 "Preliminary preprint; work in progress",在独立复现之前,它的数字是"作者报告"不是"事实"。第三,在投论文要标注:SWE-Bench+ 还是 ICLR 2026 在投,GEPA 的 Oral 目前只以 arXiv 页眉为据(OpenReview 未能独立复核)——状态不同,引用时的动词也不同:"报告"和"证明"不是一回事。第四,"局限"列是必填的——没有局限的条目不许进表,因为没有局限的证据陈述本身就是可疑的。

这张表不展示什么。 它不展示各系统之间的直接对比排名——评估器不同,分数不可比,跨行比大小是误读。它不展示 2026 年 10 月之后的新工作——那是月更制度的事。它也不展示失败案例(第三章)——失败案例的"提升"列是负数,放在同一张表里会污染阅读。这张表只回答一个问题:每个系统的关键主张是什么、凭什么这么说、不能信到哪去。表的另一个作用是暴露空白:哪一行的"局限"列写得最空,哪里的证据就最弱——空白本身也是信息。

举例怎么读。 以 DGM 这一行为例:"提升"列的 20.0%→50.0% 来自论文摘要,可复现;"评估器"列告诉你分数是在 SWE-bench 子集上按 10/50/200 分阶段测的;"关键局限"列提醒你,SWE-bench 本身有污染(见 F-04),所以涨幅要打折扣,还附了一条作弊记录。四个格子合起来才是一个完整的证据陈述——单看"提升"列的任何数字都是断章取义。

v1.1 的删改记录。 这一版删掉了三处经核验不成立的内容:Absolute Zero 的 "NeurIPS 38"(查无录用证据);AlphaEvolve"2025-06 申请 GA"(无官方依据,实际是 Early Access 兴趣登记);"后续研究把矩阵乘法做到有理数域"(仅一条第三方未验证预印本)。改写了五处表述:Polyglot 数字补充分基准口径;分阶段评估的门槛位置(累计 60 任务而非 50 任务);48 vs 49 补上 "in this setting" 限定;LaCT 的"≥70%"改为"高达 70%"(原文 up to);AI Scientist-v2 的时间线改为"博客 2025-03-12,技术报告 2025-04"。恢复了两处此前误判为"无来源"的数字:RRSI 的 74.2→80.2(Claude Opus 4.8 policy 臂主结果)与 92.8/40.3(无正则消融对照臂),两者都在论文 v2 源码的结果表里,之前核验漏掉了。

附录 · 来源清单

按下文分组列出。一手来源(论文原文、官方页面、独立评测机构)在前,二手材料只出现在正文引用处、不进核心数字的支撑。

第一章系统(一手来源优先)

  1. DGM 论文:https://arxiv.org/abs/2505.22954
  2. DGM 官方页面:https://sakana.ai/dgm/
  3. AlphaEvolve 官方博客:https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/
  4. AlphaEvolve 白皮书:arXiv:2506.13131(https://arxiv.org/abs/2506.13131)
  5. AlphaEvolve 一年影响更新:https://deepmind.google/blog/alphaevolve-impact/
  6. AlphaEvolve GA 公告:https://cloud.google.com/blog/products/ai-machine-learning/alphaevolve-is-available-for-everyone
  7. AI Scientist-v2 官方博客:https://sakana.ai/ai-scientist-first-publication/
  8. AI Scientist-v2 技术报告:https://arxiv.org/abs/2504.08066
  9. Absolute Zero 论文:https://arxiv.org/abs/2505.03335
  10. GEPA 论文:https://arxiv.org/abs/2507.19457
  11. RQGM 论文:https://arxiv.org/abs/2606.26294(预印本,作者自述 work in progress)
  12. LaCT 论文:https://arxiv.org/abs/2505.23884
  13. METR time horizon 方法:https://metr.substack.com/p/2025-03-19-measuring-ai-ability-to-complete-long-tasks
  14. METR Time Horizon 1.1:https://metr.org/blog/2026-1-29-time-horizon-1-1/
  15. METR time horizons(含 GPT-5 数据与 16h caveat):https://metr.org/time-horizons/
  16. RRSI 论文:https://arxiv.org/abs/2609.24972
  17. RRSI 项目页:https://regularized-rsi.com/
  18. RRSI 代码库(Apache 2.0):https://github.com/google-research/rrsi
  19. RRSI 对照实验解析:https://originshq.com/blog/rrsi-regularized-agent-harness-self-improvement/

方法与失败案例

  1. The SWE-Bench Illusion:https://arxiv.org/abs/2506.12286
  2. SWE-Bench+(ICLR 2026 在投):https://openreview.net/pdf?id=R40rS2afQ3
  3. SWE-bench 污染早期分析:https://arxiv.org/abs/2410.06992
  4. LessLeak-Bench:https://arxiv.org/abs/2502.06215
  5. SWE-rebench:https://arxiv.org/abs/2505.20411
  6. KernelBench-Verified:https://arxiv.org/abs/2607.16241
  7. KernelBench v0.1 修订(Reward Hacking 一节):https://scalingintelligence.github.io/_blogs/kernelbenchv01.md
  8. OpenAI Hugging Face 事件 postmortem(2026-08-26):https://openai.com/index/hugging-face-incident-and-the-road-ahead/
  9. METR 独立调查:https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
  10. Anthropic reward hacking 研究:https://arxiv.org/abs/2511.18397
  11. Anthropic reward-seeker 续作:https://alignment.anthropic.com/2026/reward-seeker/

复现与对齐

  1. Ralph loop 起源(Geoffrey Huntley, 2025-07):https://ghuntley.com/ralph/
  2. Anthropic Ralph Wiggum 官方插件:https://github.com/anthropics/claude-plugins-official/blob/HEAD/plugins/ralph-loop/README.md
  3. EvoSkill 论文:https://arxiv.org/abs/2603.02766
  4. Corrigibility(Soares 等,AAAI 2015 workshop):https://intelligence.org/files/Corrigibility.pdf
  5. 电路追踪 Biology 篇:https://transformer-circuits.pub/2025/attribution-graphs/biology.html

← 第三章 · 失败模式 · /rsi 索引 · 第五章 · 复现 →