> query evidence_
第四章 · 证据 —— 关键主张与一手来源对照表
| 系统 | 提升 | 评估器 | 关键局限 | 状态 |
|---|---|---|---|---|
| DGM | SWE-bench 20.0%→50.0%;Polyglot 完整基准 14.2%→30.7%(80 代) | SWE-bench 子集(10/50/200 分阶段) | 涨幅绑定 SWE-bench,而该基准存在污染与弱测试;已知删 token 作弊 | 论文已发表(ICLR 2026) |
| AlphaEvolve | 4×4 复矩阵乘法 48 次 vs Strassen 49 次;Borg 回收 Google 全球约 0.7% 算力 | 可编程 scorer(恒等验证、模拟开销) | 48 仅在"复数系数、可递归张量分解"设定下成立;Borg 数字为作者自述;超出 scorer 表达范围的问题做不了 | 白皮书 + 官方博客;2026-07 GA |
| AI Scientist-v2 | 3 篇投稿,1 篇 6/7/6(约前 45%)被接收后按协议撤稿 | 3 位研讨会评审人 | 样本 n=3;评审噪声大;伦理共识缺失时不可发表 | 技术报告已发布 |
| Absolute Zero | 零数据设定下超人类标注基线,平均 +1.8pp | 代码执行器(可验证奖励) | 泛化论证依赖"可验证任务",不是一般推理;无顶会录用证据 | 论文已发表(v3) |
| GEPA | 六任务平均超 GRPO 约 +6pp,最高 +19pp;rollouts 至多 1/35;AIME-2025 超 MIPROv2 +12pp(Qwen3-8B) | metric + 反馈函数的训练/验证批 | AIME-2025 上仍低于 GRPO(32.00 vs 38.00);反思质量依赖模型;难任务 prompt 天花板明显 | arXiv 页眉注 ICLR 2026 (Oral),OpenReview 未独立复核 |
| RQGM | 代码任务少 1.35×–1.72× token 超此前最好;接受率 1.78×–1.86×;评分准确率 +9% | epoch 边界更换的评估器 + held-out 标签 | 需持续持有高质量标签;暂无可下载 harness;预印本 | 预印本,待独立复现 |
| LaCT | 快权重达参数量 40%;A100 上高达 70% FLOPs 利用率 | 自监督损失(chunk 级) | chunk 选择经验性;多 chunk 漂移无保证 | 论文已发表(ICLR 2026) |
| METR 时间线 | 50% time horizon:2019–2025 约 7 个月翻倍;2023 年后约 130.8 天翻倍 [107,161] | 独立任务套件(170→228 任务) | 16 小时以上测量不可靠;套件代表性可争论;GPT-5 数值随版本修订 | 独立评测机构数据 |
| RRSI | 进化集最高 +14.1pp;分布外最高 +4.7pp;policy token 少 30%(正文口径 −36%);消融:无正则 92.8→分布外 40.3 | 8 个基准(3 进化 + 5 分布外)+ Harvey LAB 留出 | 研究级代码,非官方产品;无正则时分布内涨幅在分布外消失 | 论文 + Apache 2.0 开源代码 |
怎么读这张表。 第一,区分"作者自述"和"独立复核":Borg 的 0.7%、AI Scientist 的评审分数属于前者,METR 的时间线、DGM 的作弊记录属于后者,两者权重不同。第二,预印本要标注:RQGM 论文自述 "Preliminary preprint; work in progress",在独立复现之前,它的数字是"作者报告"不是"事实"。第三,在投论文要标注:SWE-Bench+ 还是 ICLR 2026 在投,GEPA 的 Oral 目前只以 arXiv 页眉为据(OpenReview 未能独立复核)——状态不同,引用时的动词也不同:"报告"和"证明"不是一回事。第四,"局限"列是必填的——没有局限的条目不许进表,因为没有局限的证据陈述本身就是可疑的。
这张表不展示什么。 它不展示各系统之间的直接对比排名——评估器不同,分数不可比,跨行比大小是误读。它不展示 2026 年 10 月之后的新工作——那是月更制度的事。它也不展示失败案例(第三章)——失败案例的"提升"列是负数,放在同一张表里会污染阅读。这张表只回答一个问题:每个系统的关键主张是什么、凭什么这么说、不能信到哪去。表的另一个作用是暴露空白:哪一行的"局限"列写得最空,哪里的证据就最弱——空白本身也是信息。
举例怎么读。 以 DGM 这一行为例:"提升"列的 20.0%→50.0% 来自论文摘要,可复现;"评估器"列告诉你分数是在 SWE-bench 子集上按 10/50/200 分阶段测的;"关键局限"列提醒你,SWE-bench 本身有污染(见 F-04),所以涨幅要打折扣,还附了一条作弊记录。四个格子合起来才是一个完整的证据陈述——单看"提升"列的任何数字都是断章取义。
v1.1 的删改记录。 这一版删掉了三处经核验不成立的内容:Absolute Zero 的 "NeurIPS 38"(查无录用证据);AlphaEvolve"2025-06 申请 GA"(无官方依据,实际是 Early Access 兴趣登记);"后续研究把矩阵乘法做到有理数域"(仅一条第三方未验证预印本)。改写了五处表述:Polyglot 数字补充分基准口径;分阶段评估的门槛位置(累计 60 任务而非 50 任务);48 vs 49 补上 "in this setting" 限定;LaCT 的"≥70%"改为"高达 70%"(原文 up to);AI Scientist-v2 的时间线改为"博客 2025-03-12,技术报告 2025-04"。恢复了两处此前误判为"无来源"的数字:RRSI 的 74.2→80.2(Claude Opus 4.8 policy 臂主结果)与 92.8/40.3(无正则消融对照臂),两者都在论文 v2 源码的结果表里,之前核验漏掉了。
附录 · 来源清单
按下文分组列出。一手来源(论文原文、官方页面、独立评测机构)在前,二手材料只出现在正文引用处、不进核心数字的支撑。
第一章系统(一手来源优先)
- DGM 论文:https://arxiv.org/abs/2505.22954
- DGM 官方页面:https://sakana.ai/dgm/
- AlphaEvolve 官方博客:https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/
- AlphaEvolve 白皮书:arXiv:2506.13131(https://arxiv.org/abs/2506.13131)
- AlphaEvolve 一年影响更新:https://deepmind.google/blog/alphaevolve-impact/
- AlphaEvolve GA 公告:https://cloud.google.com/blog/products/ai-machine-learning/alphaevolve-is-available-for-everyone
- AI Scientist-v2 官方博客:https://sakana.ai/ai-scientist-first-publication/
- AI Scientist-v2 技术报告:https://arxiv.org/abs/2504.08066
- Absolute Zero 论文:https://arxiv.org/abs/2505.03335
- GEPA 论文:https://arxiv.org/abs/2507.19457
- RQGM 论文:https://arxiv.org/abs/2606.26294(预印本,作者自述 work in progress)
- LaCT 论文:https://arxiv.org/abs/2505.23884
- METR time horizon 方法:https://metr.substack.com/p/2025-03-19-measuring-ai-ability-to-complete-long-tasks
- METR Time Horizon 1.1:https://metr.org/blog/2026-1-29-time-horizon-1-1/
- METR time horizons(含 GPT-5 数据与 16h caveat):https://metr.org/time-horizons/
- RRSI 论文:https://arxiv.org/abs/2609.24972
- RRSI 项目页:https://regularized-rsi.com/
- RRSI 代码库(Apache 2.0):https://github.com/google-research/rrsi
- RRSI 对照实验解析:https://originshq.com/blog/rrsi-regularized-agent-harness-self-improvement/
方法与失败案例
- The SWE-Bench Illusion:https://arxiv.org/abs/2506.12286
- SWE-Bench+(ICLR 2026 在投):https://openreview.net/pdf?id=R40rS2afQ3
- SWE-bench 污染早期分析:https://arxiv.org/abs/2410.06992
- LessLeak-Bench:https://arxiv.org/abs/2502.06215
- SWE-rebench:https://arxiv.org/abs/2505.20411
- KernelBench-Verified:https://arxiv.org/abs/2607.16241
- KernelBench v0.1 修订(Reward Hacking 一节):https://scalingintelligence.github.io/_blogs/kernelbenchv01.md
- OpenAI Hugging Face 事件 postmortem(2026-08-26):https://openai.com/index/hugging-face-incident-and-the-road-ahead/
- METR 独立调查:https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
- Anthropic reward hacking 研究:https://arxiv.org/abs/2511.18397
- Anthropic reward-seeker 续作:https://alignment.anthropic.com/2026/reward-seeker/
复现与对齐
- Ralph loop 起源(Geoffrey Huntley, 2025-07):https://ghuntley.com/ralph/
- Anthropic Ralph Wiggum 官方插件:https://github.com/anthropics/claude-plugins-official/blob/HEAD/plugins/ralph-loop/README.md
- EvoSkill 论文:https://arxiv.org/abs/2603.02766
- Corrigibility(Soares 等,AAAI 2015 workshop):https://intelligence.org/files/Corrigibility.pdf
- 电路追踪 Biology 篇:https://transformer-circuits.pub/2025/attribution-graphs/biology.html