AI Agent评测自动化研究

负结果的一生:一次实验说不之后要过五道关

最近关于 AI 能否独立做科研,有两份很有代表性的前沿评测。一份是普林斯顿等机构开展的影子评审实验(arXiv:2607.27191v2)。研究人员挑选了两篇尚未公开发表的 NeurIPS 学术论文,只把核心研究问题交给 AI,让它在独立的电脑环境里查文献、写代码、跑实验,最后交出一篇完整的论文。agent 看不到原论文和作者结果;每题原定上限 120 小时,在交出自评 Weak Reject 的草稿后,研究者为测上界追加了 24 小时。没有人针对具体研究问题提供指导,也没有现成的打分程序给它反馈。最终,原论文的作者按照真实的同行评审标准审稿,给两篇论文分别打出了 2/6 拒稿与 1/6 强烈拒稿。

另一份是 Prime Intellect 团队开展的算法优化长程基准测试。这里的规则截然相反:屏幕上有一个实时变动的分数面板,系统记录了 18 种不同 AI 模型在 153 条自主长程运行轨迹(run)中的表现,最长的一次运行持续了 8.7 天。在能够随时看到数字涨跌的确定性环境里,表现最好的 Fable 5 系统在 8.7 天的长程运行里把训练步数压到 2,726,关掉了与人类纪录(2,600 步,发博文时仍是未经同一验证器复核的公开 PR)之间差距的 81.7%。

表面上看,这是一场惨败与一场突破的对照。这种对照容易让人得出直观印象:AI 只能在有即时分数的场景里刷榜,一到真正的开放研究里就毫无头绪。但如果翻开 Prime Intellect 的公开运行轨迹库和影子评审的轨迹查看器,会看到两项研究把视线引向同一处。在 Prime Intellect 的 153 条运行记录里,18 个模型提出的优化构想高度重合,没有任何一次运行产出根本性的新方法,制胜的成分都与现有文献相似。正如研究团队所总结的:The models all find similar ideas. What separates them is how they run experiments. 哪怕是表现欠佳的模型也能提出正确的方向:Grok 4.5 两次丢掉了 row normalization 这个改动,两次的原因都是它自己引入的 scaling bug。想法两次回到手里,又两次被自己的实现错误证伪。

这揭示了一个常遭忽略的现实:AI 做研究的真正瓶颈,并不是想不出好点子。前沿模型在理解问题和产生构想上并不缺灵感,真正的差距发生在实验给出否定信号之后:系统到底怎么对待这次失败。在真正的科学探索中,一次实验失败并不意味着这个构想本身走到头了。从一个否定信号出现,到它未来重新发挥价值,通常要经历五道关口:归因、定界、存档、复活与组合。

负结果的五道关:归因、定界、存档、复活、组合

1. 读失败:什么失败了,失败管多宽

面对一次不及预期的实验,最先要回答的是归因问题:究竟是哪里出了问题。在实验执行中,指标变差通常源自四种截然不同的根因:核心假设从数学上就错了、假设是对的但代码写出了 bug、代码和假设都对但测量环境的随机噪声掩盖了信号、或者当前搭配的其他参数不合适。这四种截然不同的情况,在监控屏幕上表现出来的现象一模一样,都是数字下跌。缺乏经验的系统,最容易把数字下跌一律等同于假说本身的破产。Grok 4.5 把代码实现的缺陷算在了数学假设头上;而在影子评审的 TabPFN 课题里,AI 试过少数内部信号探测失败后,直接跳到白盒内部信号不存在的普遍结论,最终交出的检测器也偏离了题目要求的 PFN 专用设计

归因之后,紧接着要明确定界的边界:这次失败的结论究竟管多宽。Prime Intellect 在报告中给出了一个清晰的论断:A negative result here only tells you about the specific recipe it was tested on. 一次失败的实验,仅仅说明该方法在当前这套具体配方下行不通,并不等于整个方法家族都不可行。精确的定界需要严密的测量纪律。在 Prime Intellect 的约一百条运行里,有 62 条没有直接采信官方给出的噪声估计,先自己写脚本测了当前环境的底噪,而这些自测的运行集中在结果表顶部;其中 42 条进一步发现,即便随机种子完全相同,同一份配方重跑的 loss 依然会动,因为 GPU 本身不是确定性的。于是它们设计了同种子配对对比的测试方式,在不增加算力成本的情况下,把微弱的真实改进信号从噪声中分辨了出来。遇到模棱两可的临界结果,强系统用 3 个种子而不是 1 个去测,只有自己的噪声模型判断值得时,才支付 8 个种子的验证成本。

这种测量纪律也提醒我们如何看待榜单本身。在 Prime Intellect 的公开排行与探索看板中,同一套模型加脚手架的两条运行,按对齐口径分别相差约 40 到 54 步,而主榜 18 个相邻名次的差距中有 16 个不超过 54 步。再加上多数配置至少启动 3 条轨迹、24 小时后只续跑最优的一条,完整成绩是多次取优后的极值。榜单本质上是模型与脚手架绑定的系统排行,具体位次容易受单次波动扰动,只有拉开梯队的宽分层才具有稳定的参考意义。

2. 留下与重问:实验留下什么,什么条件下重开

好系统与差系统的根本差别,在于一次实验失败之后留下了什么。正如测试团队所观察到的:What separates the best traces is what an experiment leaves behind. 落到工程上,值得留下的是带失败归因的中间记录、当前测出的噪声底线,以及一份明确记录了失效条件的负结果清单。

在针对黎曼猜想的数学探索实验中就出现过这样的做法:第一轮提出的 650 个数学猜想全部证实行不通。系统并未推倒重来,转而整理出一份包含 106 个候选项的详细台账,精确记录了每个猜想在什么条件下失效、未来出现什么新前提时可以重新启动。到了第二轮探索,系统首先阅读这本失败台账,带着明确的已知边界去开辟新路径。

负结果的重新激活有着明确的前提条件:整个系统的底层大环境(recipe)发生变化,曾经暂时搁置的方法需要重新拉出来检验。Prime Intellect 的长程测试记录显示,Opus 5 在整体配方变化后,主动翻出早期判定为无效的 β2\beta_2 参数调优重新测试,这一次直接打破了系统的历史最佳纪录。与此相反,曾经有用的改动也会过期:K3 在引入了新的归一化方法后,主动消融并移除了之前两个曾经带来提升的辅助模块。在复杂的系统里,核心配方调整之后,历史的对与错都需要重新洗牌。

影子评审的失败恰恰在这一步露出了破绽。在长达 6 天的探索中,AI 内部的自我审查在开放世界评测日志里明确指出了当前方案的两大硬伤:特征是手挑的、评估指标与训练语料循环咬合。但缺乏配方变化触发重审的机制,在原定截止还剩 110 小时的时候,AI 就锁定了整体路线不再更改;人类后来追加的 24 小时延期,也没有触发对主路线的重开,工作仍围绕旧稿补实验、加限定和改写展开。

这里呈现出一个鲜明的反差:影子评审里的系统把推翻给了主张、把坚持给了稿子;而在基准测试里的强系统,把推翻留给自己写下的代码和技术栈(每次合并后重新消融),把坚持留给了微弱的信号和最初的问题。只记录失败现象却不注明重启条件的日志,只是一座墓碑,无法指导后续的研究。

墓碑只记死因,账本带复活条件

3. 组合:小增益如何等到搭档

单独拿出来测试不过关的改动,组合在一起却可能产生质的飞跃。在 Prime Intellect 的测试中,Fable 5 在单个参数的微调陷入瓶颈后,开始有意识地寻找那些单测看起来变差、组合在一起却表现出色的参数对。通过一次对历史边缘改动的联合测试,系统直接拿下了 31 步的大幅度提升。差系统往往习惯于孤立地审判每一个细小的变动,只要单次测试没有明显效果就随手丢弃,这种单挑式的做法自然会错过需要多个零件协同配合的高阶解法。

在影子评审的 Persona Cartography 课题中,AI 面对连续的阴性结果,只是不断机械地收窄论文声称的主张范围,甚至耗费大量算力把阴性结果简单复制到其他小模型上,从未尝试将前期积累的几个微弱线索拼在一起做交叉验证。这种单维度的退缩让探索空间迅速收缩殆尽,最后只能交出一篇结论局限的论文。这正是为什么规范记录负结果如此关键:那些在当下看起来不起眼的微小碎片,本质上是在等待能与它发生化学反应的搭档。

4. 能制度化多少

Prime Intellect 的运行记录表明,上面提到的这些高级科研行为,并不需要人类研究员手把手去教,它们已经在前沿模型的自主探索中自发出现:有的模型会主动重测历史参数,数十个运行自发建立了硬件噪声基准。这些行为模式不是少数模型的专属天赋,它们至少有一部分可以通过工程框架去沉淀和强化。在工程实现上,有四条纪律可以做成自动化的刚性运行时结果确定性门禁

  1. 噪声底线纪律:在轻信任何负面结果之前,必须先用基准测试测出当前环境的随机噪声水平。
  2. 故障归因分账机制:把代码 bug、硬件波动、参数不适配与核心科学假设的错误在记录中严格分开。
  3. 负结果带条件入账:记录失败时注明失效时的依赖配置,一旦底层大配方发生调整,自动重新激活测试。
  4. 弱信号组合池化:为单测没有达到及格线但有微弱正面迹象的改动建立候选池,定期发起多变量联合测试。

依然有一部分核心判断无法完全用死板的规则来替代。在没有现成记分牌的开放探索中,判断一个缺陷究竟是无伤大雅的工程小毛病,还是动摇根基的方向性致命伤,依然高度依赖人类成熟的研究品味与学术判断。这部分无法写成死规则的取舍,正是科研探索最核心的护城河。这也给接下来的评测指明了清晰的对照思路:在开放科研的影子评审评估框架中,保持模型本身不变,只在外部环境里加上这四道管理负结果的硬性纪律,观察系统是否能够跳出死磕错误路线的泥潭;而在有分数的基准测试中,则需要统一测试框架、固定轨迹种子数量并重复运行,减少工程外壳与抽样波动带来的混淆。

结语

评价一个系统到底懂不懂做研究,不能只看它在脑暴时提出了多少花哨的想法,也不能只看它在有现成答案的考卷上能拿多少分。真正的分水岭,在于一次实验得出否定结果之后,系统采取了什么行动,以及它为这次失败留下了什么遗产。那些能够看清失败机理、并在时机成熟时重新唤醒旧想法的系统,将在漫长而复杂的探索旅程中,与那些把失败随手扔掉的系统拉开差距。

鸭哥每日手记

日更的深度AI新闻和分析