今日关注:不要盲目AI research了,Meta推出「AI研究偏好模型」RPM:先试试小规模试点?
来源:学术头条    时间:2026-08-18 22:29:24

AI 研究智能体(AI Research Agent,AIRA)已经能够自主提出、实现并评估机器学习实验,但在前沿任务上的进展始终受制于成本:写出一个候选方案只需几分钟,而验证它是否有效却可能需要数小时甚至数天的 GPU 时间。

如今,智能体能够提出的候选方案数量,远远超过其能负担得起执行的数量,这使得“如何在固定执行预算下分配算力”的研究偏好(research preference)成为决定研究进展的关键因素。


(资料图)

为应对这一挑战,Meta FAIR 团队及其合作者提出了“AI 研究偏好模型”(RPMs),一个无需实际执行候选方案,就能预测多个候选方案中哪个最值得投入算力去执行的模型。

论文链接:https://arxiv.org/pdf/2608.13940

研究团队观察到,语言模型在预测绝对指标或执行结果时表现并不可靠。因此,RPM 不会被用于猜测某个方案最终能跑出什么分数,而是把问题重新表述为相对排序问题:在真正投入算力之前,先对候选方案进行排序,找到最有希望的路径。

具体而言,他们首先基于冻结的预训练语言模型(未进行任务特定训练)构建了两个不同形式的 RPM:一个inference-only 模型,对候选计划、代码和先前执行过的解决方案进行推理,以及一个agentic 模型,先执行小规模试验再做后续决策;随后,他们将这两类模型整合到了一个 AIRA-dojo 搜索 agent 中。

在 Agentic RPMs 研究中,研究团队发现试点实验智能体在分配时间预算时容易过于保守,导致大量预算被闲置。为此,他们采用了两种机制:一是在提示词中有意夸大剩余时间预算(报告的数值是实际的数倍),避免智能体过早停止;二是在每次提交后,引入一个独立的反馈模型审阅已有发现,提出下一步最有信息量的实验,或判断证据已经充分、结束循环。

在 AIRS-Bench 上的评估结果显示:两种方案分别将平均归一化得分从 0.684 提升至 0.711 和 0.729,并能在约 15 小时内达到无引导智能体 24 小时才能达到的水平,且所用执行预算不到后者的 2/3。值得一提的是,他们的最优 RPM 模型还在两个 AIRS-Bench 任务上取得了 SOTA 结果。

图|RPM 增强型 AIRA-dojo 的评估结果

当然,这项研究也具有一定的局限性。例如,当前实验假设 LLM 推理成本可忽略,但实际存在延迟——以 Inference-only RPM 为例,扣除 0.660 小时的推理延迟后,归一化得分从 0.711 微降至 0.708,具体开销会因托管基础设施和模型规模而异;离线评估数据来自此前不同骨干模型、不同任务模态下的贪心搜索运行,属于离策略数据,使得研究论文的主要结论仍以端到端结果为准。

而且,研究团队仅将 RPM 的集成范围限定在子节点创建阶段。初步实验显示,由于 Hidden Consistent Evaluation 协议已保证验证集与测试集高度一致,RPM 用于最终节点选择时相对“选验证得分最高节点”的默认策略并无显著提升;父节点选择阶段的应用则留给未来工作。

此外,RPM 目前仅在 AIRA-dojo 框架下、使用单一骨干模型、在单一基准上得到验证,有待在后续工作验证其在其他框架和骨干模型上的可迁移性。

未来,AI 研究智能体的下一阶段竞争,或许不只是能否提出更多有潜力方案,还包括能够更准确地决定哪些方案值得投入研究资源。

RPM 则给出了一个直接的系统化路径:用相对比较取代脆弱的绝对预测,用历史轨迹补充判断上下文,并在必要时通过小规模实验获得更多证据。当实验评价远比方案生成昂贵时,把测试时计算投入候选选择,本身就可能成为提升自动化研究效率的重要方向。

关键词: 实验 智能体 meta research

X 关闭

X 关闭