AI 研究智能体(AI Research Agent,AIRA)已经能够自主提出、实现并评估机器学习实验,但在前沿任务上的进展始终受制于成本:写出一个候选方案只需几分钟,而验证它是否有效却可能需要数小时甚至数天的 GPU 时间。
如今,智能体能够提出的候选方案数量,远远超过其能负担得起执行的数量,这使得“如何在固定执行预算下分配算力”的研究偏好(research preference)成为决定研究进展的关键因素。
(资料图)
为应对这一挑战,Meta FAIR 团队及其合作者提出了“AI 研究偏好模型”(RPMs),一个无需实际执行候选方案,就能预测多个候选方案中哪个最值得投入算力去执行的模型。
论文链接:https://arxiv.org/pdf/2608.13940
研究团队观察到,语言模型在预测绝对指标或执行结果时表现并不可靠。因此,RPM 不会被用于猜测某个方案最终能跑出什么分数,而是把问题重新表述为相对排序问题:在真正投入算力之前,先对候选方案进行排序,找到最有希望的路径。
具体而言,他们首先基于冻结的预训练语言模型(未进行任务特定训练)构建了两个不同形式的 RPM:一个inference-only 模型,对候选计划、代码和先前执行过的解决方案进行推理,以及一个agentic 模型,先执行小规模试验再做后续决策;随后,他们将这两类模型整合到了一个 AIRA-dojo 搜索 agent 中。
在 Agentic RPMs 研究中,研究团队发现试点实验智能体在分配时间预算时容易过于保守,导致大量预算被闲置。为此,他们采用了两种机制:一是在提示词中有意夸大剩余时间预算(报告的数值是实际的数倍),避免智能体过早停止;二是在每次提交后,引入一个独立的反馈模型审阅已有发现,提出下一步最有信息量的实验,或判断证据已经充分、结束循环。
在 AIRS-Bench 上的评估结果显示:两种方案分别将平均归一化得分从 0.684 提升至 0.711 和 0.729,并能在约 15 小时内达到无引导智能体 24 小时才能达到的水平,且所用执行预算不到后者的 2/3。值得一提的是,他们的最优 RPM 模型还在两个 AIRS-Bench 任务上取得了 SOTA 结果。
图|RPM 增强型 AIRA-dojo 的评估结果
当然,这项研究也具有一定的局限性。例如,当前实验假设 LLM 推理成本可忽略,但实际存在延迟——以 Inference-only RPM 为例,扣除 0.660 小时的推理延迟后,归一化得分从 0.711 微降至 0.708,具体开销会因托管基础设施和模型规模而异;离线评估数据来自此前不同骨干模型、不同任务模态下的贪心搜索运行,属于离策略数据,使得研究论文的主要结论仍以端到端结果为准。
而且,研究团队仅将 RPM 的集成范围限定在子节点创建阶段。初步实验显示,由于 Hidden Consistent Evaluation 协议已保证验证集与测试集高度一致,RPM 用于最终节点选择时相对“选验证得分最高节点”的默认策略并无显著提升;父节点选择阶段的应用则留给未来工作。
此外,RPM 目前仅在 AIRA-dojo 框架下、使用单一骨干模型、在单一基准上得到验证,有待在后续工作验证其在其他框架和骨干模型上的可迁移性。
未来,AI 研究智能体的下一阶段竞争,或许不只是能否提出更多有潜力方案,还包括能够更准确地决定哪些方案值得投入研究资源。
RPM 则给出了一个直接的系统化路径:用相对比较取代脆弱的绝对预测,用历史轨迹补充判断上下文,并在必要时通过小规模实验获得更多证据。当实验评价远比方案生成昂贵时,把测试时计算投入候选选择,本身就可能成为提升自动化研究效率的重要方向。
X 关闭
X 关闭
- 15G资费不大降!三大运营商谁提供的5G网速最快?中国信通院给出答案
- 2联想拯救者Y70发布最新预告:售价2970元起 迄今最便宜的骁龙8+旗舰
- 3亚马逊开始大规模推广掌纹支付技术 顾客可使用“挥手付”结账
- 4现代和起亚上半年出口20万辆新能源汽车同比增长30.6%
- 5如何让居民5分钟使用到各种设施?沙特“线性城市”来了
- 6AMD实现连续8个季度的增长 季度营收首次突破60亿美元利润更是翻倍
- 7转转集团发布2022年二季度手机行情报告:二手市场“飘香”
- 8充电宝100Wh等于多少毫安?铁路旅客禁止、限制携带和托运物品目录
- 9好消息!京东与腾讯续签三年战略合作协议 加强技术创新与供应链服务
- 10名创优品拟通过香港IPO全球发售4100万股 全球发售所得款项有什么用处?

