Meta创建AI过滤器以选择实验,节省GPU时间

By: www.diariobitcoin.com|2026/09/07 10:20:53

Meta FAIR推出了AI研究偏好模型(AI Research Preference Models),这是一个在执行机器学习实验之前对其进行分类的系统,以减少GPU的消耗。在AIRS-Bench的测试中,该工具将平均分数从0.684提高到0.729,并在大约15小时内达到了与24小时训练相当的结果。

  • RPM比较未执行的候选者,并允许代理仅选择最有前景的实验。
  • 代理版本的标准化平均分数为0.729,而没有该系统时为0.684。
  • 两个版本的结果都在大约15小时的计算中达到了24小时基础模型的结果。

使用人工智能进行自主研究面临一个不太显眼的问题:验证想法需要时间、金钱和计算能力。一个代理可以为机器学习模型提出数十种修改,但每次完整训练可能消耗数小时甚至数天的GPU,因此预先选择成为过程中的一个重要决策。

Meta的FAIR团队与牛津大学和伦敦大学学院的研究人员共同推出了AI研究偏好模型(RPM)。该系统并不试图猜测绝对分数或准确预测实验的最终结果,而是对尚未执行的候选者进行排序,并选择哪个候选者值得首先进入昂贵的训练阶段。

在计算支出之前的过滤器

该提案源于对语言模型的一个限制的发现:尽管它们可以推理计划、代码和搜索历史,但在直接预测执行指标时并不可靠。因此,RPM采用了一个更为有限的任务,比较两个候选者,并根据可用证据决定哪个看起来是更有前景的研究方向。

该机制集成在AIRA-dojo中,这是一个选择父代的贪婪树搜索环境,使用Draft、Improve和Debug操作符。代理并不是生成一个子代、执行它并重复该过程,而是并行应用一个操作符15次,收集未测试的候选者,并通过配对比较组织淘汰赛。

只有该淘汰赛的获胜者进入执行阶段,而每次比较都通过宽度优先搜索的遍历获得已探索节点的上下文。该上下文包括之前的实验和它们获得的验证分数,这些信息使评审能够区分出可行的改进、冗余的变体和仍可纠正的错误。

这种方法改变了代理的核心问题。代理不再被要求预测每个提案的表现,而是被要求确定哪个提案值得消耗下一个资源块,这一决策更接近研究人员在有限预算下优先考虑假设时所做的评估。

两个版本的不同成本

团队评估了一个仅基于推理的RPM变体和一个具有代理能力的变体。在第一个版本中,一个冻结的语言模型充当评审,检查候选计划、代码和搜索历史,而一个使用MIPROv2的优化评分标准指导其决策。

该评分标准试图重现主要研究人员的标准:容忍可纠正的错误,奖励可以扩展的想法,并惩罚重复已探索工作的方向。该版本的离线准确率在57.7%到59.0%之间,表明选择相较于随机性有所改善,尽管仍远未达到完美标准。

代理版本使用相同的评审,但允许在一个孤立的环境中操作,该环境克隆代理的工作空间并包含一个唯一的 H200。它的工具包括 python、bash 和 submit_solution,通过这些工具在决定是否继续某个方向或结束研究周期之前,执行小规模的试点测试。

设计中包含两个直接影响系统行为的决策。为了避免过早停止,剩余预算显示为 2700 秒,尽管实际可用时间为 300 秒,试点限制为 30 次,阈值为 60 秒;此外,代理选择器仅在 Draft 和 Improve 阶段介入,因为 Debug 会返回随机选择,以避免因额外评估而消耗时钟。

与随机选择的结果对比

测试在 AIRS-Bench 上进行,包含 20 个公共文本和表格数据任务,每个任务在单个 H200 上计算 24 小时,使用 10 个种子。Qwen3.6-27B 作为研究操作员和 RPM 的支柱,条件设计旨在将改进归因于选择层,而不是引入更强大的评审。

未使用 RPM 的随机选择作为参考,获得了 0.684 的平均标准化分数。仅基于推理的模型将该数字提升至 0.711,而代理版本达到了 0.729;使用验证和测试预言机计算的上限分别为 0.748 和 0.759。

在达到基线模型结果的速度上也出现了差异。推理变体在 14.88 小时内达到了 0.684 的最终分数,相当于加速 1.61 倍,而代理系统在 15.50 小时内达到了这一结果,相较于 24 小时的参考,提升了 1.55 倍。

这种收益并未消除所有成本:自托管推理每次执行增加 0.660 小时。调整该时间后,相应版本的报告性能为 0.708,耗时 23.34 小时,这表明实际优势既依赖于过滤器的质量,也依赖于执行它的基础设施的效率。

突出结果和提案的局限性

报告将两个新的基准结果归因于 RPM 变体。在 WinoGrande 中,代理系统达到了 94.1%,高于之前称为 AIRA₂ 的代理系统的 90.4%;而仅基于推理的版本在 SVAMP 中获得了 95.7%,相比之前的人类结果 94.2%。

这些数字并不意味着选择器可以替代实验评估,因为 RPM 仍然需要执行所选候选者并验证其表现。它的贡献在于减少进入该阶段的提案数量,这在 GPU 能力决定团队可以探索多少假设的场景中是一个重要的差异。

架构还表明,自主性不仅仅依赖于向代理提供更多工具。当系统组织预算、保留先前测试的上下文并在承诺资源之前比较替代方案时,性能会得到改善,尽管设计决策,如预算高估和 Debug 返回随机选择,仍然揭示了实验性的妥协。

该提案部分可部署:AIRA-dojo 和 AIRS-Bench 是开源的,使用的 LLM 保持冻结状态,Qwen3.6-27B 拥有开放权重。然而,使用 H200、自托管推理的成本以及对短期试点的依赖表明,将这些结果转移到其他环境中需要独立测量基础设施、任务和预算。

MarkTechPost报道,FAIR在Meta与牛津大学和伦敦大学学院合作开发了这项工作,并将RPM作为AI研究代理的优先级层。最相关的结果,超越了一个具体的数字,是将实验选择转变为机器学习循环的一个明确组成部分,而不是依赖随机生成或代理的直觉。

该发布还指出,相较于没有RPM的配置,推理变体的估计改进概率为0.5923,代理变体为0.5913,95%置信区间的下限分别为0.5066和0.5018。这些数据表明存在适度的统计优势,并建议将结果解读为有希望的证据,而不是保证该方法在任何研究问题上都能同样有效。

对于预算紧张的团队来说,吸引力在于在相同的可用时间内获得更多有用的探索。这个想法仍需在更多任务和配置中得到验证,但为一个日益增长的紧张局势提供了具体的回应:代理可以越来越快地生成实验,而执行这些实验的能力仍然稀缺且成本高昂。

-- 价格

--
--
--

本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

猜你喜欢

iconiconiconiconiconicon
客户服务:@weikecs
商务合作:@weikecs
量化做市商合作:bd@weex.com