一篇科学手稿是否仅因其写作风格不同而获得更高的评分,即使其结果完全相同?这是明李及其他七位作者于2026年8月10日发表的一项研究所探讨的问题,该研究在学术讨论中引入了一个既技术又令人不安的概念:修辞影响力在自动化同行评审中的AI评估。研究表明,被要求评估科学文章的大型语言模型可能会受到文本呈现风格的影响,即使科学内容保持不变。
研究团队设计了一个实验,旨在隔离单一变量:形式,而非实质。基于120份匿名提交的材料,这些材料提交给2026年ICLR会议,这是机器学习领域最重要的会议之一,作者们生成了一个控制语料库,包含4200篇完整的手稿,所有手稿均源自相同的原始工作,但根据不同的修辞变体进行了重写。
两个基于大型语言模型的重写者在六个不同的修辞维度上进行了工作,将其转变为每篇手稿的相反方向:一方面是强调某些说服性方面的版本,另一方面是减弱这些方面的版本,但科学结果保持不变。此时,五位AI评审员开始评估这些手稿,采用两种不同的协议,一个是标准的,另一个是更严格的,同时测试了联合重写、递归重写和由评审员主导的重写配置。
最显著的结果是,修辞敏感性并不均匀,而是根据真正的等级结构进行组织。在测试的六个维度中,证据框架和对工作的新颖性立场在正面和负面重写版本之间产生了最大的对比。研究目的的框架形成了第二个层次,虽然较弱但仍然可感知,而其他修辞维度则显示出较小或不太稳定的效果。
这种等级结构在比较不同质量的手稿时依然保持。但有一个细节使得这一现象更加微妙:分数的变化在很大程度上依赖于AI审稿人赋予的初始评分。起初分数较低的手稿在修辞重写后往往会有所提升,而分数已经较高的手稿则往往会下降。最明显的方向性对比出现在中间评分区间,正是在这里,编辑决策最不确定,因此更容易受到影响。
研究中最反直觉的一个方面是更复杂的修辞操控方法的有效性。更复杂的工作流程,结合了联合重写、递归或审稿人引导的重写,并不可靠地产生更大的收益,与更简单的干预相比。换句话说,增加重写过程的复杂性并不自动等同于更好地操控AI的判断。
联合重写的效果在很大程度上依赖于用作重写者的模型:更换大型语言模型会显著改变结果。即使向AI审稿人提供明确的指导,也未能显示出相对于简单的无指导的第二次阅读的持续优势。此外,重复重写还会产生递减收益,并且在很大程度上依赖于使用的特定配置。然而,研究确实发现了一个相当明确的角色分工:重写模型主要决定了相反变体之间的分离,而审稿模型则决定了对评分的影响的大小和方向。
当研究人员应用更严格的审稿协议时,整体评估的平均分数比标准协议下降了1.36分。但这里有一个对设计这些系统的人来说更重要的数据:更高的严格性并没有一致地降低AI审稿人的修辞敏感性。换句话说,使评审者更加苛刻,并不会自动使其对所评估文本的风格选择更具免疫力。
为什么这一切都重要?因为科学审稿已经面临越来越大的压力。出版物的数量以指数级增长,招募可用的人类审稿人变得越来越困难,以至于根据对《Frontiers》期刊工作人员进行的调查,超过一半的审稿人在其评估过程中已经以某种形式融入了人工智能。在这种背景下,自动化系统可能被简单的修辞手法操控的想法,且不触及科学内容,这在过程的完整性上打开了一个潜在的严重裂缝。
研究的作者不仅仅是记录这个问题:他们将其呈现为一种奖励黑客行为,即利用语言捷径来获得更好的评分,而不真正提高工作的质量。由此得出的结论很明确:需要能够抵御不改变科学内容的修辞变化的自动化评估系统。只要这种稳健性没有得到保证,任何增加或重新表述的行都可能比一篇科学文章真正应该传达的数据更具分量。
修辞选择,如证据的框架和对新颖性的立场,显著影响AI审稿人的判断,即使科学内容保持不变。
使用了一个受控语料库,包含4200篇手稿,来自120份匿名提交,提交至2026年ICLR。
不:更复杂的重写工作流并没有可靠地带来比更简单的干预更高的评分增益。
严格的审稿协议将整体评估的平均评分降低了1.36分,但并没有一致地改变AI审稿人的修辞敏感性。
内容由人工智能协助生成,并经过人工编辑审阅。
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

















