先说结论:这不是你一个人在想的问题,你毕业论文致谢里最想“感谢”的那几位审稿人,可能有一部分真的是在拿AI当枪使。
Frontiers今年初的调查确实挺吓人:超过一半受访的审稿人承认,自己在审稿过程中用到了AI工具。注意,这里说的是“用到”,不是“全部交给AI”。但就冲这个比例,你之前收到的那些措辞怪异、句式机械、批得莫名其妙又让你熬夜返修的审稿意见,确实有相当概率存在“AI参与创作”的成分。
我自己的感受是,这几年收到的审稿意见正在悄悄“变味”。早年间审稿人意见通常很具体:“请补充XX方法的收敛性证明”“图3的误差棒是怎么算的”“引言部分引用不够新,建议补上近两年的工作”——一看就是同行真的读了你的文章,捏着你的技术细节挑毛病。但最近两年,我收到的意见里出现了大量“正确的废话”:“该研究具有重要的理论意义和现实价值”“作者应该进一步补充实验验证”“建议作者讨论研究的局限性”。措辞端正、语法挑不出毛病,但就是感觉它没有真的读懂我的工作,像是在对着摘要做阅读理解,而不是在研究全文。
如果你也收到过这种“AI味”很浓的审稿意见,这篇文章能帮你做三件事:第一,判断自己收到的审稿意见到底是不是AI写的,以及它背后是哪种AI用法;第二,理解为什么AI审稿会让“被审稿”的体验变得更折磨;第三,从作者和审稿人两个角度,找到在这种环境下保护自己、提升效率的实操方法。
1. 为什么“AI审稿”会大规模出现:平台、审稿人和学术生态的三重推动
先别急着骂审稿人懒惰。AI审稿能在短短一两年内渗透超过半数审稿流程,背后是结构性的推力,不是单个人的道德问题。
1.1 审稿人数量和质量的剪刀差
学术期刊的投稿量增长速度远超审稿人的供给速度。我认识好几个常被拉去审稿的同行,手头同时压着三四篇稿件,每篇都被要求两到四周内返回意见。一篇正经的学术论文,通读一遍加查参考文献加核对实验逻辑,少说也要四五个小时,认真写意见又是两三个小时。如果一个月被拉去审三四篇,等于要多干两天的活,还完全无偿。
在这种压力下,审稿人拿AI做初筛其实是“顺理成章”的选择:让AI先通读全文,提取摘要、方法、结论,生成一个意见草案,自己在草案基础上做修改和补充。省下的是从头开始组织语言的时间,保住的是“自己的判断”这个最后底线。这属于比较有底线的用法,问题在于很多审稿人连“修改和补充”都省了,直接复制粘贴AI意见就提交。
1.2 审稿意见的“60分合格线”太低
期刊编辑判断一份审稿意见是否合格,主要看它有没有覆盖“创新性、实验设计、数据完整度、文字规范性”这几个大项。AI生成的意见恰好在这几个维度上表现不差——它虽然抓不住文章的深层缺陷,但能把每个大项都“蜻蜓点水”式地提一条意见。对于工作量爆炸的编辑来说,一份看起来面面俱到的意见,比一份虽然尖锐但只聚焦个别技术点的意见更不容易引发后续争议。
说白了,现在的审稿意见评价体系奖励“全面平庸”,不奖励“深刻但偏科”。AI在这种评价体系下简直是天生的高分选手。
1.3 学术写作本身越来越“AI化”
还有个容易被忽略的因素:现在很多论文本身就是AI辅助写出来的。当论文的表述风格趋于标准化、模板化之后,AI审稿人反而更容易“看懂”——它们擅长的正是提取标准化文本里的结构化信息。一篇高度模板化的论文,配上AI擅长的模板化审稿,形成了一种诡异的“生态闭环”:论文看着像AI写的,审稿意见也看着像AI写的,但两个AI之间并没有在对话,人类作者在中间干着急。
2. “AI味”审稿意见有哪些共同特征:从措辞到结构的识别手册
被AI审稿意见折磨过的作者,多少都练出了一种“嗅觉”。下面是我总结的几类典型特征,按可靠程度从高到低排个序。要说明的是,单项特征不能直接定罪,组合出现时可信度才高。
2.1 词汇层面的“AI高频词”清单
语言模型生成学术文本时,有几类词汇出现频率明显高于真人审稿人:
- “delve”和“explore”滥用:真人写审稿意见很少用“delve into”,但AI特别喜欢:“The paper delves into a critical problem”。这句话翻译过来就是“这文章研究了一个重要问题”,信息量为零,但AI觉得这么说显得深刻。
- “groundbreaking”“novel”“significant”的廉价化:真人审稿人用“novel”通常是真的觉得某个方法新,AI用起来像撒糖——每个稿件都“propose a novel framework”,每篇都“make significant contributions”。审稿意见里如果满篇都是这种形容词,却在具体哪一点上“novel”都说不出个所以然,基本可以怀疑。
- “furthermore”“moreover”“however”的模板化衔接:AI特别喜欢用逻辑连接词强行制造条理性。真人审稿意见的逻辑是“跟着问题走的”,AI的逻辑是“跟着模板走的”,读完你会觉得它什么都说了,又什么都没说。
- “It is worth noting that”“It should be emphasized that”这类无人称句式:真人审稿意见通常直接点名:“The authors should...”“The experimental section lacks...”。AI则倾向于用一种“客观公允”的口吻说话,这种口吻放在审稿意见里特别违和。
2.2 结构层面的“三段式赞美+两点小建议”
打开一份AI生成的审稿意见,结构高度雷同:
Summary: This paper presents a XXX method for XXX, aiming to solve XXX. The motivation is clear and the results demonstrate the effectiveness of the proposed approach. Major Comments: 1. The authors should provide more detailed experimental settings. 2. Some recent related works should be discussed and compared. Minor Comments: Some typos and grammar issues should be carefully corrected.这段结构的特点是:开头先戴高帽,说你的动机清晰、结果有效;然后提两条无关痛痒的大修意见(补实验设置、补文献对比);再来一条小修(改语法错误)。真人审稿人很少这样写——真人要么直接杀向核心问题,要么心狠手辣地列十条意见还附赠三页补充材料。AI的“温柔”不是因为它善良,而是它在拟合“审稿意见该长什么样”的平均形态,而平均形态必然是温和的。
2.3 语义层面的“空转”现象
这是最折磨人的一点。AI审稿意见往往能在每个维度都发表评论,但每个评论都停在“指出问题存在”的层面,不深入“问题为什么重要”和“应该怎么改”。比如:
- 它会说“作者应补充对比实验”,但不会告诉你应跟哪个baseline对比,不会说明它怀疑你的方法在哪些场景下会失效。
- 它会说“建议进一步分析参数敏感性”,但不会追问你某个超参数取值的依据,不会指出你的结论在参数变化时是否还成立。
- 它会说“讨论部分的深度不足”,但不会指出你漏掉了哪条相关文献的启发,不会追问你的方法在某个应用场景下是否有限制。
如果把审稿比作医生诊断,真人的意见是“你这里有个肿块,我怀疑是XX,建议做YY检查确认”;AI的意见则是“建议注意身体健康,定期体检”。没有错,但也没用。
2.4 尾部“minor comments”的诡异细节
有意思的是,AI审稿意见在“minor comments”部分的细节往往是断裂的。它可能指出“第X页有个拼写错误”,但这个错误的页码是它胡编的;它可能建议“统一专业术语表述”,但你的全文构词很一致;它甚至可能提一条针对某篇参考文献的意见,而这篇文献在你的文章里根本不存在。
原因在于AI生成文本时会对“引用”“页码”“变量名”这类具体指称做合理性想象——它知道审稿意见里应该提到这些细节,但它不知道真实细节是什么,于是编了一个“长得像真的”出来。这个特征对识别AI审稿极其关键:真人审稿意见的细节总是准的,AI审稿意见的细节往往是“幻觉”。
3. 从被审稿人角度出发:当AI味意见砸到头上,我们怎么接招
识别出审稿意见可能是AI写的,不是为了去举报或者对线——大部分期刊也没有针对“审稿人用AI”的统一规则,较量起来很难有结果。更实际的目标是:从这份质量不高的意见里,榨出能帮自己提升论文的干货,同时别让AI的空转意见耗死自己。
3.1 第一步:先判断这份意见的“可用密度”
收到审稿意见后,先别急着开始改。花半小时通读一遍,按“可执行性”分成三类:
- 可直接执行:指出明确的问题(如“第5页的公式推导跳跃”“实验只测了50轮,建议测到200轮看收敛趋势”),这类意见不管是谁提的,先照做。
- 可翻译执行:指出一个模糊问题(如“建议增强方法的理论分析”),真人意见通常会说清楚“是缺误差界分析还是缺收敛性证明”,AI意见则只说“增强”。这类意见要靠你自己补全背后的意图,把它翻译成一个具体的实验或证明任务。
- 不可执行:通篇夸奖加上几条泛泛而谈的“建议补充”“建议讨论”,这类意见的价值不在内容,而在它隐含的信号——审稿人没怎么细看你的稿子,你的返修能否通过,更多地取决于编辑对“作者认真回应”这个动作的印象。
我的经验是,遇到第三类意见特别多的情况,返修策略要调整为“以工程化方式补齐审稿人期待的形式内容”:补一个更全的参数敏感性实验,加一段对比讨论,把之前放在附录的某个结果挪到正文——这些改动都是为了塑造“作者积极回应审稿意见”的姿态,而不是真的在解决学术问题。
3.2 第二步:把“空转意见”翻译成具体修订任务
拿最常见的几条AI式意见举例,我在实际修改中是这样执行的:
- “建议作者补充实验验证”——补充“消融实验+参数敏感性分析+可视化案例”三个方向中最欠缺的那个。如果正文已经没有空间,可以在附录里做一个完整版实验,并在Response里写清楚“我们已经补充了X实验,见附录A,结果表明……”。
- “建议讨论研究的局限性”——在讨论部分加一个“Limitations and Future Work”小节,写三点:方法适用边界、实验规模限制、理论分析缺失。注意,这里不是让你自爆缺点,而是展现你对方法边界有清醒认识。
- “建议补充近期相关研究对比”——检索近两年引用量较高的五篇相关文献,加在Related Work部分,并在实验表中增加与其中一到两篇的对比。就算做不了公平对比,也要在Response里说明“由于实验环境和数据集差异,原论文的对比数据未能完全复现,我们在表X中列举了可参考的数据”。
这轮操作的核心要义是:不要跟意见较劲,而是把每条意见都当作一个“任务单”,快速、体面地完成它。
3.3 第三步:写Rebuttal时,用“结构化+契约式”回应
如果AI意见已经让你改了两轮,第三轮的Rebuttal一定要改变策略——不再单纯逐条回应,而是给编辑和审稿人出具一份“修改清单+核心结论”的契约式说明。
我通常会写这样一个结构:
Summary of Revisions: 1. New experiments: 补充了XX消融实验(图X),验证了XX模块的作用,结论从“XX有效”细化为“XX在数据量大于X时有效”。 2. Theoretical analysis: 应审稿人建议,增加了关于XX的收敛性分析(Lemma 1),证明过程见第X页。 3. Related work: 补充了2023-2025年间关于XX方向的X篇代表性工作(第X页),并与本文方法在XX维度做了对比。 Point-by-point responses start here: Comment 1: ... Response: ...这样做的原因很现实:如果你的审稿人有一部分工作在AI手里,AI是看不懂长篇大论式的Rebuttal的,但经济、清晰的“修改清单+逐点回应”格式正好在AI最擅长的“结构化信息提取”范围内。编辑在复核时也更省力,省力就容易通过。
3.4 一个反直觉的经验:AI味意见的期刊,返修通过率反而高
我在处理过好几轮“AI味”审稿意见之后,发现一个倒反天罡的规律:被AI式意见要求返修的稿件,最终录用概率不低。原因是AI的意见追求“全面但不过激”,它不会像真人审稿人那样在某些核心问题上坚持到底。只要你把形式补全,第二次返修后在编辑那里多数能过。
前提是你在Rebuttal里展现出了“认真执行了每一条意见”的姿态。审稿人用AI省时间,你也可以用“结构化回应”省时间,两边都在省时间,最后反而容易达成共识。
4. 审稿人视角:我建议同行们怎样用AI,又坚决不要怎样用AI
这段是写给同样被拉去审稿的同行的。AI本身不是洪水猛兽,用得好能大幅提升审稿质量,用得不好会制造学术垃圾。关键在于区分“AI辅助理解”和“AI替代判断”。
4.1 能用AI做的事:压缩信息、筛查规范、生成初稿
对于一篇动辄上万字的投稿,让AI先做一轮结构化阅读是合理的:让AI提取文章的研究问题、方法核心、数据集、主要结论,然后你在AI提取的纲要基础上,对照原文判断“它有没有漏掉关键环节”“它提取的重点对不对”。这一步能帮你快速定位文章的骨架,节省通读时间。
另外两个合理的场景是让AI检查格式规范性和初级语言问题。参考文献格式是否统一、图表标题是否符合期刊要求、是否存在明显的中式英语(针对英文投稿)——这些活儿交给AI不但效率高,还不容易漏。但注意,AI查出来的“语言问题”不要直接全盘接受,它的改稿有概率破坏作者原有的技术名词统一性。
4.2 不该让AI做的事:生成“创新性判断”和“具体修改建议”
AI最大的短板在于对“学术创新性”缺乏真实判断力。它没有在这个领域深耕过,不知道某个问题在社区里讨论了多少年,不了解“换个损失函数”和“提出一个全新的学习范式”之间的段位差。它生成的意见看起来什么都能评论,但评论的深度停留在“摘要级”。
所以我的习惯是:AI可以用来准备审稿意见的初稿框架,但“重大修改意见”必须是真人判断后的产出。最稳妥的流程是——AI读完文章给你一份“事实性摘要+规范性检查清单”,你在它基础上从头到尾翻阅原文章节,用自己的专业判断挖掘核心技术问题,再手写具体意见。这样做,AI帮你省去的是“复述文章”和“检查皮毛”的时间,你省下来的精力可以全部投到深挖问题上去。
4.3 期刊和编辑的应对策略该往哪走
这个问题不是作者能推动解决的,但我作为长期跟期刊打交道的从业者,真心建议期刊尽快把“审稿人使用AI”纳入规则框架。可以参考的动作有:
- 在审稿邀请时明确声明:审稿人使用AI辅助阅读是允许的,但审稿意见的最终判断必须由真人负责,且在意见中声明使用了AI工具。
- 建立“AI意见模板”检测机制:编辑在初次收到审稿意见时,先用工具筛查明显的AI生成痕迹。意见中如果出现大段模板化表述和虚构的细节,退回要求重写。
- 缩短稿件推送周期:审稿人不愿意上手审,很大程度是因为期刊在截稿日期的压力下不给人留消化的时间。编辑部如果能给审稿人两周而不是一周,真人审稿意见的比例会明显回升。
这些不是我坐在家里拍脑袋说的,而是好几个审稿人朋友在抱怨中反复提到的真实痛点。一边用着AI糊弄,一边骂期刊不给时间,这种现象本身就很荒诞。
5. 未来的学术审稿生态会往哪里走:警惕平庸化,但不必太悲观
看到这里,你可能觉得一团黑雾罩在学术上空。我的判断没那么悲观,但有一个明确的风险点值得警惕。
5.1 AI审稿正在推动“学术表达标准化”的加剧
当AI在审稿中占据主导,它会倾向于奖励“AI熟悉的那类论文”——结构清晰、术语标准、每个模块都长得规规矩矩。这反过来会倒逼作者把文章写成AI友好型模板:开头一段motivation,中间三章方法,最后实验结论。等这个循环转上几年,整个学术生态的写作风格会越来越收敛,真正“非主流”但极具创造力的表达会被无意识的筛选机制压制。
这个趋势的危险不在“审稿质量下降”这种显性层面,而在于“学术多样性流失”这个隐性层面:顶会顶刊上的论文长相越来越像,风险偏好低的评审结果会淘汰掉需要重新理解才能看懂的工作。
5.2 但我们手里还有几张牌
第一张牌是“作者-审稿人”之间的异步沟通渠道正在变多:很多期刊开始支持“pre-review discussion”或“反复rebuttal轮次”,作者有机会在意见之外补充背景信息,消解AI式意见带来的机械感。
第二张牌是“公开审稿”模式在开源期刊领域扩展。当审稿意见和作者回复都公开可查,审稿人的署名压力会让真人审稿的深度被迫回升——毕竟没人愿意让自己署名的审稿意见看起来像是AI生成的废话。
第三张牌是作者群体自身的力量。如果越来越多的同行在返修时像我前面说的那样,用结构化Rebuttal引导编辑关注“意见的专业深度”,编辑自然会慢慢感受到AI式意见带来的低效率和风险,从而在环节控制上收紧。
学术审稿这个系统的韧性其实很强。审稿意见的本质是“同行对同行的专业对话”,AI可以模仿它的格式,可以填充它的框架,但很难替代那种“我读懂了你在做什么且我知道哪里有问题”的深度确认。只要作者群体还在认真回应每条意见,审稿群体里那些真正认真的人就会感受到对话的存在,这个基准线就不会完全塌掉。
说到底,我们这代学术打工人面对的并不是“AI要毁掉学术”的末世剧本,而是一个“工具的滥用正在稀释学术对话质量”的具体麻烦。而麻烦的解决办法跟很多常见困境一样:先把伤害认清楚,再把手头的事按最笨的办法做好,最后靠时间和群体反馈把乱象滤掉。你们最近收到的审稿意见里,出现“AI味”的比例大不大?有没有哪条意见一眼就让你觉得“这不可能是人写的”?欢迎在评论区分享你们的真实经历,我挺想知道这个现象在不同学科、不同期刊之间分布差异有多大。