三分之一的arXiv论文,竟然是AI写的?
就在最近,一项unslop的研究在外网炸开了锅。
过去一年,计算机科学领域65%的新论文,被它的检测器标了红。
网友甚至为此造了一个专属名词——「大泔水时代」。
可同一时期的数学论文,却只有0.7%。

01、ChatGPT一响,曲线原地起飞
在这项研究中,团队扫了12750篇arXiv论文,时间跨度从2023年1月直抵2026年7月。
目标锁定十个学科,每个领域每月抽取约25篇全文。
对照组则选定在2021至2022年,那是ChatGPT还未降生的纯人类时代。

结果显示,2021至2022年,标记率稳定在0.4%;但随着ChatGPT的发布,曲线在几个月内拔地而起。
在最近一个完整季度中,标记率达到了32%,而在2026年初,峰值更是逼近39%。

分学科来看,计算机科学最为惨烈,标记率高达65%。
要知道在ChatGPT问世前,它的基准值只有0.2%。短短三年,数字狂飙了300多倍。
紧随其后的是定量生物学56.3%,电气工程51.3%,经济与金融47%;再往下,应用物理34%,统计31.3%,凝聚态物理24%,高能物理14%,天体物理10.7%。
榜单的最后一行是数学:0.7%。
而这还只是下限。如果把AI文本藏得足够隐蔽,检测器是识别不出来的。

同一台检测仪,同一个论文库,落差逼近100倍。
到底是数学家集体坚守纯手工码字?还是这台机器在数学公式面前,压根就是个瞎子?
跌入谷底的0.7%,是机器致盲
其实,谜底已经被unslop亲手写进了报告里。
想想看,一篇标准的数学论文究竟长什么样?满屏都是符号、公式、定理与证明,真正用英语写成的散文句子,少得可怜。
偏偏这台检测器只认文字。它盯的是句子的结构、用词的习惯、段落的组织。
而数学论文里仅剩的那几行字,还全是「设X为某某」「由引理3可推导」这类格式化表达,和检测器训练时见过的科学英语基本不在同一个频道上。
所以团队自己也承认,目前的研究还有不少局限性:
数学的0.7%目前还说明不了什么。可能是数学家真不怎么用AI,也可能是检测器看不懂数学论文,但这份数据分不出是哪一种。
对照组也比较小。每个学科只有200篇ChatGPT前的论文,按0.4%的误报率,2000篇里总共只有8篇被标记。这种水平,只能算是粗略估计。
再有就是前面说过的,检测器抓不全。所以,这些数字都还只是下限,真实比例只会更高。
越卷的地方,越离不开AI
那么,到底是谁在用AI写论文?
答案,藏在斯坦福另一项持续了两年的研究里。
2024年3月,斯坦福Weixin Liang团队率先把尺子伸进同行评审:ICLR 2024的审稿意见里,约10.6%的句子被LLM大幅修改过。论文还没测完,审稿人自己先用上了。
2025年8月,还是这个团队,把样本扩到112万篇论文,并且直接登上了《自然·人类行为》。
研究显示,截至2024年9月,CS论文摘要的LLM修改比例最高已达22.5%。而且用得最狠的,是发预印本最勤、扎在最卷领域的研究者。

越卷的领域,用得越狠。
在这里,AI写作已经成为了军备竞赛:同行都在用AI提速,只用手写的人,节奏就慢了一拍。
难怪X上一条流传颇广的相关转发,配文里第 一行就是:「提示词:写一篇能发arXiv的论文。」

02、它闻的是「味」,不是AI
不过,先别急着拿这65%去定罪。
团队在报告里也承认,检测器分不清「AI顺过一遍语法」和「整篇机器代工」,它只认文字里的机器味浓度。
所以65%的正确理解,是「65%的论文闻起来像AI」,而不是「65%的论文是AI写的」。
但麻烦在于,这种机器味,人类自己也会沾染。
有不信邪的研究者,把自己多年前的旧论文扔进检测工具,结果27%到74%的内容被标红。
要知道在那个年代,ChatGPT连个影子都还没有。

原因不难找。
翻开今天的学术期刊,满纸都是大型语言模型、基准测试、业界最前沿。措辞越标准,结构越工整,越容易撞上检测器认定的机器特征。
何况,LLM本来就是拿这类论文训练出来的。不是学者写得像AI,是AI生来就写得像学者。

当所有文字都有了嫌疑
其实这两年,我们都在干和检测器同一件事。
读到一段四平八稳、词句工整、时不时蹦出「不仅……而且……」的文字,心里就会咯噔一下:这怕不是AI写的吧?
unslop的检测器,等于把这种玄学的嗅觉,做成了一台能量产数字的仪器。
毕竟怀疑一旦装进脑子,就卸不掉了。
过去,「写下来」本身就是一种背书。一个人愿意花几个小时组织文字,至少说明他认真。
现在写得再漂亮,都可能只换来一句「AI吧」。
有些人甚至开始刻意绕开自己用了半辈子的词,只因它们「听起来太AI」。

如今,「AI味」正在变成一场席卷文字圈的新型原罪。
滑稽的是,直到今天,我们连这种「AI味」究竟由什么构成,都还没能精确测量出来。









