三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%
8471点击    2026-07-27 16:07

三分之一的arXiv论文,竟然是AI写的?


就在最近,一项unslop的研究在外网炸开了锅。


过去一年,计算机科学领域65%的新论文,被它的检测器标了红。


网友甚至为此造了一个专属名词——「大泔水时代」。


可同一时期的数学论文,却只有0.7%。


三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%


ChatGPT一响,曲线原地起飞


在这项研究中,团队扫了12750篇arXiv论文,时间跨度从2023年1月直抵2026年7月。


目标锁定十个学科,每个领域每月抽取约25篇全文。


对照组则选定在2021至2022年,那是ChatGPT还未降生的纯人类时代。


三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%


结果显示,2021至2022年,标记率稳定在0.4%;但随着ChatGPT的发布,曲线在几个月内拔地而起。


在最近一个完整季度中,标记率达到了32%,而在2026年初,峰值更是逼近39%。


三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%


分学科来看,计算机科学最为惨烈,标记率高达65%。


要知道在ChatGPT问世前,它的基准值只有0.2%。短短三年,数字狂飙了300多倍。


紧随其后的是定量生物学56.3%,电气工程51.3%,经济与金融47%;再往下,应用物理34%,统计31.3%,凝聚态物理24%,高能物理14%,天体物理10.7%。


榜单的最后一行是数学:0.7%。


而这还只是下限。如果把AI文本藏得足够隐蔽,检测器是识别不出来的。


三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%


同一台检测仪,同一个论文库,落差逼近100倍。


到底是数学家集体坚守纯手工码字?还是这台机器在数学公式面前,压根就是个瞎子?


跌入谷底的0.7%,是机器致盲


其实,谜底已经被unslop亲手写进了报告里。


想想看,一篇标准的数学论文究竟长什么样?满屏都是符号、公式、定理与证明,真正用英语写成的散文句子,少得可怜。


偏偏这台检测器只认文字。它盯的是句子的结构、用词的习惯、段落的组织。


而数学论文里仅剩的那几行字,还全是「设X为某某」「由引理3可推导」这类格式化表达,和检测器训练时见过的科学英语基本不在同一个频道上。


所以团队自己也承认,目前的研究还有不少局限性:


数学的0.7%目前还说明不了什么。可能是数学家真不怎么用AI,也可能是检测器看不懂数学论文,但这份数据分不出是哪一种。


对照组也比较小。每个学科只有200篇ChatGPT前的论文,按0.4%的误报率,2000篇里总共只有8篇被标记。这种水平,只能算是粗略估计。


再有就是前面说过的,检测器抓不全。所以,这些数字都还只是下限,真实比例只会更高。


越卷的地方,越离不开AI


那么,到底是谁在用AI写论文?


答案,藏在斯坦福另一项持续了两年的研究里。


2024年3月,斯坦福Weixin Liang团队率先把尺子伸进同行评审:ICLR 2024的审稿意见里,约10.6%的句子被LLM大幅修改过。论文还没测完,审稿人自己先用上了。


2025年8月,还是这个团队,把样本扩到112万篇论文,并且直接登上了《自然·人类行为》。


研究显示,截至2024年9月,CS论文摘要的LLM修改比例最高已达22.5%。而且用得最狠的,是发预印本最勤、扎在最卷领域的研究者。


三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%


越卷的领域,用得越狠。


在这里,AI写作已经成为了军备竞赛:同行都在用AI提速,只用手写的人,节奏就慢了一拍。


难怪X上一条流传颇广的相关转发,配文里第一行就是:「提示词:写一篇能发arXiv的论文。」


三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%


它闻的是「味」,不是AI


不过,先别急着拿这65%去定罪。


团队在报告里也承认,检测器分不清「AI顺过一遍语法」和「整篇机器代工」,它只认文字里的机器味浓度。


所以65%的正确理解,是「65%的论文闻起来像AI」,而不是「65%的论文是AI写的」。


但麻烦在于,这种机器味,人类自己也会沾染。


有不信邪的研究者,把自己多年前的旧论文扔进检测工具,结果27%到74%的内容被标红。


要知道在那个年代,ChatGPT连个影子都还没有。


三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%


原因不难找。


翻开今天的学术期刊,满纸都是大型语言模型、基准测试、业界最前沿。措辞越标准,结构越工整,越容易撞上检测器认定的机器特征。


何况,LLM本来就是拿这类论文训练出来的。不是学者写得像AI,是AI生来就写得像学者。


三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%


当所有文字都有了嫌疑


其实这两年,我们都在干和检测器同一件事。


读到一段四平八稳、词句工整、时不时蹦出「不仅……而且……」的文字,心里就会咯噔一下:这怕不是AI写的吧?


unslop的检测器,等于把这种玄学的嗅觉,做成了一台能量产数字的仪器。


毕竟怀疑一旦装进脑子,就卸不掉了。


过去,「写下来」本身就是一种背书。一个人愿意花几个小时组织文字,至少说明他认真。


现在写得再漂亮,都可能只换来一句「AI吧」。


有些人甚至开始刻意绕开自己用了半辈子的词,只因它们「听起来太AI」。


三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%


如今,「AI味」正在变成一场席卷文字圈的新型原罪。


滑稽的是,直到今天,我们连这种「AI味」究竟由什么构成,都还没能精确测量出来。


参考资料:

https://unslop.run/blog/measuring-ai-writing-on-arxiv


文章来自于"新智元",作者 "摩西"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI写论文

【开源免费】paperai是一个可以快速通过关键词搜索到真实文献并将其应用到论文写作当用的功能。

项目地址:https://github.com/14790897/paper-ai

在线使用:www.paperai.life

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0