57% 的论文留有 AI 痕迹,但我们真能数得清吗?
已更新:12小时前

Image: "British Museum Reading Room Panorama Feb 2006" by Diliff (CC BY 2.5) via Wikimedia Commons, recoloured.
7月29日
欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科与社会科学期刊。
文献中有多大比例出自 AI 之手?PNAS 如今争的是尺子,而非读数
今年五月,Kyle Siler 发表了大概是对已发表文献中 AI 足迹规模最大的一次审计:一项对 2020 至 2025 年间 Elsevier、Frontiers、MDPI 和 PLoS 旗下 730 万篇期刊论文全文的分析。该研究构建了一个由 228 个“焦点词”组成的语料库,这些词的词频在 2022 年之后以与 LLM 输出相一致的方式急剧跃升;[该研究](https://doi.org/10.1073/pnas.2605754123)估计,到 2025 年,约 57% 的已发表论文显示出 LLM 影响的证据,高于 2023 年的 12%。对社会科学家而言,比头条数字更有意思的是其分层结构:双重差分模型发现,与 LLM 相关的语言在地区、机构层级、出版商、学科与期刊层级之间存在显著差异,其中经济发展水平和与英语母语环境的距离是最强的地区预测因子之列。排名较低的机构比精英大学显示出更高的比例;年轻的营利性出版商相对于同行也显示出更高的水平。在 Siler 的表述中,这种采用虽然普遍,但在社会上是有分层的。
本周,PNAS 刊出了质疑的声音。在一封题为[“词汇变化并非 LLM 普及率或其决定因素的校准测量”](https://doi.org/10.1073/pnas.2620928123)的信中,Chad M. Topaz 和 Utsav Bahl 恰恰质疑头条数字所依赖的那一步推断:某些词汇频率的上升,可以被折算成 LLM 使用率,或被用来识别谁在采用这些工具。Siler 在[回应](https://doi.org/10.1073/pnas.2621834123)中把这项工作的贡献重新表述为对 2022 年后学术散文词汇变迁的解读,而非某台校准仪器的读数。这场分歧之所以重要,是因为词频方法已然悄然成为该领域默认做法:[Kobak 及其同事](https://doi.org/10.1126/sciadv.adt3813)用超额词汇分析对超过 1500 万篇生物医学摘要进行分析,为 2024 年经 LLM 处理的摘要给出了 13.5% 的下界;而[一项发表于 Nature Human Behaviour 的研究](https://doi.org/10.1038/s41562-025-02273-8)则把相关的估计方法用于科学论文。两个估计相差四倍,这本身就是故事。
**为何重要:** 只要你把文本当数据用(如今多数社会科学家和营销研究者都是如此),这就是一个针对你自身研究流程的、正在发生的方法论警告。词汇代理指标廉价、可扩展、直观,而这恰恰是它们被当作测量而非需要验证的相关项的原因。同样的批评远远超出 AI 检测的范畴:它同样适用于情感词典、主题模型标签,以及任何从词频推断出、随后再对人口统计变量或机构层级做回归的构念。在写下一篇“文本即数据”论文之前,先问一问针对你的测量所做的校准研究会是什么样子,因为审稿人很快就会开始发问。
本周更多动态
大多数组织协调或许并不必要,AI 智能体帮助证明了这一点
Harang Ju 从分布式系统理论中借用了一个精确的判据:只有当任务规约是非单调的,也就是后来的信息可能推翻先前结论时,协调才真正必要。他论证 Thompson 经典的相互依赖类型学可以映射到该判据之上,然后把由此得到的决策规则应用于 65 个 APQC 工作流和 13,417 个 O*NET 任务(用一个经过校准的 LLM 打分),并辅以多智能体 AI 仿真。在他的分解下,74% 的工作流和 42% 的任务是单调的,这意味着 24% 到 57% 的协调支出对正确性而言是不必要的。多智能体 AI 少见地充当了经典组织理论的测量仪器。
[阅读 PNAS 原文(7月27日)→](https://doi.org/10.1073/pnas.2606267123)
仅凭 14 个样本的机器学习
训练数据稀疏,向来是“我们这里用不了机器学习”的标准理由。Shan 及其同事把基因组导向的数据增强与蛋白质语言空间中的对比学习结合起来,从仅有的 14 条已知吩嗪修饰序列出发,他们把这一方法称为 ML-CITO。它带来了 PTC 的发现,这是一种催化吩嗪修饰的酶,而人们长期假定这种修饰只能经由非酶化学发生;该发现已得到模拟与生化表征的确认。可以推广的教益在于配方本身:利用领域结构去制造有信息量的训练信号,而不是坐等一个大数据集出现。
[阅读 PNAS 原文(7月27日)→](https://doi.org/10.1073/pnas.2607571123)
Stable Diffusion 作为文化分析的工具
Kim 及其合作者没有用生成式 AI 来作画,而是用它读画:从五百年西方绘画中提取两类潜在信息,一类是色彩等形式层面的信息,一类是题材等语境层面的信息。语境信息与艺术史惯常的时期、风格和单个艺术家的吻合程度,远高于形式元素。团队随后通过向历史画作注入可能的语境、并合成符合目标时期风格的绘画,验证了这一几何结构。对任何对文化产品做计算分析的人来说,这提供了一个把生成模型的嵌入空间当作测量装置的范本。
[阅读 PNAS 原文(7月24日)→](https://doi.org/10.1073/pnas.2517969123)
年报中的照片究竟在向投资者传递什么
Ben-Rephael、Ronen、Ronen 和 Zhou 用机器学习算法评估公司年报中照片(而非图形或图表)的信息含量,并开发了一个“内容强化”的度量,用以捕捉投资者从图像中提取的信息在多大程度上补充了文字叙述。当资产增长、业务复杂性和可读性较差的披露使信息加工成本高昂时,公司会使用更多照片;在分析师覆盖面外生下降之后,它们也会增加照片的使用。更高的图像普遍度和更强的文本强化,与更准确、分歧更小的分析师预测相关联。这是一个干净的例子,展示多模态机器学习如何打开了一条纯文本研究一直忽视的披露渠道。
[阅读 Review of Accounting Studies 原文(7月21日)→](https://doi.org/10.1007/s11142-026-09975-y)
模块化并不能取代协调,关键在于是哪一种
Amrit Tiwana 借助 Simon 的制品理论,把平台模块性拆解为三个侧面:解耦、接口,以及限定应用内部行为边界的“设计规则”。协调与促进可分性的侧面互补,却与促进整合性的侧面相互替代;而设计规则在平台上无处不在、理论上却长期被忽视,它们制造出必须由协调来消解的多义性。论文明确把论证延伸到智能体 AI 与混合平台的前沿,在那里,生态系统所有者应当购买多少协调,这个问题将变得远为尖锐。
[阅读 Information Systems Research 原文(7月13日)→](https://doi.org/10.1287/isre.2022.0444)
实用指南:AI 图形摘要,以及必须避免的图像错误
Nature 本周连发两篇实用指南:一篇逐步讲解如何在几分钟内用 AI 工具做出图形摘要,另一篇给出避免科研中 AI 图像错误的三个建议。值得放在一起读,而非分开读:前者的速度收益,只有在你把后者的失败模式内化之后才是安全的,毕竟各期刊为管制 AI 生成图形而行动的速度非常快。
[阅读 Nature 原文(7月22日)→](https://doi.org/10.1038/d41586-026-02072-9)
本周内容到此为止。欢迎把本文转发给正要开展“文本即数据”研究的同行,也欢迎访问 gaiforresearch.com,探索适用于您自身研究的 AI 工具。
AI 科研动态速览





留言