top of page

AI 正在审计科学记录,还揪出了 75 年前的错误

5天前
讀畢需時 4 分鐘

已更新:7小时前

Image: "Schlagwortkatalog" by Dr. Marcus Gossler (CC BY-SA 3.0) via Wikimedia Commons, recoloured.

8月10日

欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及各领域顶级商科与社会科学期刊。

AI 正在审计科学记录,而记录节节败退

三年来,关于 AI 与科研诚信的争论只朝一个方向进行:当机器用捏造的文本和虚构的引文污染文献时会发生什么。本周 [Nature 报道](https://www.nature.com/articles/d41586-026-02235-8)了反向运行的车流。杭州之江实验室的一位理论化学家用 AI 系统预测沸点,而系统不断给出与一份有 75 年历史的参考数据库中长期被接受的条目相冲突的数值。他回头逐条核对原始文献,结果发现出错的是参考数据,而非模型。在其他案例中,同样的方法还找出一篇已发表论文中的笔误,以及一组错误的、百年前的沸点测量值。Nature 指出,这项技术在发现旧论文和参考工具书中的错误方面表现得异常出色。警示与发现同样重要:这些工具“像人一样会犯错”,因此每一条被标记的结果仍需人工核验,才能真正算数。

这种能力落在了一场争论的正中央:AI 究竟该被放在质量控制流水线的哪个位置。在 Management Science 上,一个团队在[“以火攻火”](https://doi.org/10.1287/mnsc.2026.00184)一文中主张,AI 加速的写作已使投稿量超过了志愿审稿人队伍能够消化的规模,拖垮了审稿周期和决策准确性,因此期刊别无选择,只能把大型语言模型引入审稿流程,并从一条具体、有边界的 LLM 辅助流水线做起。同一期的一篇[评论](https://doi.org/10.1287/mnsc.2026.02443)对框架本身而非工具提出异议:别去造一台更好的传真机。把 AI 拴在现有的投稿、评审与发表架构上,保住的是一套为稿件稀缺和读者稀缺而设计的系统,而真正值得抓住的机会,是重新思考知识究竟该如何被评价与传播。与此同时,Science 则就我们如何测量 AI 本身提出了平行的主张,呼吁以多样性、人机伙伴关系和系统性为核心,去构建图灵测试的后继者,而不是模仿某一个人。

**为何重要:** 发表后的错误检测,是 AI 的弱点几乎不构成妨碍的第一项工作。一个能大规模标记可疑取值的模型,即便精度平平也有用武之地,因为每一个命中都会由人来核验,而一次误报的代价只是在档案库里泡一个下午。这与 AI 辅助同行评审的经济学截然不同,在那里,一次错误的判断会悄无声息地毙掉或放行一篇论文。可以预期,AI 在学术质量控制中的第一个持久角色将出现在发表之后,而非之前;也可以预期,当某个工具指向你自己领域已引用几十年的参考表时,会有几周不好受的日子。如果你的工作依赖经典的常数、基准数据集或人工整理的表格,那么今年就该问一问:上一次有人核查它们是什么时候。

本周更多动态

AI 智能体正在文献中揪出几十年前的错误

之江实验室的一位化学家发现,他的 AI 系统那“错得离谱”的沸点预测其实是对的,被它们顶撞的 75 年前的参考数据反而错了。相关案例还找出一篇已发表论文中的笔误,以及一组不正确的、上百年前的测量值。Nature 强调,AI 事实核查者本身仍是不可靠的裁决者,它们会犯人类式的错误,因此在任何修正之前,被标记的条目都需要人工核验。

[阅读 Nature 原文(8月6日)→](https://www.nature.com/articles/d41586-026-02235-8)

把 AI 注入同行评审的理由

Management Science 的作者们指出,作者的 AI 采用加速了论文产出与投稿率,使审稿人容量吃紧,并损害了周转时间和决策准确性等期刊指标。他们的应对是一套具体的工作流,把大语言模型作为第一步部署进评审过程,而非全面取代人类判断。这是顶级期刊最早一批严肃的运营方案之一,远不止是一份立场声明。

[阅读 Management Science 原文(8月7日)→](https://doi.org/10.1287/mnsc.2026.00184)

别造一台更好的传真机

这篇同刊评论承认 AI 能缓解审稿人短缺并提升生产力,但警告这类应用在很大程度上保留了科学出版业的既有架构。文章借助运营管理与创新研究的视角论证,AI 实际上创造了一个契机,让我们能重新想象学术知识被评价与传播的更根本的方面。这场分歧的关键不在 AI 是否有用,而在于这个领域应该解决的是什么问题。

[阅读 Management Science 原文(8月7日)→](https://doi.org/10.1287/mnsc.2026.02443)

下一代图灵测试

模仿某个人,从来就是一个狭窄的目标,如今更成了一个误导性的目标。这篇 Science 文章主张,评估 AI 进展的新方法应当围绕能力多样性、人机伙伴关系和系统性效应来组织,而非一场单一的对错问答。对那些在方法部分评估 AI 工具的研究者而言,它有助于重新厘清“好的表现”究竟指什么。

[阅读 Science 原文(8月6日)→](https://doi.org/10.1126/science.aee3176)

生成式 AI 作为未测试内容的因果预测工具

生成式 AI 让新内容的生产变得廉价,而这又吊诡地使筛选更难:管理者面对一个爆炸式扩张的选项集,却几乎没有机会测试其中任何一项。这篇 Journal of Marketing Research 论文开发了一个因果预测框架,用以评估从未投放过的新颖非结构化处理,文本、图像、创意变体。这一底层问题远远超出营销的范畴,对任何想要为尚未投放的刺激获取效应估计的研究者都适用。

[阅读 Journal of Marketing Research 原文(8月3日)→](https://doi.org/10.1177/00222437261476639)

LLM 可能让我们“做得更多,做得更差”

Nature 报道的一项建模研究预测,LLM 的采用会加快研究过程的每个阶段,但这种加速更多体现为论文数量的增加,而非质量的提升:研究者跳向下一个项目,而不是打磨手头这一个。合作者 Carl Bergstrom 明确表示,工具并非根源;这一结果反映的是一个早已奖励数量甚于质量的激励体系,“LLM 只是把我们本来就有的问题举到镜子前。”

[阅读 Nature 原文(7月31日)→](https://www.nature.com/articles/d41586-026-02397-5)

本周内容到此为止。欢迎把本文转发给仍在无条件信任手册里每个数字的同行,也欢迎访问 gaiforresearch.com,探索更多适用于您研究的工具。

AI 科研动态速览

留言


这项倡议得到了以下组织的支持:

  • Twitter
  • LinkedIn
  • YouTube
logo_edited.png
bottom of page