top of page

生成式AI助力科研计划

订阅我们


机器人审稿人来了,却没人同意谁该负责
Image: "In Peer Review We Trust" by Sarahmirk (CC BY-SA 4.0) via Wikimedia Commons, recoloured. 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科与社会科学期刊。 AI 已从实验室工作台走向审稿人的办公桌 在过去两年里,关于 AI 在科研中作用的争论一直围绕着"输入端":更好的文献检索、更快的编码、更干净的草稿。而本周,讨论重心果断转向了"把关端"。在 [Science](https://doi.org/10.1126/science.aem0443) 的报道中,Jeffrey Brainard 指出,随着 AI 能力不断增强,研究人员和出版机构正在积极探索如何用它来支持同行评审,以及它在哪些方面仍显不足。这种表述很重要:问题已不再是审稿人是否会悄悄把稿件粘贴进聊天机器人,而是期刊是否应当刻意构建这一能力,并附上相应规则。 问责问题紧随其后。[Nature](https://doi.org/1

Lille My
3天前讀畢需時 4 分鐘


科研中的 AI:生成式 AI 对工作本身做了什么
Image: "CM Deep Ellum 12122018-28 (1)" by Thecommondesk (CC BY-SA 4.0) via Wikimedia Commons.jpg), recoloured. 图片:Martin Vorel 的《Programming code》(CC BY-SA 4.0),来自 [Wikimedia Commons](https://commons.wikimedia.org/wiki/File:Programming_code.jpg),已重新调色。 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科与社会科学期刊。 生成式 AI 改变的是"构建什么",而不只是"多快" 生产率框架一直主导着生成式 AI 文献:这个工具能让人们更快吗?两项新研究将其推向了更远处。在 [Strategic Management Journal](https://doi.org/10.1002/smj.70118)(战略管理期刊)中,研究者研究了软件中产品层面

Lille My
4天前讀畢需時 4 分鐘


几乎所有生物医学论文都显示出 AI 的痕迹,技巧本身已经转移
Image: "Lab technitian looking through the microscope while adjusting coarse k" by Shixart1985 (CC BY 2.0) via Wikimedia Commons, recoloured. 8月24日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及各领域顶级管理学期刊。 几乎每篇论文里都有 AI。真正悬而未决的问题是:谁在指挥谁。 这个头条数字让人难以忽视。一篇于 8 月 12 日发布到 [arXiv](https://arxiv.org/abs/2608.10715)、并由 [Nature](https://www.nature.com/articles/d41586-026-02551-z) 报道的预印本估计,到 2025 年 12 月,PubMed Central 数据库中接近 90% 的论文显示出 LLM 辅助写作或编辑的痕迹,在整个 2025 年为 77%,2024 年为 52%。该方法延伸了同一团队发表

Lille My
4天前讀畢需時 5 分鐘


AI 真的能让你更高效吗?证据变得更不可靠了
Image via Wikimedia Commons.jpg) (public domain). 8月17日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科期刊。 当"AI 让我更高效"其实只是你对处理方式的定义 关于 AI 在科学领域最常被引用的说法之一是:开始使用大型语言模型的研究者发表成果明显更多。问题在于,没有人能直接观察到"采纳"行为,因此研究通常只能推断它,也就是从检测器标记为 LLM 辅助的第一篇论文入手。在一篇新的 PNAS 通讯中,[《Scientific production in the era of large language models: Outcome-triggered treatment timing and spurious event-study dynamics》](https://doi.org/10.1073/pnas.2618638123)的作者指出,这个推断规则正是问题所在。由于高产出月份在机制上更可能包含一篇被检测到的论文,处理时

Lille My
4天前讀畢需時 5 分鐘


AI 正在审计科学记录,还揪出了 75 年前的错误
Image: "Schlagwortkatalog" by Dr. Marcus Gossler (CC BY-SA 3.0) via Wikimedia Commons, recoloured. 8月10日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及各领域顶级商科与社会科学期刊。 AI 正在审计科学记录,而记录节节败退 三年来,关于 AI 与科研诚信的争论只朝一个方向进行:当机器用捏造的文本和虚构的引文污染文献时会发生什么。本周 [Nature 报道](https://www.nature.com/articles/d41586-026-02235-8)了反向运行的车流。杭州之江实验室的一位理论化学家用 AI 系统预测沸点,而系统不断给出与一份有 75 年历史的参考数据库中长期被接受的条目相冲突的数值。他回头逐条核对原始文献,结果发现出错的是参考数据,而非模型。在其他案例中,同样的方法还找出一篇已发表论文中的笔误,以及一组错误的、百年前的沸点测量值。Nature 指出,这项技术在发现旧论文和参考工具书

Lille My
5天前讀畢需時 4 分鐘


LLM 能替代人类被试吗?
Image: "Empty seats" by ProjectManhattan (CC BY-SA 3.0) via Wikimedia Commons, recoloured. 8月3日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科期刊。 LLM 作为合成被试:廉价的预实验,还是一条走得太远的捷径? 当前社会科学中影响最深远的方法论之争,是语言模型能否替代人类参与者。在 Strategic Management Journal 上,Matteo Tranchero、Cecil-Francis Brenninkmeijer、Arul Murugan 和 Abhishek Nagaraj 为战略研究给出了迄今最具体的回答之一:一个以[LLM 驱动的智能体作为合成被试](https://doi.org/10.1002/smj.70112)来设计与运行仿真实验的框架。将其应用于经典的“探索与利用”两难时,他们报告基于 LLM 的实验复现了人类被试身上观察到的模式,而这恰恰是让该方法既诱

Lille My
5天前讀畢需時 4 分鐘


57% 的论文留有 AI 痕迹,但我们真能数得清吗?
Image: "British Museum Reading Room Panorama Feb 2006" by Diliff (CC BY 2.5) via Wikimedia Commons, recoloured. 7月29日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科与社会科学期刊。 文献中有多大比例出自 AI 之手?PNAS 如今争的是尺子,而非读数 今年五月,Kyle Siler 发表了大概是对已发表文献中 AI 足迹规模最大的一次审计:一项对 2020 至 2025 年间 Elsevier、Frontiers、MDPI 和 PLoS 旗下 730 万篇期刊论文全文的分析。该研究构建了一个由 228 个“焦点词”组成的语料库,这些词的词频在 2022 年之后以与 LLM 输出相一致的方式急剧跃升;[该研究](https://doi.org/10.1073/pnas.2605754123)估计,到 2025 年,约 57% 的已发表论文显示出 LLM 影响的证据,高于

Lille My
5天前讀畢需時 5 分鐘


当 AI 成为方法:标准、基准,以及由谁来验证机器
Image via Wikimedia Commons.jpg) (public domain). 7月27日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、PNAS 以及各领域顶级商科与社会科学期刊。 AI 已悄然成为研究工具,而验证工作尚未跟上 本周最相关的两篇论文关注的都是方法,而非模型。在 Journal of Consumer Psychology 上,一组[评论文章](https://doi.org/10.1002/jcpy.70037)回应 Schmitt、Hao、Pham 和 Hofstetter 提出的生成式扎根理论(Generative Grounded Theory, GGT),这是一个七步框架,让生成式 AI 深度参与语料库构建、数据结构化、编码、概念聚类、抽象化、理论整合以及饱和度评估。这意味着 AI 已经进入诠释研究者传统上行使判断力的几乎每一个步骤,远远超出了质性项目的边缘地带。评论这一体裁本身就是信号:学界尚未就这类框架能担保什么达成共识,还在通过纸面论辩解决分歧。 同一问题的定量侧面出现在 [

Lille My
9月6日讀畢需時 4 分鐘


科研中的 AI:你的智能体相信你喂给它的任何东西
7月20日 更新:7月27日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及各领域顶级期刊。 智能化科研真正的薄弱环节:你允许智能体读什么 本周最令人不安的结果同时也是最简单的。据 [Nature](https://www.nature.com/articles/d41586-026-02071-w) 报道,研究人员下载了五个争议议题上的公开数据集,对其加以改动,使统计趋势的方向和强度发生变化,再将改动后的版本上传至私有仓库。随后,他们让 Anthropic、OpenAI 和 Google 构建的 AI 智能体同时访问公开仓库与被篡改的仓库,并要求其依据数据回答问题。平均而言,大约有一半的情况下,智能体轻信了被操纵的数据集,得出了"欺诈者"想要的结论。(该研究为预印本,尚未经同行评审。) 将这一结果与另外两项进展放在一起读,一个模式浮出水面:AI 辅助科研的压力点正从*生成*转向*验证*。在首尔举行的 [ICML 2026](https://www.techtimes.com/articles/319684

Lille My
9月6日讀畢需時 4 分鐘


一个数据集,多个 AI 分析师:任何你想要的答案
7月16日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科期刊。 当可辩护的分析变得廉价,证据便会充裕,却不再可信 几十年来,对 p 值操纵(p-hacking)的实际约束是人力成本。多分析师研究(many-analyst studies)由多个独立团队在同一数据上检验同一假设,并且经常得出相互冲突的结论,这类研究证明了可辩护分析构成的多元宇宙确实存在,但组织一次这样的研究需要昂贵的人力协调。本周,Martin Bertran、Riccardo Fogliato 和 Zhiwei Steven Wu 撤除了这道刹车。他们在 [PNAS](https://doi.org/10.1073/pnas.2606495123) 上发表的研究基于大语言模型构建了完全自主的 AI 分析师,每个分析师在固定数据集和固定假设上独立执行完整的分析流程,并由另一个独立的 AI 审计员筛查每次运行的方法学有效性。在三个数据集上,AI 分析师再现了人类多分析师研究中观察到的分析离散度:效应量、*P*...

Lille My
9月6日讀畢需時 5 分鐘


AI 正在成为研究仪器:它既预测实验,也执行实验
7月11日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及各领域顶级期刊。 AI 正在成为研究仪器:它既预测实验,也执行实验 对社会科学家而言,本周最引人注目的结果以最令人不安的方式带来启发。Ashwini Ashokkumar、Luke Hewitt、Isaias Ghezae 和 Robb Willer 在 Nature 上汇集了 70 项预注册的、全国代表性的调查实验,覆盖 105,165 名美国被试中的 476 个处理效应,并让 GPT-4 模拟具有代表性的美国样本对每一项刺激的反应。模型预测的处理效应与真实处理效应的相关系数达到 r = 0.85,追平乃至超过了人类专家预测小组。关键在于,对那些不可能泄漏进训练数据的未发表研究,模型准确度依然保持(r = 0.90),尽管其倾向于高估效应量。Nature 的一篇配套评论主张审慎地使用大语言模型,在正式施测之前对研究设计进行筛选与预检验。 如果第一篇论文展示的是 AI 预测实验,第二篇论文展示的则是 AI 亲自运行实验。在 Science 上,Kex

Lille My
9月3日讀畢需時 4 分鐘


AI 已能自主设计实验,但验证仍在实验台
7月6日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及商学领域的顶级期刊。 AI 已能自主设计实验,但验证仍在实验台 过去两年,研究者获得的 AI 还只能总结论文、起草代码。本月,Nature 聚焦了更具雄心的进展:能够运行完整科学推理闭环的 AI 系统。Olivier Elemento 在一篇 News & Views 评论文章中介绍了两个独立开发的系统,即 Google DeepMind 的 Co-Scientist 与 FutureHouse 的 Robin:它们生成假设、设计实验加以检验、解读结果,并依据发现修正假设。其设计目标是成为参与发现循环每一步的合作者,而非被动等待提示词的聊天机器人。相关基础工作已发表于 Nature 研究栏目,其中包括《Accelerating scientific discovery with Co-Scientist》。 这一定位框架与能力本身同样重要。Nature 的一篇配套文章《AI 工具能加速思考,但证据仍来自实验台》强调,此类智能体的定位是为科学家

Lille My
9月3日讀畢需時 4 分鐘


何时信任机器?算法厌恶与学术研究中的 AI 治理
6月30日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及商学与社会科学领域的顶级期刊。 算法厌恶并非全有或全无:抵触具有不对称性 十年来,“算法厌恶”(algorithm aversion)一直是解释好模型为何被束之高阁的最常被引用的理由之一:通常的说法是,人们一旦得知建议出自机器,便不再信任它。Saunak Basu、Alan R. Dennis、Aravinda Garimella 和 Wencui Han 在 Information Systems Research 上发表的新论文,对这幅过于整齐的图景提出了修正。在金融科技投资情境下开展的四项研究(两项随机对照实验、一项实地研究和一项质性访谈研究)中,他们发现对 AI 建议的抵触是不对称的:决定因素在于建议的实际内容,而非建议出自算法这一事实。 其机制与投资判断的方式有关。有些信号是显性的、可编码的;另一些则依赖于人类专家认为机器无法完全触及的隐性经验判断。当 AI 建议与专家的判断一致时,建议很容易被吸收;当建议与这种隐性判断相悖,即告诉专家其直

Lille My
9月3日讀畢需時 4 分鐘


当人工智能成为研究变量:AI 生成数据中的隐性偏差
6月28日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及商学与管理学顶级期刊。 当你让 AI 代为测量变量时,可能正在让研究结果产生系统性偏差 这已成为诸多学者的常规操作:调用大语言模型对在线评论进行情感打分、评估广告的审美水平,或是标记客户留言中的情绪倾向,随后直接将这些由 AI 生成的分数作为解释变量纳入回归方程,用以估计其对销售额或用户互动的影响。这种操作表面上看似严谨的科学测量,实则暗藏隐患。在发表于 Information Systems Research 的一篇前沿论文中,Jingwen Zhang、Wendao Xue、Yifan Yu 和 Yong Tan 指出,由于 AI 预测本身并不完美,直接将这些预测标签作为回归自变量代入模型,会给最终的效应估计带来系统性偏差。AI 标注过程中的误差不会在平均化过程中自行抵消,而是会直接传导并扭曲你的回归系数与统计推断。 作者团队针对部分线性模型开发了一套去偏校正程序,能够有效纠正 AI 生成自变量所引起的估计失真,从而恢复有效的一致估计与统计推断。

Lille My
9月2日讀畢需時 4 分鐘


科研中的人工智能:它是否在悄然削弱科学家的专业技能?
6月24日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及商学与社会科学领域的顶级期刊。 技能退化之问:人工智能是否正在侵蚀它本应增强的能力? 两年来,关于科研领域中人工智能的主流叙事始终聚焦于加速:论文产出更多、分析速度更快、准入门槛更低。本周 Nature 转换视角,探讨我们可能正在失去什么。在一篇题为《AI 正在毁掉我们的技能吗?早期研究结果出炉,情况不容乐观》("Is AI ruining our skills? Early results are in: and they're not good")的专题报道中,该杂志系统梳理了最新证据,指出过度依赖 AI 助手可能会侵蚀那些工具本应支持的核心能力,包括批判性阅读、复杂问题解决以及严谨写作。人们担忧的核心在于,将认知工作全盘外包会逐步削弱人类自身的判断力,导致研究者丧失及时发现并纠正错误的能力。 这种个体层面的担忧在学术群体层面同样存在映射。在《AI 会引发科学复兴还是走向同质化单一种植?》("Will AI spark a scientific

Lille My
9月2日讀畢需時 4 分鐘


人工智能与个人技能:是拐杖还是协同搭档?
6月20日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及管理学与社会科学领域的顶级期刊。 人工智能:技能拐杖还是超级队友? 本周有两项研究得出了截然相反的结论,将这两者结合起来审视,是当下研究者最有价值的思考方式。首先是担忧:Nature 报道称,关于 AI 对人类技能影响的早期研究结果已经出炉,且情况不容乐观。随着人们将推理、写作与判断外包给聊天机器人,新出现的研究表明底层的人类技能可能会逐渐退化,其认知机制就如同过度依赖 GPS 会削弱个人方向感一样。对于任何指导学生或倚重深厚专业知识的人而言,这绝非空泛的担忧。 接着是制衡的另一面。在一项针对宝洁公司(Procter & Gamble)791 名专业人士的预注册现场实验中(发表于 Organization Science),研究人员将参与者随机分配,让他们在有或没有 AI 辅助的情况下,单独或组队解决真实的产品创新难题。这个"赛博队友"不仅提高了产出效率:单独与 AI 协作的个体表现达到了未借助 AI 的两人团队水平;AI 通过帮助专家在自身专业之外

Lille My
9月1日讀畢需時 4 分鐘


科研中的人工智能:医疗智能体亮相,以及 AI 是否正在收窄科学视野?
6月19日 欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 及各领域顶级期刊。 人工智能正在赋能科学家,却在收窄科学的探索焦点 本周最重磅的研究是对科学研究体系本身的一次深刻审视,而非某个新模型发布。Qianyue Hao、Fengli Xu、Yong Li 与 James Evans 在 Nature 发表论文,通过对 4,130 万篇论文的深入分析指出:采用 AI 工具的研究人员在职业生涯中发表的论文数量约为未采用者的 3 倍,累计被引次数更是接近后者的 5 倍。几乎从所有个体层面的指标来看,AI 都是现代学术界所见过的最强生产力倍增器。 但从学术界的整体生态来看,情况则截然不同。该研究发现,随着学者们普遍依赖 AI,整个学术界的注意力正在向一组日益收窄、高度拥挤且回报丰厚的热门课题集中。Traberg、Roozenbeek 与 van der Linden 在 Communications Psychology 发表的同期评论直接指出了这种风险:一种"科学单一栽培"(scientific...

Lille My
9月1日讀畢需時 3 分鐘
bottom of page