机器人审稿人来了,却没人同意谁该负责
已更新:12小时前

Image: "In Peer Review We Trust" by Sarahmirk (CC BY-SA 4.0) via Wikimedia Commons, recoloured.
欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科与社会科学期刊。
AI 已从实验室工作台走向审稿人的办公桌
在过去两年里,关于 AI 在科研中作用的争论一直围绕着"输入端":更好的文献检索、更快的编码、更干净的草稿。而本周,讨论重心果断转向了"把关端"。在 [Science](https://doi.org/10.1126/science.aem0443) 的报道中,Jeffrey Brainard 指出,随着 AI 能力不断增强,研究人员和出版机构正在积极探索如何用它来支持同行评审,以及它在哪些方面仍显不足。这种表述很重要:问题已不再是审稿人是否会悄悄把稿件粘贴进聊天机器人,而是期刊是否应当刻意构建这一能力,并附上相应规则。
问责问题紧随其后。[Nature](https://doi.org/10.1038/d41586-026-02686-z) 在一篇题为《谁该为用 AI 撰写的科学负责?》的文章中直截了当地提出了这一问题。这一疑问迄今被署名政策以武断方式回答(AI 不能成为作者),而不是去厘清,一旦模型起草了方法部分,人工签名究竟在证明什么。而第三篇 [Nature](https://doi.org/10.1038/d41586-026-02682-3) 专题则追问,AI 是否正让我们所有人思维趋同。这一同质化担忧潜藏于上述两者之下:如果同一批模型既帮忙写论文,又帮忙筛选论文,那么被提出和被接受的成果的多样性就会从两端同时收窄。
**为何重要:** 如果你参与评审、编辑或投稿,也就是我们所有人,那么今年正在起草的这些政策将支配你未来十年的工作。它们现在正在被书写,且基本没有来自社会科学和商科领域的意见参与,而这些领域恰恰最可能因研究前沿收窄而遭受损失。务实的做法并不光鲜:在下次投稿和下次评审之前,先阅读目标期刊的 AI 政策,并在你的投稿信和评审报告中明确说明你使用了什么、又亲自核实了什么。主动披露的价值远远大于被编辑发现时的披露。
本周更多动态
因果推断终于可以用于文本和图像
Kosuke Imai 与 Kentaro Nakamura 提出了生成式 AI 推断(GenAI-Powered Inference, GPI),这是一种利用非结构化数据进行因果推断的统计框架。GPI 使用开源的预训练生成模型(LLM 和扩散模型),既用于大规模生成非结构化数据,也用于提取能够保证捕获数据底层结构的低维表征,然后对这些表征应用机器学习来估计因果量。对于任何在市场营销、政治学或组织研究中开展基于文本或图像实验的人来说,这是一份难得真正可用的方法学基础设施。
[阅读 PNAS 原文(9月3日)→](https://doi.org/10.1073/pnas.2530532123)
告诉人们 AI 知道什么,能让他们更好地委派任务
既有研究已经确立:当人类在自己与 AI 之间分配任务时,他们要么委派得太少,要么委派了错误的任务,从而破坏了本应让这种组合变得有价值的互补性。这项 ISR 研究考察了不同类型的 AI 系统信息会如何影响人们委派的频率以及委派任务的选择质量。其设计启示十分直接:你告诉用户关于系统的信息,其本身就是一种干预,而不仅仅是文档说明。
[阅读 Information Systems Research 原文(9月4日)→](https://doi.org/10.1287/isre.2024.1330)
吸收能力建立在"仅有人类"的假设之上
作者在 Research Policy 上撰文论证,吸收能力(absorptive capacity)这一构念的功能、维度与内在关系,都源自一个隐含假设:人类是知识吸收背后唯一的学习主体,而 AI 打破了这一假设。借助一种结合概念映射与质性访谈的溯因式理论构建设计,该论文重新审视了 AI 与组织知识吸收之间的关系。对于任何想知道本领域哪些经典构念需要悄然重新界定的研究者来说,这是一份有用的模板。
[阅读 Research Policy 原文(9月1日)→](https://doi.org/10.1016/j.respol.2026.105600)
可解释 AI 切实改善了对自动驾驶汽车的预测
大多数可解释性研究停留在仿真和玩具式设置中,其实际价值未经检验。这篇 Nature 论文将可解释深度学习引入现实世界的自动驾驶部署,发现它能改善人类对系统的心理模型:也就是说,人们能更好地预判黑盒规划器何时会出错。对于研究人机信任校准的研究者而言,这是少数可用的"实战级"结果之一。
[阅读 Nature 原文(9月2日)→](https://doi.org/10.1038/s41586-026-10950-5)
B2B 客户离开前如何说话
通过以实证优先的方法处理 B2B 客户的语言数据(在线评论与客服通话记录),这篇 JAMS 论文循序识别出一组稳健而简洁的语言特征,这些特征可诊断客户体验,并能预测即将到来的购买决策,论文检验了五类特征。这是把"以数据为文本"用于预测而非描述的一个干净范例,而该特征集也可移植到其他关系密切的场景中。
[阅读 Journal of the Academy of Marketing Science 原文(8月24日)→](https://doi.org/10.1007/s11747-026-01192-y)
从特洛伊木马到防 AI 的考试
一篇 Nature 职业专题收集了学者们为打击评估中未声明的 AI 使用而部署的策略,从重新设计更具抵抗力的考试,到在作业要求中植入隐蔽指令以抓住整段抄袭。比起这些技巧,更值得读的是其背后的信号:评估设计(而非检测软件)才是这一领域正在汇合的方向。
[阅读 Nature 原文(9月1日)→](https://doi.org/10.1038/d41586-026-02370-2)
本周内容到此为止。欢迎把它转发给那位正准备撰写下一份评审报告的同事,也欢迎访问 gaiforresearch.com,探索可用于你自身研究的 AI 工具。
AI 科研动态速览





留言