当 AI 成为方法:标准、基准,以及由谁来验证机器
已更新:12小时前

Image via Wikimedia Commons.jpg) (public domain).
7月27日
欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、PNAS 以及各领域顶级商科与社会科学期刊。
AI 已悄然成为研究工具,而验证工作尚未跟上
本周最相关的两篇论文关注的都是方法,而非模型。在 Journal of Consumer Psychology 上,一组[评论文章](https://doi.org/10.1002/jcpy.70037)回应 Schmitt、Hao、Pham 和 Hofstetter 提出的生成式扎根理论(Generative Grounded Theory, GGT),这是一个七步框架,让生成式 AI 深度参与语料库构建、数据结构化、编码、概念聚类、抽象化、理论整合以及饱和度评估。这意味着 AI 已经进入诠释研究者传统上行使判断力的几乎每一个步骤,远远超出了质性项目的边缘地带。评论这一体裁本身就是信号:学界尚未就这类框架能担保什么达成共识,还在通过纸面论辩解决分歧。
同一问题的定量侧面出现在 [Journal of Management](https://doi.org/10.1177/01492063261465289) 上,一项对 2013 至 2025 年间发表于顶级管理学期刊的 [353 篇计算语言学文章](https://doi.org/10.1177/01492063261465289)的综述发现,采用速度已超过共享标准的建立速度,而后者正是连接理论构念、语言数据与计算测量的关键。作者识别出影响基于计算语言学研究可信度的四大反复出现的挑战,换言之,十年积累的文本即数据研究,其增长快于评价它所需的惯例的形成。而在 [PNAS](https://doi.org/10.1073/pnas.2509757122) 上,一个呼吁在法律领域建立公开基准的团队,把同一论点推到了制度层面:市场上广泛销售的法律 AI 工具已在执业中使用,幻觉问题的记录之多,以至于首席大法官在司法机构年度报告中专门点名,然而关于这些工具实际表现的公开信息却少之又少。
**为何重要:** 当模型替你编码、替你构建构念或替你起草答案时,它的误差属性就成了你的误差属性,而审稿人目前尚无公认的质询手段。务实的做法是,把每一个 AI 参与的测量步骤当作你对待一份新量表的方式来处理:准确报告模型做了什么、由哪个模型和哪种提示词生成、你针对它做了哪些人工验证。未来五年能在同行评审中存活下来的方法部分,将是那些让工具显形的部分。
本周更多动态
生成式 AI 正在重塑企业需要哪些人类技能
由于生成式 AI 可以检索数据、执行分析和传递信息,它能替代从事这些活动的劳动者,同时补足依赖这些活动的劳动者。作者认为,自然而然的组织后果是技能降级:随着组织调整分工,企业对 GenAI 能够有效处理的人类技能的需求出现系统性下降。它把劳动力市场辩论的焦点从整岗替代,转向一场更安静的洗牌:哪些能力还会被企业雇用。
[阅读 Management Science 原文(7月24日)→](https://doi.org/10.1287/mnsc.2025.01859)
Stack Overflow 封禁 ChatGPT 后发生了什么
Stack Overflow 禁止由 ChatGPT 生成的提问与回答的政策,构成了一次自然实验,Information Systems Research 的这篇论文用横跨 Stack Overflow 与 Reddit 的双重差分设计加以利用。作者结合两个平台上的语言特征 NLP 测量与投票特征,考察这一禁令如何改变了社区的内容。关于平台层面的 AI 治理究竟会对知识公域产生什么影响,这是一份难得的实证解读。
[阅读 Information Systems Research 原文(7月24日)→](https://doi.org/10.1287/isre.2024.1235)
为什么分析越多,战略越难做
在 California Management Review 上,作者描述了许多领导团队正在亲历的悖论:随着分析能力愈发强大且普及,分析可以同时为多个不同的未来提供可信支持。于是约束条件从生成洞见转移到做出选择并维持对选择的承诺。对于研究或咨询 AI 增强决策的人来说,这是一个有用的框架。
[阅读 California Management Review 原文(7月20日)→](https://doi.org/10.1177/00081256261470443)
审计算法所需的统计学不同于审计人的统计学
歧视诉讼通常在调整可观测协变量后估计差距,以图揪出歧视意图。这篇 PNAS 论文指出,这一策略无法迁移到对当前常见辅助决策算法的审计上,因为这些算法的输入通常根本不包含种族或其他受法律保护的属性。对于从事公平性或审计研究的学者,这是对默认实证工具箱的直接挑战。
[阅读 PNAS 原文(7月20日)→](https://doi.org/10.1073/pnas.2509765122)
考虑种族的录取算法遇上 SFFA 案后的法律格局
在最高法院于 Students for Fair Admissions v. Harvard 案中裁定机构不得基于种族做出录取决定的同时,各大学已开始使用机器学习系统辅助录取决策。这篇 PNAS 文章梳理了这两条平行进展如何迫使教育机构乃至法院直面一个问题:考虑种族的算法究竟是什么。其意义远超录取本身,对任何为受保护属性建模的人都适用。
[阅读 PNAS 原文(7月20日)→](https://doi.org/10.1073/pnas.2509764123)
集体许可能否平息 AI 训练数据之争?
版权所有者已起诉多家大规模生成式 AI 系统的开发者,指控其将受版权保护的作品用作训练数据,而合理使用是被告的核心抗辩。这篇 PNAS 分析追踪了两个方向各自会引出什么(如果合理使用成立,开发者仍可自由地将现有模型商业化,并用相同数据训练新模型),并评估了集体许可这一替代机制。对于在已发表语料上构建或微调模型的研究者,这与他们直接相关。
[阅读 PNAS 原文(7月20日)→](https://doi.org/10.1073/pnas.2509769122)
科学家拒绝交给聊天机器人的事
当 AI 吸收了科研中越来越多的常规劳动,Nature 问科学家们,他们刻意把哪些工作留给自己。答案指向那些人们觉得有内在回报、而不仅仅是耗时的工作。在这个充斥治理与测量的星期里,这是一篇简短而富有人情味的对冲。
[阅读 Nature 原文(7月21日)→](https://doi.org/10.1038/d41586-026-02213-0)
本周内容到此为止。欢迎将本文转发给正让模型替自己编码的同行,也欢迎访问 gaiforresearch.com,探索适用于您自身研究的 AI 工具。
AI 科研动态速览





留言