top of page

LLM 能替代人类被试吗?

5天前
讀畢需時 4 分鐘

已更新:7小时前

Image: "Empty seats" by ProjectManhattan (CC BY-SA 3.0) via Wikimedia Commons, recoloured.

8月3日

欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科期刊。

LLM 作为合成被试:廉价的预实验,还是一条走得太远的捷径?

当前社会科学中影响最深远的方法论之争,是语言模型能否替代人类参与者。在 Strategic Management Journal 上,Matteo Tranchero、Cecil-Francis Brenninkmeijer、Arul Murugan 和 Abhishek Nagaraj 为战略研究给出了迄今最具体的回答之一:一个以[LLM 驱动的智能体作为合成被试](https://doi.org/10.1002/smj.70112)来设计与运行仿真实验的框架。将其应用于经典的“探索与利用”两难时,他们报告基于 LLM 的实验复现了人类被试身上观察到的模式,而这恰恰是让该方法既诱人又危险的那个结果。

作者将这一方法定位为[快速、低成本地为人类实验制作原型并生成新假设](https://doi.org/10.1002/smj.70112)的工具,而非人类数据的替代品。这一定位很重要。一个花几美元、一夜跑完的合成预实验,可以在你把钱花在真实样本库之前就否掉一个糟糕的设计,也可以扫过任何 IRB 批准的研究都负担不起的参数空间。但复现一个已知的行为模式是一个很弱的检验:一个用几十年已发表社会科学训练出来的模型,理应能恢复那些出现在其训练数据中的发现。与教科书结论相合只是入场券,而非验证;有意思的问题在于这些智能体能否把新颖的情形做对,而那恰恰是你没有人类基准可供核对的环节。

**为何重要:** 如果你在营销、管理、信息系统或心理学领域做实验,这如今已是一个现实的设计选择,而非奇谈。站得住脚的用法在上游:用智能体预试刺激、删减条件、生成假设,然后为任何你打算声明的结论采集人类数据。站不住脚的用法在下游:把智能体的行为当作关于人的证据来报告。审稿人已经开始磨砺这条分界线,一篇模糊它的论文迟早会被抓住。去读那个框架,借用其原型化流程,并在确证性研究中保留人类被试。

本周更多动态

PNAS 发问:科研仍将是一项人类事业吗

Michael Hochberg 和 Peter H. Thrall 借 PNAS 的一篇视角文章把问题摆得很直接:AI 将重组科学,而研究是否仍是人类的事业,还是一个开放问题。它是对 AI 采用实证工作的有益补充,因为它把镜头从个体生产力转向科学事业的结构本身:谁来设定问题、谁获得荣誉,以及人的角色将变成什么。

[阅读 PNAS 原文(7月29日)→](https://doi.org/10.1073/pnas.2610088123)

监控摄像头变成“线下点击流”

实体零售商从来没能拥有电子商务借助点击流数据获得的那种实时行为可见性。在 Information Systems Research 上,Rubing Li、Wen Wang、Kaiquan Xu 和 Anindya Ghose 构建了一个视频分析框架,把普通的店内监控录像转化为结构化的行为记录,用行人重识别、轨迹重建、姿态估计和视觉语言模型来预测店内购买。对消费者研究者而言,它既是一个丰富的新数据源,也是一个需要在数据进入实验室之前就想清楚的隐私问题。

[阅读 Information Systems Research 原文(7月29日)→](https://doi.org/10.1287/isre.2023.0432)

医疗 AI 有一个测量问题

Arjun K. Manrai 在 Nature 上撰文指出,评估医疗 AI 的这个领域正在测量错误的东西。这一批评远不止适用于医学:任何采纳排行榜式基准的学科,都会继承“在精心策划的测试集上得高分”与“在工具本该服务的复杂现实场景中有用”之间的落差。如果你正在为自己领域中的 AI 工具设计评估,值得一读。

[阅读 Nature 原文(7月28日)→](https://doi.org/10.1038/d41586-026-02125-z)

AI 生成的成人内容与线下犯罪

Siddharth Bhattacharya、Yun Young Hur 和 Gal Oestreicher-Singer 在 MIT Sloan Management Review 上报告,一项对日本国家警察厅详细犯罪数据的分析发现,在被标记为 AI 生成且仅限成人的材料的参与度峰值时段,强奸案发率出现统计上显著的上升。作者将其表述为提供此类工具与场地的公司所面临的一个迫近的声誉与法律风险。与任何针对敏感结果的观察性设计一样,其识别策略值得细读,但它所提出的关于生成式 AI 下游社会效应的问题,商科学者不能置之不理。

[阅读 MIT Sloan Management Review 原文(7月29日)→](https://doi.org/10.63383/wiap5820)

AI“光枪”重塑蛋白质

Nature 报道了 Raygun,一个能够缩小或放大蛋白质的 AI 系统,其开发者称这一能力为更简便的蛋白质编辑打开了大门。它提醒我们:当社会科学还在争论合成被试时,生命科学中的生成模型已经拿出了在实验台上接受检验的设计,而不只是在研讨会上被争论。

[阅读 Nature 原文(7月29日)→](https://doi.org/10.1038/d41586-026-02335-5)

从观测数据中学出可解释的治疗策略

Nathanael Jo、Sina Aghaei、Andrés Gómez 和 Phebe Vayanos 在 Management Science 上提出一种混合整数优化方法,用于从观测数据而非随机化数据中学习最优的处方式树,也就是二叉树形式的、可解释的治疗分配策略。对一个必须向监管者、临床医生或管理者解释其干预的领域而言,一棵深度适中的可解释策略,往往胜过一个只略微更准的黑箱。

[阅读 Management Science 原文(7月30日)→](https://doi.org/10.1287/mnsc.2021.02813)

本周内容到此为止。欢迎把本文转发给正要开展预实验的同行,也欢迎访问 gaiforresearch.com,探索适用于您自身研究的 AI 工具。

AI 科研动态速览

留言


这项倡议得到了以下组织的支持:

  • Twitter
  • LinkedIn
  • YouTube
logo_edited.png
bottom of page