AI 真的能让你更高效吗?证据变得更不可靠了
已更新:12小时前

Image via Wikimedia Commons.jpg) (public domain).
8月17日
欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 以及各领域顶级商科期刊。
当"AI 让我更高效"其实只是你对处理方式的定义
关于 AI 在科学领域最常被引用的说法之一是:开始使用大型语言模型的研究者发表成果明显更多。问题在于,没有人能直接观察到"采纳"行为,因此研究通常只能推断它,也就是从检测器标记为 LLM 辅助的第一篇论文入手。在一篇新的 PNAS 通讯中,[《Scientific production in the era of large language models: Outcome-triggered treatment timing and spurious event-study dynamics》](https://doi.org/10.1073/pnas.2618638123)的作者指出,这个推断规则正是问题所在。由于高产出月份在机制上更可能包含一篇被检测到的论文,处理时点便会与它本应解释的结果纠缠在一起,即便完全不存在因果效应,事件研究也会产生一个干净而有说服力的处理后跳升。
这项论证异常直接。作者利用重构后的 arXiv 数据,分别用随机处理分配、中性(非 AI)关键词触发、反向处理以及 ChatGPT 之前的安慰剂期运行同一设计,而每一种变体都重现了同样的处理后收益形态。真实效应恰好为零的模拟也同样重现了已发表的结果模式。他们的结论直白:仅凭首次检测的时点就能制造出证据。这项批评针对的是 Kusumegi 等人发表在 *Science* 390, 1240(2025)上的研究,但它适用于任何从产出流本身读取"采纳"时点的设计,涵盖科学计量学与企业层面研究中庞大且不断增长的 AI 与生产力文献。
它与上周另一篇来自流程另一端的有用现实检验同周而至。Nature 报道了一篇预印本:一个智能体系统被放到两篇计算机科学论文的概念上自由发挥,它发展了这些概念,但原作者并不买账。普林斯顿大学的 Sayash Kapoor 作为共同作者告诉 Nature:"我不认为端到端的开放式研究自动化近在眼前"([AI isn't ready to research itself](https://www.nature.com/articles/d41586-026-02494-5))。两则故事合在一起,描绘出一个自主 AI 研究的天花板低于宣传、而 AI 加速人类研究的证据比标题数字所暗示的更脆弱的领域。
**为何重要:** 如果你正在撰写一篇依赖"AI 将研究生产力提高了 X%"的论文、课题申请书或政策备忘录,在引用这个数字之前,先核查"采纳"是如何被测量的。更宽泛地说,这是一个伪装成数据问题的识别问题的教科书案例:当你的处理指标取自于生成结果的同一过程时,交错式事件研究图会看起来很漂亮,却毫无意义。同样的陷阱潜伏在每一篇从 AI 检测到的产出中推断 AI 采纳日期的研究里,包括你自己所在的领域即将发表的那些。
本周更多动态
平台 AI 政策改变创作者行为,即使没人被强制使用 AI
利用中国两大领先视觉艺术平台的天然实验(Lofter 推出 AI 图像生成器,Graffiti Kingdom 禁止 AI 生成的艺术作品),作者发现创作者活动在支持 AI 的举措之后下降,在反对 AI 的举措之后上升。多项检验指向立场信号,而非工具功能或执行力度:创作者将政策解读为平台对人工劳动的承诺以及对未来竞争环境的表态。效应在人气更高、多平台发布以及厌恶 AI 的创作者群体中最为明显,而替代风险、感知质量低下与版权侵权是他们提到的主要担忧。
[阅读 Information Systems Research 原文(8月10日)→](https://doi.org/10.1287/isre.2025.2155)
生成式 AI 减少了住房估值中的价格歧视
住房价格歧视,即可比住房在少数族裔占多数的社区被估值更低的现象,长期以来被归因于人类偏见,而早期的研究表明,传统的 AI 模型(即便是以公平为目标的模型)也无法解决它。这项研究对比了 284,749 处美国房产的 AI 生成与人类生成的房价,发现生成式 AI 实际上能够缓解这一差距,并接着探究了这一反直觉结果背后的机制。这是一个生成式模型减少而非掩盖既有偏见的罕见案例,而机制分析正是让它值得被引用的原因。
[阅读 Information Systems Research 原文(7月13日)→](https://doi.org/10.1287/isre.2024.1234)
用合成储户模拟银行挤兑
作者构建了一个具有指定人口统计特征的合成储户智能体代表群体,让他们接触一条病毒式恐慌帖,随机化银行的沟通干预,并在生成系统的消息变体之前用人类基准验证模型反应。估算出的取款倾向随后被输入一个传染模型,该模型在邻近网络中传播取款行为。带有强烈安抚和明确存活条款的直接、个性化沟通显著降低了取款意愿,这是一种为危机沟通做预测试的廉价方法,而这样的预测试不可能在真实储户身上进行。
[阅读 Management Science 原文(7月6日)→](https://doi.org/10.1287/mnsc.2024.06807)
当 AI 准确率对等与策略性自我披露相遇
这篇分析性论文考察了在准确率对等政策下,消费者披露身份的决策如何与企业的 AI 推荐和 AI 学习投资选择相互作用。该设定之所以重要,是因为对等要求通常被分析为对算法的纯粹约束,却忽略了消费者会通过改变自己所披露的信息来回应它们,而这又反过来改变了算法学习所依据的数据。这对任何构建公平监管、个性化或消费者隐私模型的人都有参考价值。
[阅读 Marketing Science 原文(8月14日)→](https://doi.org/10.1287/mksc.2024.0900)
别再把 p > 0.05 读作"没有效应"
Tomek、Caldwell 和 Eisner 处理了文献中最顽固的误读之一:把统计上不显著的结果当作没有差异的证据。不显著的 p 值与两种截然不同的情形都一致,即没有实质差异,或者存在真实差异但样本过小或噪声过大而无法检测。文章阐述了原因以及如何转而检验实际等价性。这对任何报告零结果的人(包括日益常见的"AI 没有带来差异"的发现)都直接有用。
[阅读 PNAS 原文(8月14日)→](https://doi.org/10.1073/pnas.2611548123)
按画像而非规则来治理 AI 智能体
Atoosa Kasirzadeh 与 Iason Gabriel 在 Nature 中主张,应通过智能体画像来治理 AI 系统,即刻画一个 AI 智能体能做什么、代表谁行动以及拥有多少自主性,而不是针对模型制定一刀切的规则。对于在数据收集、编码或分析中部署智能体的研究者来说,这一框架是有用的语言,可以用来准确描述一个系统被赋予了多大程度的独立行动。
[阅读 Nature 原文(8月12日)→](https://doi.org/10.1038/s41586-026-10805-z)
本周内容到此为止。欢迎把本文转发给那位正准备引用某个 AI 生产力数字的同事,也欢迎访问 gaiforresearch.com,探索可用于你自身研究的 AI 工具。
AI 科研动态速览





留言