top of page

AI 正在成为研究仪器:它既预测实验,也执行实验

9月3日
讀畢需時 4 分鐘

已更新:12小时前

7月11日

欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及各领域顶级期刊。

AI 正在成为研究仪器:它既预测实验,也执行实验

对社会科学家而言,本周最引人注目的结果以最令人不安的方式带来启发。Ashwini Ashokkumar、Luke Hewitt、Isaias Ghezae 和 Robb Willer 在 Nature 上汇集了 70 项预注册的、全国代表性的调查实验,覆盖 105,165 名美国被试中的 476 个处理效应,并让 GPT-4 模拟具有代表性的美国样本对每一项刺激的反应。模型预测的处理效应与真实处理效应的相关系数达到 r = 0.85,追平乃至超过了人类专家预测小组。关键在于,对那些不可能泄漏进训练数据的未发表研究,模型准确度依然保持(r = 0.90),尽管其倾向于高估效应量。Nature 的一篇配套评论主张审慎地使用大语言模型,在正式施测之前对研究设计进行筛选与预检验。

如果第一篇论文展示的是 AI 预测实验,第二篇论文展示的则是 AI 亲自运行实验。在 Science 上,Kexin Huang 及其同事介绍了 Biomni,一个通用的生物医学智能体:其行动发现组件从 25 个领域的数千篇出版物中挖掘工具、数据库与实验方案,构建出一个统一环境,使智能体能够在其中自主执行多种研究任务。两篇论文放在一起,勾勒出一条连续谱:一个能够低成本预测哪些假设值得检验的模型,衔接一个能够承担部分检验工作的智能体,从而压缩从想法到证据之间的循环。

**为何重要:** 一种能在你收集数据之前预测结果的研究工具,对研究优先级排序、分析推进和设计压力测试确实有用;但它同样构成一种诱惑,让人跳过那些棘手而意外的、足以推翻既有预期的实证工作。r = 0.85 这一标题数字是对成熟调查范式的平均;而你的领域最需要回答的问题,往往正是大语言模型最无话可说的那类问题。用这些工具决定该做什么,而将它们当作跳过实验的替代品;同时,任何“模拟被试”都只能视为假设生成器,绝不能当作数据。

本周更多动态

“人味化”工具能抹去 AI 文本的痕迹

Nature 报道了一类“人味化”(humanizer)工具:它们对 AI 生成的文本进行改写与风格重塑,专门用于击败期刊和高校所依赖的检测器。对研究者和编辑而言,这场军备竞赛关系重大:它侵蚀基于检测的学术诚信检查,把负担推回披露规范、来源追溯与信任。对任何指望用自动化 AI 文本检测来把守投稿的人而言,这篇文章是一次必要的现实提醒。

[阅读 Nature 原文(7月7日)→](https://doi.org/10.1038/d41586-026-02105-3)

我们正在变成“反向半人马”吗?

在 Science 对 Cory Doctorow《The Reverse Centaur's Guide to Life After AI》的书评中,Tim Wu 阐发了全书的核心忧虑:所谓“反向半人马”,是指被降格为给自动化系统喂料并收拾残局的工作者,而非被技术增强的人。对于正在权衡如何把 AI 纳入研究与教学流程的学者而言,这是一个尖锐的提醒:真正决定谁掌握主导权的,是人机分工的设计,而非模型本身的原始能力。

[阅读 Science 原文(7月9日)→](https://doi.org/10.1126/science.aei9754)

细胞的基础模型

研究者提出了通用细胞嵌入(Universal Cell Embedding, UCE),一个通过自监督学习在大型单细胞数据语料上训练的基础模型,能将多种类型与物种的细胞置于同一表征空间。与语言模型嵌入类似,它致力于成为其他分析可以据以构建的通用底座,为社会与行为科学家提供了一个具体范例:文本之外的“基础模型”可以是什么样子。

[阅读 Nature 原文(7月8日)→](https://doi.org/10.1038/s41586-026-10689-z)

建在存储芯片里的神经网络

Science 报道了一个直接在计算机存储芯片内实现的人工神经网络,即“以物理方式在存储中计算”,能够实时高精度重建人类皮层活动模式。通过在数据所在之处完成计算,这类神经形态硬件有望大幅提升 AI 的能效;随着大模型的算力与电力成本不断攀升,这一问题日益受到关注。

[阅读 Science 原文(7月2日)→](https://doi.org/10.1126/science.aei8090)

人形机器人向手术迈出第一步

一项 Nature 可行性研究报告了人形机器人执行外科手术任务的早期体内试验。这是一次渐进但具体的探索,检验通用机器人平台(而非定制的手术设备)能否在活体中完成操作。它提醒我们:推动仓储与实验室自动化的同一场具身智能浪潮,正在进入可靠性门槛高得多的临床场景。

[阅读 Nature 原文(7月8日)→](https://doi.org/10.1038/s41586-026-10796-x)

本周内容到此为止。欢迎将本文转发给还在往 ChatGPT 里粘贴数据的同行,也欢迎访问 gaiforresearch.com,探索适用于您自身研究的 AI 工具。

AI 科研动态速览

留言


这项倡议得到了以下组织的支持:

  • Twitter
  • LinkedIn
  • YouTube
logo_edited.png
bottom of page