科研中的人工智能:智能体集群走上实验台

Image: "Andrew+ robot" by Pocar19 (CC BY-SA 4.0) via Wikimedia Commons, recoloured.
欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science、PNAS 及其他顶级期刊。
从聊天机器人到实验团队:人工智能智能体开始运行实验
两年来,“人工智能科学家”大多只存在于屏幕之上。本周,它向实验台迈进了一步。据 Nature 报道,Anthropic 建立了一个生物湿实验室,人类科学家与人工智能智能体在其中共同设计并开展实验。该实验室公布的首项发现来自约 950 个人工智能智能体,它们以自主方式探索了包含数十亿种蛋白质的数据库,历时超过 21 小时,并在彼此之间讨论阶段性结果、决定下一步行动。在受命寻找可能与逆转录酶协同作用的蛋白质时,这些智能体注意到一种巨型病毒中此类基因附近有一段反复出现的短 DNA 序列,随后又在其他病毒基因组中发现了类似的重复阵列,这些模式令人联想到细菌的 CRISPR 系统。需要注意的局限同样真实存在:该预印本尚未经过同行评审,这些序列的功能尚不清楚,也尚未发现与之配对的 DNA 切割酶。该公司生命科学负责人本人也称之为“一条有前景的线索”("a promising lead")。真正困难的部分,即功能表征,仍然依赖人类的实体实验工作。
支撑这类实体工作的基础设施也在发生变化。Nature 的另一篇报道介绍了模型硬件标准(Model Hardware Standard,MHS),这是 Anthropic 与霍华德·休斯医学研究所(HHMI)Janelia 研究园区合作开发的软件框架,能够让不同厂商的仪器相互“对话”,并允许人工智能智能体对其进行统一调度。一支测试该框架的卡内基梅隆大学团队报告称,他们在数小时内便完成了实验搭建,而这一过程通常“很容易耗时数月”("easily take months")。与此同时,Science 指出了让智能体大规模协作带来的一个更为奇特的副作用:相互交流的智能体集群往往会创造出自己的“怪异术语”。文章认为,这是一种自然产生、却令人不安的副产品。
为何重要: 人工智能辅助研究的基本单位正在发生转变,从一个人向一个模型发出提示,转向由众多智能体在有限的人类检查节点下进行检索、决策,乃至操作设备。这提高了研究产出效率,但也使研究者的工作重心转向审核:阅读可能逐渐演变为私有术语的智能体日志,并判断在机器标记出的数百个“怪异现象”中,哪些值得投入稀缺的实验室时间。对社会科学研究者而言,同样的模式也将进入数据收集与分析流程。因此,数据溯源、透明度与人工核验正是当下值得投入培养的能力。
本周更多动态
人机团队表现欠佳,原因在于实验很少让人类有机会学习
近期一项元分析得出结论:平均而言,人机组合的表现并不优于二者中较强一方单独行动的表现。Julian Berger、Ralph Hertwig、Ralf Kurvers 及其合作者重新分析了该元分析纳入的全部 74 项研究,发现大多数研究设计缺少支持人类学习的要素,例如结果反馈。提供反馈的研究初步显示出更高的协同效应;人工智能解释与反馈相结合时与正向协同效应相关,而缺少反馈的解释则与负向协同效应相关。作者指出,仍需开展因果检验。对于任何开展人机实验的研究者而言,这都是一条清晰的设计经验。
PNAS 作者认为:人工智能无法取代人类被试
在 PNAS 的一篇新文章中,Jim Hoover、Alan D. J. Cooke、Geoff Tomaino 和 Su Hyun Lee 认为,正如其标题所明确表述的那样,人工智能无法取代行为研究中的人类被试。这为我们在八月报道过的合成受访者之争增添了一个重要的声音。在消费者研究或问卷调查研究中试用“硅基样本”之前,这篇文章值得一读。
机器学习特征的 p 值
Kay Giesecke、Enguerrand Horel 和 Chartsiri Jirachotkulthorn 提出了 AICO(Add-In COvariates,加入协变量)方法,通过屏蔽每个特征所含的信息并测量由此产生的变化,检验该特征是否对模型的预测性能有所贡献。该方法无需重新训练、无需代理模型,也无需分布假设,即可得到精确的有限样本特征 p 值和置信区间,并在信用评分和抵押贷款行为预测中得到了演示。对于使用机器学习的商学与金融学研究者而言,它为“哪些变量重要?”这一问题提供了具有统计学依据的回答。
OpenAI 宣称解决了一道千禧年大奖难题,物理学家发表看法
OpenAI 宣称,其最先进的模型解决了一道千禧年大奖难题,证明描述流体运动的纳维-斯托克斯方程可能产生奇点。Nature 的这篇特稿探讨了这一结论对物理学意味着什么(专家指出,这些方程在某些条件下本就已知会失效,例如稀薄气体),以及它引发的更广泛讨论:人工智能的数学能力究竟如何,模型是否吸收了他人尚未发表的成果,以及功劳应当归属于谁。
制药企业的私有数据大幅提升人工智能蛋白质模型的能力
公共数据库中关于蛋白质与药物相互作用的样本不足。Nature 报道了一个基于制药企业提供的 20,000 多个蛋白质结构训练的人工智能系统,其表现优于仅使用公共数据训练的类 AlphaFold 模型。这对任何领域都是一个发人深省的案例:当决定性的训练数据为私有时,谁能构建最好的模型,又由谁来审视这些模型?
本周内容到此结束。欢迎转发给那位仍在向 ChatGPT 复制粘贴的同事,也欢迎访问 gaiforresearch.com,探索适用于您自身研究的人工智能工具。





留言