科研中的人工智能:当论文变成智能体

Image via Wikimedia Commons (public domain).
欢迎阅读本周的人工智能重塑科研动态速览,内容精选自 Nature、Science 以及商学领域的顶级期刊。
从静态论文到可运行的智能体
任何尝试复用已发表方法的人都深知其中的艰辛:寻找代码、修复运行环境、解读补充材料。在 Nature 上,Jiacheng Miao、Joe R. Davis、Jonathan K. Pritchard 及其合作者提出了 Paper2Agent,这是一个自动化框架,能够将一篇研究论文转化为充当“虚拟通讯作者”("virtual corresponding author")的人工智能智能体。
多个智能体分析论文及其代码库,构建模型上下文协议(MCP)服务器,随后生成并运行测试以提升其稳健性。在与 Claude Code 等对话智能体连接后,所生成的“论文智能体”能够以自然语言回答科学问题,同时调用论文自身的工具与工作流程。在基于 AlphaGenome、Scanpy 和 TISSUE 的案例研究中,作者报告这些智能体复现了原始论文的结果,并能处理全新的用户查询;多个论文智能体还协同工作,为银屑病确定了一个优先考虑的因果基因(参见 Nature 新闻报道)。
同一周,Science 发表了 Virtual Biotech(虚拟生物技术公司):这是一个以药物研发公司为原型组织起来的人工智能智能体体系,下设靶点发现、安全性评估、药物形式选择和临床开发等部门。在一项演示中,超过 37,000 个智能体对 55,984 项临床试验的结果进行了标注,发现靶向细胞类型特异性基因的药物进入市场的可能性高出 48%,不良事件则减少 32%。该系统还提出了一种肺癌治疗策略,并推断了一项已终止的溃疡性结肠炎试验可能的失败机制。作者明确将其定位为一个*由人类引导的*多智能体系统。
为何重要: 这两篇论文共同指向研究成果形态的转变:从供人阅读的文档转向可供查询的系统,从单一分析者转向大规模编码证据的智能体组织。对社会科学和商学研究者而言,Paper2Agent 的思路可以直接迁移:一个能够自我解释并重新运行的复现材料包,将降低复用门槛,并使可复现性检验的成本大幅下降。Virtual Biotech 的试验标注工作,实质上是由智能体完成的大规模内容分析,可作为系统综述与档案编码的范本。悬而未决的仍是那些熟悉的问题:谁来验证智能体的编码?期刊又该如何认定和评审一篇会“回话”的论文?
本周更多动态
面向腹部 CT 的通用人工智能助力放射科医生
RADAR 是一个视觉语言模型,基于超过 400,000 例增强腹部 CT 检查和 1,500 万个按解剖部位划分的图像文本对训练而成,直接从临床报告中学习,无需人工标注。在内部及外部多中心评估中,它在 18 个解剖结构和 146 种影像学表现上均表现出色。在一项阅片研究中,RADAR 的辅助使 26 名放射科医生的诊断敏感度提升了约 10%,这为研究专家工作中人机协作的学者提供了有价值的数据点。
深度学习与结构计量经济学的结合
Yicheng Song 和 Tianshu Sun 提出了序贯搜索 Transformer(Sequential Search Transformer,SST),这是一种深度结构计量模型,将序贯搜索理论嵌入可端到端训练的深度学习架构,并提供了形式化的识别分析。在应用于一家美国电子商务网站的点击流数据时,SST 在预测搜索与购买行为方面优于最先进的深度学习模型和结构模型;政策实验显示,其在产品推荐和新产品推广方面均带来收益。对于希望兼顾预测能力与可解释性的营销学者而言,这是一个清晰的范例。
生成式人工智能企业为何可能放弃免费版本
Information Systems Research 上的一个分析模型考察了“人工智能自适应学习”(即用户交互在微调过程中不断改进模型)如何改变免费增值策略。作者发现,高度有效的自适应学习反而可能损害盈利能力,因为它使免费版本过于有吸引力;即使服务成本极低,企业的最优选择也可能是不提供免费版本;此外,免费版本并不必然提高消费者剩余,因为更好的人工智能可能使企业得以提高付费版价格。
人脸识别减少了机场航班起飞延误
本研究利用美国一座机场首次在整个航站楼范围内部署人脸识别技术的契机,发现起飞延误减少约 16%,到达延误减少约 6%,且提前起飞或提前到达的情况并未增加。飞往亚洲和非洲(非白人旅客比例较高的目的地)的航班收益较小,而大型飞机的收益较大。这提醒我们,人工智能带来的运营收益可能分布不均。
让人们真正愿意采纳的算法建议
Chan、Delage 和 Lin 探讨了一个经典的算法厌恶问题:当“最优”建议与人们对情境的判断相冲突时,往往会被忽视。他们的方法从既往选择中学习决策者的评价,在推断出的参数周围构建不确定性集合,并采用稳健优化,同时提供统计保证与性能保证。在一项模拟多伦多外卖配送的研究中,该方法显著提高了估计的骑手遵从率,同时保持了相当的配送时间。
本周内容到此结束。欢迎转发给那位复现材料包仍然躺在压缩文件里的同事,也欢迎访问 gaiforresearch.com,探索适用于您自身研究的人工智能工具。





留言