top of page

Vibe Research:AI 协作研究工作流教程

2天前
讀畢需時 7 分鐘
AI research assistant helping with coding and data analysis
AI research assistant helping with coding and data analysis

Yuan Ren

2026年4月18日

近年来,大语言模型、编程智能体与自动化工具逐渐进入科研实践。它们可以协助研究者整理文献、实现代码、编排实验、汇总结果,甚至起草文稿。但这并不意味着研究过程会自然而然地变得更加严谨。恰恰相反,如果缺乏清晰的边界、评估与流程控制,AI 往往会放大原有的混乱:代码结构迅速膨胀,实验结果难以追溯,输出文件不断堆积,而研究者对项目整体状态的把握却持续下降。相关综述已经指出,大语言模型若要有效服务于科研,其前提并非“自主完成研究”,而是被置于一个与人类研究目标对齐、并配备清晰评估机制的流程之中(Zhang et al., 2025)。

本文所说的 Vibe Research 并非一个严格形式化的学术术语,而是一种实践性的工作框架。其基本原则是:研究者负责问题定义、方向判断、评估设计与结论审查,AI 则负责高频迭代、样板代码实现、局部探索与重复性劳动。本文尝试将这一框架整理为一份简洁、可执行的教程。

一、项目启动:先建立运行环境与协作边界

在项目冷启动阶段,首要任务并非立即生成代码,而是先建立最基本的运行环境与协作约束。根据实践经验,这一步通常包括:在项目目录中预先配置 agents.md、相关 skills 与插件;如果采用命令行工作流,则进一步准备 tmux 或 screen 等后台会话工具,以保证长周期任务能够持续运行。

这一阶段的重要性主要不在于工具本身,而在于它为后续研究建立了稳定的外部框架。在 AI 协作研究中,环境稳定、任务可恢复、职责可区分,往往比一开始就追求“优雅的代码结构”更为重要。从研究规范的角度看,这也与近年来机器学习领域对可复现性与透明度的强调相一致:研究过程需要满足可重复执行、可追溯与可验证的基本条件(NeurIPS, 2026)。

二、构想阶段:研究方向应由人主导,AI 辅助理解

在构想形成阶段,AI 的角色应限于辅助而非替代。一种相对可靠的做法是:研究者先自行阅读核心论文,筛选出真正相关的文献与技术线索,再将这些材料提供给智能体,由其生成更完整的领域理解;与此同时,研究者自己保留一份初步路线图,以明确项目应如何推进。

这种分工与现有综述的判断大体一致。相关研究指出,LLM 可以参与研究工作流的多个阶段,但其作用建立在与人类研究目标对齐的基础上,而非在问题定义上取代研究者(Zhang et al., 2025)。因此,在这一阶段,AI 更适合充当“理解加速器”,而非“方向制定者”。

三、代码库阶段:代码框架是研究工作的基础

当 AI 参与代码生成时,代码库的结构并非次要问题,而是研究工作的基础设施。在实践中,一个常见问题是智能体倾向于在项目早期过度抽象,例如把原本简单的数据加载流程拆分为多层 dataclass、配置对象与中间封装结构,导致系统复杂度在真正的实验开始之前就已显著上升。

因此,在代码库设计阶段,研究者应尽可能通过 plan mode 或其他方式,主动约束第一版框架的抽象层级。这一阶段最重要的,并非构建一个面向未来所有场景的通用系统,而是建立最短、最清晰、最易验证的研究主路径。哪些结构必须抽象,哪些部分暂时保持直接,哪些配置需要暴露,哪些逻辑应集中管理,这些问题都应从一开始就由人来决定。如果第一层框架设计不佳,此后每一次功能迭代都会累积额外的复杂度;反之,如果主路径足够清晰,之后的修改、对比与调试都会更加可控。

四、评估阶段:评估应先于实验执行

在这一工作流中,评估不应被理解为实验结束后的“结果统计”,而应被理解为实验开始前的“问题定义”。更准确地说,评估是假设的可执行表达。如果在实验开始前没有清晰设计评估逻辑,那么此后投入的大量计算资源很可能只是无方向的消耗。

因此,更可靠的顺序应当是:先设计评估,再进入实验。评估逻辑不应临时附加在实验末端,而应在最早阶段就作为代码库的一部分预留出来。至于其具体形式,可以视项目复杂度而定:它可以是相对简单的过程式脚本,也可以是分离良好的模块化系统。但有一条原则不应忽视:具有不同依赖关系的功能应尽量分开管理,而不是把结果保存、指标计算与可视化全部塞进一个过长的函数。

五、功能阶段:用 Red–Green–Refactor 建立开发闭环

当项目进入功能迭代阶段,一种相对可靠的实践是采用 Red–Green–Refactor。根据 Martin Fowler 对 TDD 的经典概括,这一循环包括三个步骤:先写一个会失败的测试(Red),再完成实现使其通过(Green),最后重组结构、消除重复、压缩技术债(Refactor)(Fowler, 2023)。

这一方法在编程智能体场景中尤为有效。Simon Willison(2026)明确建议在与编程智能体协作时使用 red/green TDD:先让测试失败,再根据失败反馈驱动实现,从而减少歧义、提升迭代质量。

之所以要特别强调 Refactor,是因为智能体往往擅长快速完成功能,却并不天然擅长在功能通过后主动重组系统结构。如果只有 Red 和 Green 而没有 Refactor,项目复杂度仍会在多轮迭代中持续累积。因此,在功能阶段,重点不应仅仅是“让 AI 写出功能”,还应借助测试建立一个可验证、可纠正、可持续维护的开发闭环。

六、实验阶段:流程管理决定项目能否保持可控

随着实验阶段真正开始推进,项目的核心挑战从“如何写代码”转向“如何维持秩序”。有两项实践措施尤其值得保留。

第一,强制维护 CHANGELOG.md。尤其是在多个智能体同时运行时,只要核心逻辑发生变化,就应在 changelog 中简要记录,至少说明变更内容及其影响范围。第二,通过命名规范区分人类创建与智能体生成的文档,例如人类创建的 markdown 文件统一使用小写,而由智能体创建或大幅重构的文件统一使用大写,从而能够快速识别来源与责任边界。

这些做法未必属于严格的主流规范,但它们服务于同一个目标:让实验过程保持可追溯、可恢复、可解释。这也与当前机器学习共同体对结果可追溯性的要求相一致:研究不仅应报告结果,还应保留足够的过程信息,以供后续检查与复现(NeurIPS, 2026)。

七、自动研究阶段:自动化探索必须建立在清晰边界之上

当功能已推进到相对稳定的阶段,且优化目标足够明确时,可以尝试进入 autoresearch 阶段。这一阶段的核心并非“让 AI 自由优化”,而是先由研究者界定可接受的优化范围,包括可修改的代码区域、参数空间与结构边界,然后才允许 AI 在受控条件下进行探索。

这一判断非常重要,因为自动化本身并不天然保证结果更可靠。相关综述同样指出,LLM 在研究中发挥作用的前提是清晰的评估指标以及与人类目标的对齐。换言之,AI 可以帮助搜索候选方案,但无法代替研究者决定什么才真正构成改进(Zhang et al., 2025)。因此,autoresearch 更适合作为一种受约束的部分委托机制,而非研究判断权的转移。

八、结果收集与写作阶段:研究后期的关键在于收敛而非扩张

一旦实验稳定运行,评估结果的形式也已明确,项目便进入后期阶段。根据实践经验,这一阶段最关键的任务是管理输出文件夹,及时归档失败的实验或无效结果,并同步将核心结果写入 changelog。

这一步的意义在于保持研究链条的清晰。随着实验数量增加,真正威胁项目质量的,往往不再是“是否还有新想法”,而是“是否还能清楚地知道每个结果从何而来、对应哪一次修改、支持哪一个结论”。

进入写作阶段,通常意味着大规模实验(例如消融研究或超参数搜索)已基本完成,项目正接近收尾。此时应回到最初的路线图,检查是否遗漏了关键实验,确认论证链条是否已经闭合,然后再开始写作。

还需指出的是,本教程更直接地适用于计算机科学和计量经济学等领域,这些领域的研究工作流通常更加形式化、数据驱动,也更易于进行可复现的评估。相比之下,它通常不太适用于人文学科以及更广泛的社会科学中的许多领域,因为在这些领域中,诠释与情境分析发挥着更为核心的作用。

结语

总体而言,Vibe Research 并不主张“把研究交给 AI”,而是主张在 AI 显著提升迭代速度之后,重新建立一套更严格的流程约束。这一框架之所以有价值,正是因为它始终坚持三件事:第一,框架必须先行建立;第二,评估必须先想清楚;第三,开发必须建立反馈闭环。因此,Vibe Research 的核心结论可以概括为一句话:AI 可以提升研究的速度,但研究判断、评估与结论的责任仍须由人来承担。

References

Fowler, M. (2023, December 11). *bliki: TestDrivenDevelopment*. Martinfowler.com. https://martinfowler.com/bliki/TestDrivenDevelopment.html

NeurIPS. (2026). *PaperInformation / PaperChecklist*. Neurips.cc. https://neurips.cc/public/guides/PaperChecklist

Willison, S. (2026). *Red/green TDD - Agentic Engineering Patterns*. Simon Willison’s Weblog. https://simonwillison.net/guides/agentic-engineering-patterns/red-green-tdd/

Zhang, Y., Khan, S. A., Mahmud, A., Yang, H., Lavin, A., Levin, M., Frey, J., Dunnmon, J., Evans, J., Bundy, A., Dzeroski, S., Tegner, J., & Zenil, H. (2025). Exploring the role of large language models in the scientific method: from hypothesis to discovery. *NPJ Artificial Intelligence*, *1*(1), 14. https://doi.org/10.1038/s44387-025-00019-5

留言


这项倡议得到了以下组织的支持:

  • Twitter
  • LinkedIn
  • YouTube
logo_edited.png
bottom of page