top of page

GATOS 工作流:开源人工智能能否帮助规模化主题分析?

9月1日
讀畢需時 5 分鐘

作者:Yuan Ren · 5月31日

GATOS 为何重要

当数字不够用时,社会科学家常常转向定性数据。开放式问卷回答、访谈和书面反思能够捕捉那些难以化约为数字的意义。正如 Saldaña(2011)所指出的,定性数据分析从根本上是一个意义建构的过程:研究者构建模式、识别关系,并在归纳与演绎推理之间来回穿梭。

困难在于,这项工作非常耗时。对定性数据进行编码,通常需要研究者手工阅读、解读、比较、修改并组织大量文本。这一过程的价值恰恰在于它的细致,但当研究者面对成千上万条开放式回答时,它很难规模化。Katz、Coloyan Fleming 和 Main 的研究《Thematic analysis with open-source generative AI and machine learning: a new method for inductive qualitative codebook development》正是在这一张力背景下展开的。他们在文中提出了"生成式人工智能赋能的主题组织与结构化"工作流,简称 GATOS。

GATOS 旨在探索:开放权重的生成式文本模型结合机器学习技术,能否支撑大规模的定性编码手册开发。重要的是,这篇论文并未把 AI 呈现为定性解读的替代品。它追问的是:编码手册开发流程中的某些环节,能否变得更可扩展、更可检视、更可复现。作者还特别强调开放权重模型,因为与专有系统相比,这类模型在隐私、本地控制与可复现性方面可能更具优势,尤其是在研究者处理敏感定性数据的情况下。

*图注:像 GATOS 这样的开源人工智能工具,能在保留人的解读的同时,帮助研究者整理大规模定性数据。*

GATOS 工作流内部

GATOS 借鉴了主题分析的若干环节,尤其是与编码的生成、打磨和归类相关的阶段。Braun 和 Clarke(2006)的六阶段主题分析方法是一个重要的参照。工作流的第一步,是围绕研究者的问题对每个原始文本单元做摘要。这些摘要有点像分析备忘录:它们从较长的回答中提炼出与研究相关的要点。随后,系统把这些要点转换为文本嵌入(embeddings),进行降维,并把语义相近的要点聚为一组。例如,关于团队领导沟通的不同评论,即便措辞不同,也可能被归入同一簇。

最有趣的步骤发生在聚类之后。GATOS 并不会为每个簇自动创建一个新编码。它采用检索增强生成(retrieval-augmented generation)的方法:对每个簇,系统先从正在形成的编码手册中检索语义上最相近的既有编码,然后提示模型判断这些既有编码是否已经提供了充分的主题覆盖。如果已充分,就不创建新编码;如果不充分,模型才生成新的编码及其定义。

这是整个工作流中最接近人类编码者实际两难的一步:一个模式究竟是真正的新事物,还是只是已被捕捉之物的某种变体?GATOS 的价值不仅在于生成编码,更在于尽量避免生成不必要的编码。

*图注:使用开源生成式人工智能与机器学习的可扩展主题分析 GATOS 工作流。*

作者如何评估 GATOS

为了评估该工作流,作者使用了三个模拟数据集,分别对应不同的社会科学情境:团队成员反馈、关于伦理行为的组织文化,以及疫情后员工对重返办公室的看法。这种基于模拟的评估方式很重要,因为作者事先知道数据中植入了哪些主题和子主题,因此可以检验 GATOS 能否从模拟回答中找回那些被有意置入的主题。

这一设计给了作者某种定性研究者难得拥有的东西:一个受控的基准。但这个优势也正是其主要局限的来源。模拟回答虽然包含已知主题,却无法完全再现人类产生的定性数据中的模糊、矛盾与情境上的杂乱。因此,这项研究为该工作流提供的是早期验证证据,而非"它在杂乱的真实研究情境中同样有效"的定论。

结果是令人鼓舞的。在三个数据集上,GATOS 找回了大部分原始子主题,有些匹配非常接近。例如,在重返职场数据集中,原始子主题"对传统办公时间的抵制"被一个措辞几乎相同的 GATOS 生成主题紧密匹配。

然而结果并不完美。一些更复杂的概念只被部分捕捉。例如,原始子主题"组织目标压倒伦理考量"最接近的生成短语是"非伦理因素的优先排序"。这捕捉到了部分含义,却丢失了"组织目标压倒伦理关切"这一具体关系。这类案例很重要,因为它们同时展示了方法的前景与限度:模型往往能识别出大致的语义区域,却可能把更具体的概念关系压平或模糊掉。

*图注:AI 辅助的聚类与检索如何支撑大规模的定性编码手册开发。*

前景、模式与悬而未决的问题

结果中有一个值得注意的模式:随着被分析的簇越来越多,新编码的创建速度逐渐放缓。这表明,随着编码手册日趋成熟,模型越来越多地识别出一个簇是否已被既有编码覆盖。在有限的计算意义上,这类似于定性研究者随着分析推进开始复用既有编码的做法。但不应把它与更完整意义上的理论饱和混为一谈:理论饱和取决于人的解读、研究目的与理论判断。

作者还观察到,在三个案例研究中,模拟回答数量与最终生成主题数量之比约为 10:1。这是一个耐人寻味的模式,但论文对它的态度很谨慎:这个比例究竟是研究设计的巧合,还是一个能推广到其他数据集的规律,目前仍不清楚。

该工作流还引出了关于规模的重要问题。GATOS 为大型数据集而设计,但规模本身有计算成本。作者指出,1 万条评论可能产生约 5 万个摘要要点和数以千计的簇,等待模型评估。换言之,AI 或许减少了某些形式的人力劳动,却也带来了新的负担:计算资源、模型选择、提示词设计与工作流验证。

另一个开放问题是编码应当在哪个抽象层级上生成。编码过于具体,编码手册就会冗余且难以使用;过于宽泛,重要的区分就可能消失。这不只是技术问题,更是定性判断。GATOS 可以辅助这一过程,但它无法免除研究者为自己的研究问题选定合适概念颗粒度的责任。

结语

最好把 GATOS 理解为一次严肃的尝试:让定性编码手册开发中的某些环节更可扩展、更透明。它的贡献不在于解决了主题分析,而在于把流程中的一段拆解成结构化的工作流:摘要、嵌入、聚类、检索、编码生成与主题组织。

这一点之所以重要,是因为许多社会科学研究者正面临日益扩大的错位:一边是定性数据的丰富性,另一边是手工编码的实际极限。Salomon(1991)曾主张超越定性与定量方法之间僵化的界线,GATOS 正可以在这一精神下来解读。它并没有把定性分析化约为计算,而是追问:计算工具可以在哪些地方负责任地支持定性工作。

因此,关键问题不是 AI 能否取代定性研究者,而是像 GATOS 这样的工作流能否承担起整理大规模文本数据中部分重复性的工作,同时把解读、反身性与理论判断留在人的手中。对于这个问题,论文给出了一个谨慎而有益的回答:可以,也许,但前提是研究者始终清楚这套工作流能做什么、不能做什么,以及人的判断在哪里仍然最为关键。

References

Braun, V., & Clarke, V. (2006). Using thematic analysis in psychology. *Qualitative Research in Psychology*, 3(2), 77–101. https://doi.org/10.1191/1478088706qp063oa

Katz, A., Fleming, G. C., & Main, J. B. (2026). Thematic analysis with open-source generative AI and machine learning: a new method for inductive qualitative codebook development. *Humanities & Social Sciences Communications*, 13(1), Article 209. https://doi.org/10.1057/s41599-026-06508-5

Saldaña, J. (2011). *Fundamentals of qualitative research*. Oxford University Press.

Salomon, G. (1991). Transcending the Qualitative-Quantitative Debate: The Analytic and Systemic Approaches to Educational Research. *Educational Researcher*, 20(6), 10–18. https://doi.org/10.3102/0013189X020006010

留言


这项倡议得到了以下组织的支持:

  • Twitter
  • LinkedIn
  • YouTube
logo_edited.png
bottom of page