使用大语言模型进行短文本主题建模:模型选择与样本量
2024年11月3日
设想你正在尝试将数千条关于某款产品的评论归纳为若干主要主题。传统上,研究者要么必须人工通读全部内容(耗时且昂贵),要么使用常常忽略重要语境的老式计算机程序。OSF 上的一篇新预印本表明,GPT-4、Claude 和 Gemini 等现代人工智能系统能够有效完成这项工作,尤其是在处理短文本时。
研究者开展了两项有趣的实验:
研究一:聊天机器人感知研究
收集了 199 人关于"是什么让聊天机器人显得像人"的回答
比较了三种不同的回答分析方式:人工分析(由一名研究助理通读全部内容);传统计算机分析(使用一种名为 LDA 的方法);现代人工智能分析(使用 GPT-4 和 Claude)
结果:人工智能系统与人工分析的一致率达到 90%,而传统计算机方法的准确率仅为 60%。
研究二:疫苗犹豫研究
分析了 10,000 条关于新冠疫苗顾虑的推文
检验了人工智能能否在不同样本量下识别主要主题
比较了三种不同的人工智能系统
结果:人工智能仅使用 5% 的数据时的表现与使用 100% 数据时一样好,准确率达到 90%。
在主题分析中使用人工智能的实践指南
如果你有兴趣使用人工智能分析文本数据,以下是分步指南:
准备数据
以整洁的格式收集文本数据
删除任何敏感信息或可识别身份的信息
选择人工智能工具
中小型项目:GPT-4o 或 Claude 3.5 Sonnet
大型项目(超过 100,000 词):Gemini Pro 1.5
考虑使用多个人工智能工具进行交叉验证
样本量策略
从小样本开始(约占数据的 5-10%)
如果数据集非常大,你可能无需分析全部数据
使用随机抽样以确保代表性
编写有效的提示词
指令要具体
示例提示词:"You are a qualitative researcher. Read this text and identify 10 main topics. Each topic should contain a name and definition. Only return the topic."
温度参数保持默认值(通常为 0.25-0.5)
验证流程
比较不同人工智能工具的结果
请人类专家审阅人工智能识别出的主题
检查所识别主题的一致性
质量控制
复核不寻常或出乎意料的主题
确认人工智能没有遗漏任何明显的主题
记录人工智能持续遗漏的任何模式
重要注意事项
人工监督
不要完全依赖人工智能,而应将其作为得力助手
请领域专家审阅结果
准备好根据人类的洞见调整主题
局限性
人工智能可能忽略文化上的细微差别
某些主题可能被合并或过度简化
人工智能无法取代人类对语境的理解
成本效益
使用人工智能可能比雇用多名人工编码员更具成本效益
小样本即可给出可靠结果,从而节省处理时间和成本
权衡不同人工智能服务在成本与能力之间的取舍
文本分析的未来
这项研究表明,人工智能可以变革我们分析文本数据的方式,使其更快速、更易获得,同时保持较高的准确率。然而,最佳结果来自人工智能的效率与人类专业知识和监督的结合。
对于处理大量文本数据的研究者、企业和组织而言,这一方法提供了一种切实可行的途径,使他们能够理解数据中的主题和模式,而不会被庞大的信息量所淹没。





留言