2026 年研究者如何选择大语言模型:实用指南

Image: "A view of the server room at The National Archives" by The National Archives (UK) (CC BY 3.0) via Wikimedia Commons, recoloured.
模型格局又变了。GPT-5、Claude 5 系列、Gemini 3,以及一批强大的开放权重模型(Llama 4、DeepSeek-V3、Qwen3、Kimi K2)在大约一年内相继问世。对大多数研究任务而言,坦率的答案是:好几个模型都已经足够好。因此,选择应当由四个实际问题驱动,而不是由排行榜驱动。
1. 你的数据去了哪里?
这是第一个问题,而不是最后一个。如果你把访谈记录、未发表的手稿或被试数据粘贴进聊天窗口,你就是在把这些数据转交给第三方。在用任何工具处理研究数据之前,请核对三件事。
是否用于训练。 ChatGPT 和 Gemini 的消费者版本可能会用你的对话来改进模型,除非你主动选择退出。主要供应商的付费团队版、企业版和 API 版默认不会用你的数据训练。
数据保留。 大多数供应商会将 API 输入保留最多 30 天用于滥用监测。部分供应商可应要求提供零保留协议。
司法管辖。 对于受 GDPR 约束的数据,优先选择在欧盟有数据驻留的供应商(法国的 Mistral,或美国大型供应商的欧盟区域),或者在自己的机器上运行开放权重模型。
如果你的伦理审批规定数据不得离开机构,那么通过 Ollama 或 LM Studio 在本地运行开放权重模型是唯一站得住脚的选择。Llama 4、Qwen3 和 DeepSeek-V3 的蒸馏版本在 32 GB 内存的现代笔记本电脑上运行良好。
2. 你需要一次处理多少文本?
上下文窗口目前从约 128,000 个 token(约 9 万个英文单词)到 100 万个 token 以上不等。一份 60 分钟的访谈记录通常为 8,000 到 12,000 个 token,因此 128k 的窗口可容纳约十份访谈,100 万的窗口可容纳整个研究。但这并不意味着你应该把整个研究塞进一个提示:在非常长的上下文中,模型对中间部分的回忆能力会下降,而且它无法告诉你它跳过了什么。对于访谈编码,用固定编码手册逐份发送文档的循环,比一个巨大的提示更可靠,也更容易审计。
3. 推理还是速度?
现在每个主要供应商都提供两类模型:快速、便宜的主力模型(GPT-5 mini、Claude Haiku 4.5、Gemini Flash)和较慢的推理模型(GPT-5、Claude Opus 5、Gemini Pro、DeepSeek-R1)。凡是需要在整份文档上做判断的任务,例如主题综合、论证重构或检查统计写作,请使用推理模型。大规模分类、翻译和重排格式请使用快速模型,并在信任它之前用人工编码的样本加以验证。
4. 你能复现结果吗?
聊天界面会在不通知你的情况下更换底层模型。凡是要写进论文的内容,请使用 API 或允许你固定模型版本、将温度设为 0、记录每一条提示和回复并可重新运行整个流程的工具。在方法部分报告模型名称、版本日期、温度和提示。大多数期刊现在都要求这样的披露;请参阅我们的期刊政策页面了解最新规则。
一张简短的决策表
涉及敏感的人类被试数据,不允许使用云端: 在本地运行 Llama 4 或 Qwen3。
敏感数据,但在有合同的前提下可以使用云端: 通过机构协议或 API 协议使用 Claude、GPT-5 或 Gemini,并关闭训练。
对公开文本进行大规模标注: 使用快速模型(Gemini Flash、GPT-5 mini、Claude Haiku 4.5),并与人工进行编码者间信度检验。
冗长、杂乱的文档,如档案材料或法律文本: 利用 Gemini Pro 或 Claude 的长上下文,逐份文档发送。
中文语料: DeepSeek、Qwen3 或 Kimi K2,它们的中文训练数据远多于西方模型。
免费、无需注册的探索: Google AI Studio、Mistral Le Chat 或 DeepSeek。
我们的工具库页面列出了当前模型的上下文窗口、价格和链接,并随市场变化持续更新。





留言