大语言模型的道德盲区:我们能信任人工智能的伦理判断吗?基于四项实验的认知偏差系统分析
2025年7月6日
随着大语言模型(LLMs)被广泛嵌入各类决策场景,人们越来越依赖它们提供道德建议,甚至让其直接参与道德决策。但有一个关键问题必须回答:这些人工智能系统真的能够做出符合人类价值观的道德判断吗?
Cheung 等人(2025)通过四项实验系统研究了大语言模型在面对现实道德困境时的反应,并将其与具有代表性的美国人样本进行比较。他们发现,大语言模型不仅在某些情况下倾向于做出比人类更利他的选择,还表现出比人类更强的"不作为偏差"(omission bias)和"是否偏差"(yes–no bias),这可能对社会决策产生深远影响。
大语言模型在决策情境中的广泛应用
为什么要研究人工智能的道德判断?
与人类日常交流密切相关的应用场景,例如朋友之间善意的谎言或自动驾驶汽车做出的生死抉择,本身就涉及道德考量。尽管开发者通常会在训练过程中嵌入伦理准则,例如鼓励"公平与善意,抵制仇恨"(OpenAI, 2024),大语言模型仍可能产生幻觉输出或表现出偏差。因此,本研究的核心目标是评估大语言模型在现实困境中道德判断的质量,尤其是它们在特定条件下是否会系统性地偏向某类决策。
关于人工智能做出道德决策的四项实验
探索人工智能道德决策的四项实验
研究一:面对相同的道德困境,大语言模型和人类谁更可能采取行动?
研究者让 GPT-4、Claude 3.5 和 Llama 3.1 等主流模型回答13个道德困境和9个集体行动问题,并将其回答与285名美国参与者的回答进行比较。这些困境涵盖两种类型:
"成本收益推理(CBR)与道德规则(Rule)":当违反规则能带来更大收益时,模型和人类是否愿意"牺牲少数以拯救多数"。
"作为与不作为":在许多情况下,选择不作为可能反映的是逃避责任的企图,而非对道德规则的坚守。
结果显示,大语言模型在这些困境中更倾向于不作为,尤其是在采取行动可能引发道德冲突的情况下。
研究二:"是"或"否"的回答如何影响人工智能的判断?
研究者发现,大语言模型对问题的措辞高度敏感。例如,在"你是否应该修改法律以使协助自杀合法化?"与"你是否应该保留现行禁止协助自杀的法律?"这两个问题中,尽管情境在逻辑上等价,模型却给出了相互矛盾的回答(是否偏差)。这一倾向在 GPT-4-turbo 和 Claude 3.5 等模型中尤为明显,无论"否"实际上支持何种道德立场,它们都更倾向于回答"否"。
研究三:进一步验证
为检验前两项实验的发现是否适用于更日常、更自然的道德情境,研究者开展了第三项实验。这一次,他们从 Reddit 的"AITA(Am I The Asshole)"论坛中选取了用户真实提交的困境。与电车难题等抽象困境相比,这些情境更加真实,也更容易引起共鸣。结果再次表明,尽管人类参与者也表现出轻微的不作为偏差,人工智能模型却呈现出更极端的倾向,尤其是在涉及自身利益与他人福祉权衡的困境中。
研究四:偏差的来源是微调,还是人性的反映?
第四项实验深入探究了大语言模型这些偏差的来源。研究团队比较了三个模型:
Llama 3.1(预训练版本)
Llama 3.1-Instruct(Meta 官方微调版本)
Centaur(由认知科学家利用16万项人类实验中的行为数据微调)
结果表明,是否偏差和不作为偏差主要源于微调阶段,而非模型架构或大规模训练语料。这一发现也凸显了 RLHF(基于人类反馈的强化学习)在塑造模型行为中的决定性作用。在微调过程中,模型学到的是"用户喜欢什么",而非"什么在伦理上正确",这有助于解释为何某些偏差在人工智能中被放大。
我们应该信任人工智能做出道德决策吗?
我们应该信任人工智能做出的道德决策吗?
这项研究最终回到一个根本问题:我们是否应该信任人工智能做出道德决策或提供伦理建议?尽管有研究表明,公众认为 ChatGPT 的道德建议比人类或伦理学家的建议更值得信赖(Madaio et al., 2024),Cheung 等人提醒,这种"受欢迎程度"并不等同于伦理上的合理性。在本研究中,他们采用"逻辑一致性检验"作为更客观的评估方式,即模型对以不同措辞提出的逻辑等价问题是否给出一致的回答。结果清楚地显示,主流大语言模型未能通过这一检验。它们的判断容易受到无关变量的影响,例如"是/否"或"作为/不作为"的措辞,这违背了理性选择理论中的"不变性原则"。
此外,模型的偏差并不总是中性的。在某些情境中,选择不作为实际上可能导致更大的伤害,例如未能揭露企业不当行为、拒绝帮助他人或不改革不公正的制度。在功利主义框架下,此类决策可能被视为不道德的。
从伦理偏差到制度偏差:人工智能行为背后的结构性激励
值得注意的是,这些偏差可能不仅源于技术选择,也可能反映了人工智能公司自身规避风险的激励。与作为造成的伤害相比,不作为在法律上往往更容易辩护。因此,一些公司可能会有意训练模型"什么都不说",以规避潜在责任。这种制度动机与个人在道德困境中为避免道德谴责而选择不作为的方式如出一辙。从这个意义上说,大语言模型可能正在放大一种早已存在的规避风险、逃避问责的文化模式。
人工智能偏差的制度驱动因素可能是什么?
结论:我们应如何理解人工智能的"善意"?
这项研究不仅揭示了大语言模型中的偏差问题,还提供了改进方向,包括引入逻辑一致性评估、推动跨学科合作以制定伦理训练标准,以及拓展偏差检测的维度。研究的结论是,尽管微调旨在"确保人工智能有益且无害",它实际上可能放大道德偏差和判断的不一致。"看起来有道德"的人工智能与"真正有道德"的人工智能之间可能仍存在显著差距。因此,我们应以审慎和批判性思维看待大语言模型在道德情境中的应用,并持续投入跨学科研究,以确保人工智能更好地符合人类的道德原则。
参考文献:
Cheung, V., Maier, M., & Lieder, F. (2025). Large language models show amplified cognitive biases in moral decision-making. Proceedings of the National Academy of Sciences of the United States of America, 122(25), e2412015122.
https://doi.org/10.1073/pnas.2412015122
Dillon, D., Mondal, D., Tandon, N., & Gray, K. (2025). AI language model rivals expert ethicist in perceived moral expertise. Scientific Reports, 15, Article 4084.
https://doi.org/10.1038/s41598-025-86510-0
OpenAI. (n.d.). Introducing the model spec: Transparency in OpenAI’s models. OpenAI. Retrieved May 10, 2024, from
https://openai.com/index/introducing-the-model-spec/





留言