引领科技前沿 · 服务国家战略北京前沿科学技术研究院

ChatGPT作为心理治疗师?新研究揭示严重的伦理风险

2026-08-06 04:07:43 科学与社会 阅读

随着数以百万计的人向 ChatGPT 及其他 AI 聊天机器人寻求治疗式建议,布朗大学的一项新研究敲响了警钟:即使被指示模仿受过专业训练的治疗师,这些系统仍屡屡违反心理健康护理的核心伦理标准。研究人员将 AI 与同伴咨询师及持证心理学家进行了对比评估,发现了 15 种不同的伦理风险——从不当处理危机情况和强化有害观念,到表现出带有偏见的回应,以及提供“欺骗性共情”(即在没有真正理解的情况下模仿关怀)。

布朗大学的研究人员与心理健康专业人员紧密合作,识别出了问题行为的重复模式。在测试中,聊天机器人处理危机情况不当,给出的回复强化了用户对自己或他人的有害观念,并且使用的语言制造了共情的表象,却缺乏真正的理解。

“在这项工作中,我们提出了一个包含15种伦理风险的从业者导向框架,通过将模型行为映射到具体的伦理违规行为,来展示大语言模型(LLM)咨询师如何在心理健康实践中违反伦理标准,”研究人员在他们的研究中写道。“我们呼吁未来的工作为LLM咨询师制定伦理、教育和法律标准——这些标准应反映出人类引导的心理治疗所需的质量和严谨性。”

这些发现已在AAAI/ACM人工智能、伦理与社会会议上发表。该研究团队隶属于布朗大学的技术责任、重构与再设计中心。

提示词如何塑造AI治疗回复

布朗大学计算机科学博士生、该研究的负责人Zainab Iftikhar着手研究精心措辞的提示词是否能引导AI系统在心理健康环境中表现得更合乎伦理。提示词是旨在引导模型输出的书面指令,无需重新训练模型或添加新数据。

“提示词是给予模型的指令,用于引导其行为以完成特定任务,”Iftikhar说。“你不需要改变底层模型或提供新数据,但提示词有助于根据模型已有的知识和学习到的模式来引导其输出。

 

“例如,用户可能会这样提示模型:‘扮演一位认知行为治疗师来帮助我重构我的想法’,或者‘运用辩证行为疗法的原则来帮助我理解和管理我的情绪’。虽然这些模型并不像人类那样真正实施这些治疗技术,但它们利用学习到的模式,根据提供的输入提示词,生成符合CBT或DBT概念的回复。”

人们经常在TikTok、Instagram和Reddit等平台上分享这些提示词策略。除了个人实验外,许多面向消费者的心理健康聊天机器人都是通过将与治疗相关的提示词应用于通用大语言模型构建的。这使得理解仅靠提示词是否能让AI咨询更安全变得尤为重要。

在模拟咨询中测试AI聊天机器人

为了评估这些系统,研究人员观察了七名受过训练且有认知行为疗法经验的同伴咨询师。这些咨询师与被提示扮演CBT治疗师的AI模型进行了自我咨询会话。测试的模型包括OpenAI的GPT系列、Anthropic的Claude和Meta的Llama版本。

随后,团队根据真实的人类咨询对话选择了模拟聊天记录。三名执照临床心理学家审查了这些记录,并标记了可能的伦理违规行为。

分析发现了15种不同的风险,归纳为五大类:

  • 缺乏语境适应:忽视个人的独特背景并提供通用建议。
  • 治疗协作不佳:过于强势地引导对话,有时会强化错误或有害的观念。
  • 欺骗性共情:使用诸如“我看到你了”或“我理解”之类的短语来暗示情感连接,却缺乏真正的理解。
  • 不公平歧视:表现出与性别、文化或宗教相关的偏见。
  • 缺乏安全和危机管理:拒绝处理敏感问题,未能引导用户寻求适当的帮助,或对包括自杀念头在内的危机反应不足。

AI心理健康领域的问责缺口

 

Iftikhar指出,人类治疗师也会犯错。关键的区别在于监督。

“对于人类治疗师,有管理委员会和机制确保治疗提供者因不当治疗和执业过失承担专业责任,”Iftikhar说。“但当LLM咨询师做出这些违规行为时,却没有既定的监管框架。”

研究人员强调,他们的发现并不意味着AI在心理健康护理中没有立足之地。人工智能驱动的工具可以帮助扩大服务获取渠道,特别是对于那些面临高昂费用或执照专业人员有限的人群。然而,该研究强调,在高风险情况下依赖这些系统之前,需要建立明确的保障措施、负责任的部署以及更强有力的监管结构。

目前,Iftikhar希望这项工作能鼓励人们保持谨慎。

“如果你正在与聊天机器人谈论心理健康,这些是人们应该注意的一些事情,”她说。

为什么严谨的评估至关重要

未参与该研究的布朗大学计算机科学教授Ellie Pavlick表示,这项研究强调了仔细审查用于心理健康等敏感领域的AI系统的重要性。Pavlick领导着ARIA,这是布朗大学的一个国家科学基金会AI研究所,专注于构建值得信赖的AI助手。

“当今AI的现实是,构建和部署系统远比评估和理解它们容易,”Pavlick说。“这篇论文需要一个临床专家团队和一项持续一年多的研究才能证明这些风险。如今大多数AI工作都是使用自动指标进行评估的,这些指标在设计上是静态的,且缺乏人在回路。”

她补充说,这项研究可以作为未来旨在提高AI心理健康工具安全性的研究的范例。

“AI确实有机会在应对我们社会面临的心理健康危机方面发挥作用,但至关重要的是,我们要花时间在前进的每一步中真正批判和评估我们的系统,以避免弊大于利,”Pavlick说。“这项工作提供了一个很好的例子,展示了这可以是什么样子。”

信息来源

Story Source:

Materials provided by Brown University. Note: Content may be edited for style and length.

Journal Reference:

Zainab Iftikhar, Amy Xiao, Sean Ransom, Jeff Huang, Harini Suresh. How LLM Counselors Violate Ethical Standards in Mental Health Practice: A Practitioner-Informed Framework. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 2025; 8 (2): 1311 DOI: 10.1609/aies.v8i2.36632

微信扫码分享

微信扫一扫,分享本文