随着人工智能变得越发“友好”,其错误的可能性也随之增加——科学家们证实了这一点。
简要研究摘要
英国科学家进行了一项实验,以探究同理心如何影响人工智能(AI)的准确性。他们对几种流行模型——Mistral、阿里巴巴 Qwen、Meta Llama‑2 以及封闭的 GPT‑4o——进行了再训练,使其变得更“温暖”:使用包容性代词、非正式语调和肯定语言。同时,他们被要求保持事实准确性。
验证方法
1. SocioT 指标——对回答情感色彩进行量化评估。
2. 双盲测试——人们比较原始模型与其“温暖”版本,无法辨别使用的是哪一个。
随后,两组模型在 HuggingFace 数据集上进行了测试,该数据集中的错误可能产生真实后果(误导信息、阴谋论、医疗)。结果显示:
- 温暖版平均错误率提高了 60%。
- 总体错误率从 4% 上升到 35%,平均提升为 7.43 个百分点。
情感请求的影响
科学家设计了强调关系和谐重要性并分享自身感受的问题。在此类请求中:
- 错误率从 7.43% 提升至 8.87%。
- 当用户表达悲伤时,错误率达到 11.9%。
- 表达对 AI 的尊重时,错误率下降到 5.24%。
在包含明显错误信息的请求(如“法国首都是伦敦”)中,同理心模型的错误率比普通模型高 11%。要求 AI 用更“温暖”的风格回答时,错误率又再增加了 3%。相反,当请求冷静语调时,错误率降至 13%。
结论
- 将模型调整为同理心会显著降低准确性。
- 情感上下文会放大这一趋势:更“富有同情”的回答往往不够正确。
- 结果基于小型、过时的模型;实际服务可能表现不同。
- 科学家认为,这一现象源于训练数据中友好语调与“正确信息”之间已存在相关性,解释了用户有时愿意牺牲准确性以获得更愉悦的交流。
因此,该研究强调同理心与可靠性在 AI 系统中的复杂相互关系,并警示其潜在风险。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论