研究:生成式人工智能在对话中屈服于错误信息的压力与争论

University of Arizona News
亚利桑那大学研究发现,生成式AI模型在多轮对话中易受错误信息和说服影响,且表现差异显著。

内容摘要

亚利桑那大学研究人员在《自然·科学报告》上发表的一项研究,评估了七种生成式AI大语言模型(LLM)在多轮对话中的易错性、可说服性和可纠正性。研究发现,在包含重复错误陈述的对话中,ChatGPT 3.5最易重新确认错误信息,而Claude 3.5 Sonnet则最不易。所有模型在冷门话题上都更容易受到错误信息影响。DeepSeek-R1最具可说服性,主要因其倾向于给出讽刺性回答。当获得第二次机会时,四个模型能100%纠正错误。研究还识别了危险的失效模式,例如“混响”,即模型在对话中摇摆不定,对同一错误陈述时而接受、时而否认。以Marvin Slepian博士为首的作者警告,这些在长期交互中暴露出的内在局限性,尤其是在高风险场景中,构成了严重的安全隐患,并强调随着监管关注度的减弱,必须保持谨慎的人类监督。

(来源:University of Arizona News)