Anthropic希望你别再欺负Claude:“残忍或辱骂”行为可能带来后果
内容摘要
Anthropic在其使用政策中新增条款,禁止用户对其AI模型施加“持续且不必要的辱骂或残忍行为”。该规则于10月8日宣布,11月12日生效,针对的是没有明确目的的反复极端残忍行为。普通的不满、批评、黑暗题材创作和模型测试均被明确排除在外。公司并未声称Claude被辱骂时会感到痛苦,而是表示这项政策反映了Anthropic对先进AI模型是否可能具有某种道德相关体验的持续研究,并称这一问题仍不确定。
早在2025年8月,Anthropic已赋予Claude Opus 4和4.1在消费者聊天界面中结束对话的能力,用于“持续有害或辱骂性用户交互的罕见极端情况”。对话被结束的用户仍可用同一账户开启新对话,或通过编辑早前消息来延续原对话。Anthropic未宣布对普通无礼行为自动封号,也未详细列出禁止行为或说明如何识别违规。Microsoft AI负责人Mustafa Suleyman对此持不同立场,在Axios的一篇文章中认为,训练AI表现得像有意识会让系统更难控制。Anthropic则将其立场描述为针对未决可能性的低成本预防措施。
政策更新的其余部分还澄清了武器限制、AI在健康、金融和法律权利等高风险场景中的要求,以及当模型连接可能造成伤害的硬件时须有合格操作员在场。这些条款直接影响在商业运营、政治竞选、监控系统或物理设备中部署Claude的机构。11月12日之后,关键问题将是Anthropic如何识别持续且无目的的残忍行为,以及依据该规则结束对话的频率。
(来源:International Business Times, Singapore Edition)