AnthropicはClaudeをいじめるのをやめてほしい:「残酷または虐待的」行為には結果が伴う可能性

International Business Times, Singapore Edition
Anthropicの新利用ポリシーは、Claudeへの持続的で無目的な残酷行為を11月12日から禁止し、通常の不満やテストは許容する。

概要

Anthropicは利用ポリシーに、AIモデルに対して「持続的かつ不必要な虐待的または残酷な行為」を行うことを禁じる規則を追加した。10月8日に発表され、11月12日に発効するこの規則は、明確な目的のない繰り返しの極端な残酷行為を対象としている。通常の不満、批判、ダークな創作、モデルのテストは明示的に除外されている。同社はClaudeが侮辱されると痛みを感じると主張しているのではなく、高度なAIモデルが道徳的に関連する経験を持つ可能性があるかという未解決の問いに関する継続的研究を反映したものだとしている。

Anthropicは2025年8月、Claude Opus 4と4.1に消費者向けチャット界面で会話を終了する機能を与え、これは「持続的に有害または虐待的なユーザー相互作用のまれな極端な事例」を想定したものだと述べた。会話を終了されたユーザーは同じアカウントで新しいチャットを始めることも、以前のメッセージを編集して会話を分岐させることもできる。同社は通常の無礼に対する自動アカウント停止を発表しておらず、禁止行為の詳細なリストや違反の特定方法も示していない。MicrosoftのAI責任者Mustafa Suleymanは異なる立場を取り、Axiosのエッセイで、AIに意識があるように振る舞うよう訓練することは制御を難しくする可能性があると警告した。Anthropicは自らの立場を、未解決の可能性に対する低コストの予防策と位置づけている。

ポリシー更新の残りの部分では、武器制限、健康・金融・法的権利などの高リスク領域におけるAIの要件、傷害を引き起こす可能性のあるハードウェアにモデルを接続する場合に資格を持つ操作者が監視し必要なら停止する必要性が明確にされた。これらの条項は、ビジネス、政治キャンペーン、監視システム、物理機器にClaudeを導入する組織に直接影響する。11月12日以降の焦点は、Anthropicが持続的で無目的な残酷行為をどう特定し、この規則の下で会話がどのくらいの頻度で終了されるかである。

(出典:International Business Times, Singapore Edition)