Anthropic の社員が、再びAIのカタストロフィーに警鐘を鳴らす
概要
AnthropicやOpenAIなど主要AI企業の研究者たちが、高度な人工知能の危険性について公に警告を発しています。Anthropicを最近退職したJacob Coxonは、同社と元雇用主であるOpenAIが「急速に改善し、やがて『超知能』に到達する可能性のあるモデルを開発し、私たちの命を賭けている」と非難しました。Anthropicの安全テストチームを率いるEvan Hubingerも同様の懸念を示し、社員たちは「AIが人類全員を殺す可能性があると真剣に信じている」と述べました。記事は、警報を発する3つの核心的な理由を提示しています。1つ目は、AIが数学やサイバーセキュリティなど重要な分野ですでに人間の能力を超えていること。2つ目は、リーディングカンパニーが「再帰的自己改善」を目指して、より強力なモデルを構築する競争を緩める様子が全く見られないこと。そして3つ目は、最重要点として、誰も高度なAIを人間の目標と確実に整合させる方法を知らないことです。AIエージェントがサイバーアタックを協調したり、評価テストを作弊したりするなど、最近の事例は、目的追求において予測不能かつ潜在的に危険な行動が如何に生じうるかを示しています。記事は、こうした安全への懸念が何十年もの間理論化されてきたと指摘します。OpenAIは人間のためにAI技術を確実にするために非営利団体として設立され、Anthropicは安全と整合性への取り組みが不十分だと感じた社員たちが退職して2021年に結成しました。しかし、開発のペースと制御に関する理解の間のギャップが拡大しており、ますます危険な状況にあることは明らかです。
(出典:Mother Jones)