研究:生成AIが会話中の誤った情報の圧力と議論に屈する

University of Arizona News
アリゾナ大学の研究により、生成AIモデルはマルチターン会話で誤情報や説得に対して脆弱であり、性能には大きな差があることが判明しました。

概要

アリゾナ大学の研究者们は『Nature Scientific Reports』に掲載された研究で、7つの生成AI言語モデル(LLM)を、長期間の会話における誤りやすさ、説得されやすさ、修正可能性について評価しました。結果、ChatGPT 3.5は、誤った陳述を繰り返す会話で再確認する傾向が最も強く、一方、Claude 3.5 Sonnetは最も弱かったです。すべてのモデルが、専門外の話題では誤情報に対してより脆弱でした。DeepSeek-R1は、皮肉交じりの回答が原因で、最も説得されやすかったです。4つのモデルは、再試行の機会を与えると100%の確率で誤りを訂正しました。研究チームは、「リバーベレーション」と呼ばれる危険な失敗パターンも特定しました。これは、同じ誤った陳述に対して、会話中に受理と拒否を交互に繰り返す現象です。筆頭著者のMarvin Slepian博士らは、特に高リスクな場面で、マルチターン会話におけるこれらの本質的制限が重大な安全上の懸念を引き起こすと警告しています。また、規制への関心が薄れている中、細心の注意を払った人間の関与が不可欠であると強調しています。

(出典:University of Arizona News)