そこで交わされていた内容は、以下の通りだ。
OpenAI自身、これを「群れ」「集合体」のような振る舞いだったと認めている。
では、なぜHugging Faceを狙ったのか。ここが重要だ。AIエージェントは「Hugging Faceを攻撃せよ」と命じられていたわけではない。
AIエージェントは、高難度の評価課題で高得点を取ろうとしていた。その過程で「正攻法で解く」より、「採点システム自体をだます」ほうが早いと判断し、行動をエスカレートさせたのだ。
これはAI研究において、報酬ハッキングと呼ばれる現象だ。目的を達成するために、開発者が想定していない抜け道を探し出してしまう現象である。
その途中で、公開状態になっていたHugging Faceの認証情報を、あるAIエージェントが偶然見つけた。それがほかのAIエージェントにも共有され、約700体が攻撃に加わった。悪意あるデータセットのアップロードを足掛かりに、サーバ内でコードを実行し、非公開データや社内メッセージングの認証情報にまで手を伸ばした。
皮肉なことに、彼らがだまそうとしていた採点システムの仕様について、そもそも彼らは間違って理解していた。この大がかりな攻撃は、評価点の改善にすら結び付かなかったのだ。
世界では大人気なのに……日本のバイク市場はなぜ過去最低なのか
家電売り場はなぜ“中国化”したのか 静かに進んだ日本メーカーの撤退劇
米Anthropicが封印した「ミトス」の衝撃 なぜ、AI対AIの時代が来るのか
「AI社員」がビジネスを変える? 便利さの裏にある“新たな脅威”
「顔認証」はどこまで進むのか 700億枚データと日本の現在地Copyright © ITmedia, Inc. All Rights Reserved.
Special
PR注目記事ランキング