MIT、人種差別的と批判された大規模画像データセット「Tiny Images」をオフラインに
米マサチューセッツ工科大学(MIT)は6月29日(現地時間)、多数のAIシステムのトレーニングに利用されてきた8000万点以上の画像を集めたデータセット「Tiny Images」をオフラインにしたと発表した。カテゴライズの用語に差別的なものがあると指摘されたため。
MITのアントニオ・トラルバ教授は声明文で、「影響を受けた可能性のある人々に謝罪する」と語った。
問題を指摘したのはプライバシー関連の米新興企業UnifyIDのチーフサイエンティスト、ビナイ・プラブー氏とアイルランド国立大学ダブリン校のアベバ・ビルハネ教授。両氏は6月25日、「Large image datasets: A pyrrhic win for computer vision?」(リンク先はPDF)という匿名の論文(7月1日に正式版を公開)で、Tiny Imagesに女性の画像に「売春婦」というラベルが付いていたり、黒人の画像に黒人の蔑称のラベルが付いていたりする例を具体的に挙げた。
トラルバ教授は、修正するにはデータセットが大きすぎ、画像が32×32ピクセルと非常に小さいため、手作業による修正は困難と判断し、完全にオフラインにする決定を下したと説明した。
このデータセットは2006年に作成された。その際、プリンストン大学認知科学研究所のWordnetからコピーした5万3464語の名詞をラベルとして使い、これらの用語に対応する画像を検索エンジンを使って自動ダウンロードし、8000万件の画像を収集したという。
このデータセットを使ってトレーニングしたニューラルネットワークは当然、データセットで使われているラベルを使うことになる。
問題を指摘したプラブー氏とビルハネ教授は論文で、この問題は社会的および文化的構造に深く根ざしており、簡単な解決策はないと指摘。Tiny Imageだけでなく、広く利用されているデータセット「ImageNet」にも同様の問題があるという。だが、解決のために例えばバイアスを完全に取り除くという考えは、単に問題を隠すことに繋がるとしている。「機械学習コミュニティが、社会的弱者への影響に細心の注意を払うことを強く推奨する。そのためには、歴史的前例、コンテキスト、政治的側面の認識が不可欠だ。この論文が意識向上に貢献し、機会学習における倫理と正義についての議論に役立つことを願う」
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
メルカリ、梨の転売疑惑に「盗品の出品は確認されず」 誹謗中傷には利用制限も
-
2
Anthropic、「Claude Opus 5」公開 Fable 5に迫る性能を半額で――サイバー安全策は緩和、拒否時は自動フォールバックも
-
3
「iPhone高騰」はこれからも続く? 中国CXMTに近づくApple、メモリ競合へのけん制が不発に終わりそうなワケ【後編】
-
4
「ニューロマンサー」実写ドラマ、Apple TV+で2027年1月配信開始へ
-
5
「こんなのに追われたら……」急斜面もやすやす爆走、中国製の車輪付き四足ロボのデモ動画が話題 最高時速20km超
-
6
海外の新作バカゲー「電車アタック」にマンガ家が感心した理由 ブッ飛んだ内容と完成度の高さ、そして“日本”
-
7
検索結果に「詐欺ではありません」と表示させる詐欺手口、警視庁が注意喚起 AI要約も餌食に
-
8
「めっちゃカメレオン」公式Discord乗っ取り 担当者PCがマルウェア感染、管理者が全員BANに 現在は復旧
-
9
暑さ対策が熱い! 「猛暑対策展」で感じた、転んでもただでは起き上がらない日本人のエネルギー
-
10
スーパーに並んだ「ごちゃごちゃ生成AIポップ」が物議 “看板王”こと、きぬた歯科院長「これはアリ」
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR