「Yahoo!知恵袋」の不快な投稿、見えないところへ わずか1日で6億件を処理 ヤフー社内で何が起きたのか(1/2 ページ)
老舗Q&Aサービス「Yahoo!知恵袋」は、長い間あるものに悩まされてきた。規約違反ではないため削除できないが、見る人を不快にさせる内容の“グレーな投稿”である。これまで社内でパトロールを行うなど対応してきたが、同サービスの投稿は約6億件にものぼり、全てのグレーな投稿を見つけ出すことは難しかった。スーパーコンピュータ「kukai」(クウカイ)が導入されるまでは。
グレーな投稿に利用者からは「厳しい意見」
グレーな投稿には、中身がなく質問への回答になっていないものや、アダルトカテゴリーではないのに年齢制限が必要そうなものなどがある。ユーザー投稿型サービスだからこそ起こる問題だが「利用者から厳しい意見をいただくことも多い。どこかで線引きをする必要があった」とヤフーの丹羽達洋さんは話す。
そこで考えたのが、グレーな投稿を検出し、トップページなど人目につきやすい場所では非表示にするという対応だった。
グレーな投稿、どうやって見つける?
しかし、質問と回答を合わせて約6億件にもなる投稿を、人が全てチェックすることは難しい。ヤフーは専用のシステムを構築し、投稿内容から「白」か「グレー」か「黒」かを自動判定することにした。
まず行ったのは投稿内容の解析だ。自然言語処理では一般的に、文を形態素(意味を持つ最小単位)に分けて解析する。だが「グレーな投稿の中には日本語の体をなしていないものもある。形態素解析ではうまくいかなかった」(ヤフーの清水徹さん)という。そこで別のアプローチを採用した。ディープラーニング(深層学習)の活用だ。
「文を文字単位に分解して扱う深層学習的な処理を導入し、文の全体や文脈を踏まえて(内容を)判断する、パワフルなモデルを作った」と清水さんは話す。
合わせて、Twitter上のツイートと、それに対する返事(リプライ)をペアにしたデータ数千万件を使った学習モデルも作成。Yahoo!知恵袋の投稿内容を解析するモデルと組み合わせ、「ある発言に対して、適切な返事を見つけられるよう学習させていった」(清水さん)という。
投稿の判別にも機械学習を活用した。まず「どんな投稿を白、グレー、黒とするか」の基準を社内向けガイドラインで設定。各基準に当てはまる「正解データ」を作成して機械学習を行い、実際にYahoo!知恵袋に投稿された質問や回答が「どの程度グレーか」を予測できるようにし、文意を解析するモデルと組み合わせた。
だが、判定のためのモデルができてからも一筋縄ではいかなかった。蓄積された約6億件の投稿をまとめて処理するには、既存のサーバを使った環境では約9カ月かかるという試算が出たのだ。そこで清水さんは考えた。「kukaiの出番だ」と。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
生成AI画像はなぜ“キショい”のか 消費者が抱く違和感の正体 広報のプロが解説
-
2
委託業者が無断でAI利用か――ヨルシカ、ライブ映像上映会のチケットサンプル画像が文字化け デザインにも影響
-
3
楽天モバイル、楽天ID未連携なら11月末に自動解約 電話番号も失効
-
4
「pixiv」「note」「ガルちゃん」などが国指定の“大規模プラットフォーム”に 誹謗中傷への迅速対応求める
-
5
「放射能問題、福島大には触らせたくない」で炎上した学歴系YouTuber、謝罪・動画削除も批判続く
-
6
「よりによって月末に」 サイボウズ「kintone」「Garoon」などで2時間にわたり障害
-
7
LINE×PayPay連携が延期の見通し 総務省の行政指導受け安全確認に時間 報道
-
8
三井不動産に不正アクセス 社員・社外関係者の情報最大5万5000件漏えいか
-
9
東大の新「価値創造学部」に批判相次ぐ……「他学部は価値を創造していないのか」「空虚な名前」
-
10
やっぱり完全在宅ワークが一番幸せだった 離職率も最低 米大が7700人の働き方調査
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR