2015年7月27日以前の記事
検索
インタビュー

月30万円かかるAIは「学習しない社員」だった――LayerXが回し始めた仕事の“自己改善ループ”(2/3 ページ)

AIがAIを改善する「再帰的自己改善」は、企業の現場へ広がった。人件費の3〜4割の費用が発生する“覚えないAI社員”をどう育てるのか。LayerXやマネーフォワードの先進事例から、AI活用の成否を握る「評価」の重要性をひも解く。

Share
Tweet
LINE
Hatena
-

評価は会社の中に閉じている

 福島氏が提示する「3つのループ」――すなわち(1)業務実行の内側ループ、(2)システム基盤を直す外側ループ、そして(3)コストを制御する費用のループは、この「覚えない社員」を組織全体で育てるための設計図である。


LayerXが示した「3つのループ」。作業の実行・検証に加え、知識や記憶への学習、AIの動作を支えるハーネスの改善を重ねる(出所:LayerX講演資料)

 モデルの重みは変えられない。変えられるのは、モデルの外側にある指示文、メモリ、ナレッジベース、権限、ワークフローといった部品で、これをまとめてハーネスと呼ぶ。重みが同じでも、次に仕事をするときに渡す指示や記憶が前回の失敗を踏まえたものになっていれば、エージェントの動きは変わる。

 内側のループは、計画、実行、評価・検証の繰り返しだ。ソースコード全体の脆弱性診断、大量の取引データからの決算処理、契約書からの競業避止条項の抽出といったゴールを与えると、エージェントは計画を立てて実行する。ここで効くのが評価である。何が良いデザインか、法務レビューとして何が正しいか、この会社では部門費用をどう案文するか。福島氏はこれらを「極めて閉じた知識」と言う。一般論では正解が決まらず、その会社の中にしか答えがない。だから評価を用意し、ハーネスがそこから学んで修正されるようにする。

 外側のループで直すのは、ハーネスそのものだ。予算の仕事をするエージェントに、法人向け業務ソフト「バクラク」内のデータしか渡していなければ、スプレッドシートにある重要な数字を見落とす。その失敗を分析し、データアクセスの権限がなかったからだと突き止め、権限の範囲を見直す。手続きの知識が間違っていればワークフローを組み替える。CTOの松本勇気氏が1年半前に本で書いた「社員をオンボーディングするようにAIを扱う」という考え方を、一歩進めたものだと福島氏は位置づけている。

改善役をAIに任せる

 ここまでなら、改善のためにハーネスを人間が直す話である。福島氏の講演で変わっていたのは、その直す役をAIに任せ始めた点だ。

 1年前の時点では、作業者・実務者としてのAIは優秀だったが、「AIの作業自体をメタ的に改善するAI」は無理だった。それが「Fableなどの高度なモデルが登場したあたりから、できるようになってきた」という。

 アモデイ氏が「この夏ごろから」と書いた時期と重なる。AI開発でRSIが動き出したのと同じ世代のモデルで、業務の側でもAIがAIの仕事を直せるようになった、という時系列である。LayerXでは改善役をフロンティアモデルにやらせてみたところ「かなりうまくいくことが分かった」という。エージェントを自己改善するエージェントは、既に社内で実戦投入されている。

 ただし、福島氏は留保も付け加えている。「全部丸投げして自己改善できるほど、まだ整ってはいない」。ある程度の方向性とハーネスを人間が作った後であれば、仕事のログと正しい評価をAIに渡して改善案を考えさせ、自己改善させることが「かなりできるようになってきた」という段階だ。同氏は、ボトルネックが実装から「仕様と検証」に移ったと述べている。AIが実行し、AIが直す。人間に残るのは、何が正しいかを決める評価者の役割だ。


AIによって実装が速くなると、何を作るかを決める「仕様」と、正しく動くかを確かめる「検証」がボトルネックになる(出所:LayerX講演資料)

Copyright © ITmedia, Inc. All Rights Reserved.

ページトップに戻る