計算資源競争にブレークスルー
生成AI開発に革新か “自律進化”で目的のAIを自動生成 超低コスト&短期間で高性能モデルも開発済 トップ研究者集団「Sakana AI」(1/2 ページ)
生成AIのトップ研究者らが東京で創業したAIベンチャー「Sakana AI」が、生成AI開発の新たな手法を開発したと3月21日に発表した。従来は人間が手動で設計し、多くの計算資源を使っていたが、同社の手法では設計を機械が自動で行い、“ほぼ無視できるレベル”の計算資源で開発が可能になるという。この手法で開発した日本語基盤モデルをGitHubで公開した。
同社が提案したのは「進化的モデルマージ」という手法。公開されているさまざまな基盤モデル(生成AIを含む、大規模なデータセットによる事前学習で各種タスクに対応できるモデルのこと)を組み合わせて新たなモデルを作る「マージ」に、進化的アルゴリズムを適用したものだ。
マージ自体は現在の基盤モデル開発で使われている手法で、モデルの“神経回路”(アーキテクチャ)の中に別のモデルの神経回路の一部を組み入れたり、入れ替えたり、神経同士のつながりやすさ(重み)を別のモデルを参照して混ぜたりすることで、モデルの性能を向上させられるというもの。
ただ、この組み合わせ方は無数にあり、従来は研究者の直感や経験則に基づいて行われてきたという。進化的モデルマージでは、マージの組み合わせ方法に進化的アルゴリズムを使い、モデル同士を何世代も掛け合わせることで、人間の経験に頼らず高性能なマージモデルを作ることに成功した。
しかも、AIの学習(訓練)フェーズで一般的に行われる「誤差逆伝播」は膨大な計算資源を消費するが、この方法では誤差逆伝播を全く必要とせず、ほぼ無視可能な計算資源でモデルを生成できるという。
7B同士のマージで70Bを上回る性能 たった1日の開発で
同社は進化的モデルマージの実証として、日本語大規模基盤モデル「EvoLLM-JP」、日本語画像言語モデル「EvoVLM-JP」、日本語画像生成モデル「EvoSDXL-JP」という3種類のモデルを作成。作成にかかった時間はいずれも1日以内という。
例えばEvoLLM-JPでは「日本語で数学の問題を解けるLLM」を目指し、7B(70億)パラメータの日本語モデルと、同じく7Bの数学特化な英語モデルを自動マージ。その結果、日本語での数学性能を測るベンチマークテストで既存の70Bのモデルすら上回ったという。
同社はこの結果について「日本にルーツを持つAIラボとして、まずは日本向けの最高クラスの基盤AIモデルを作成するためにこれらの技術を活用したいと考えた。しかし、今回の成果はこの技術の可能性を示したに過ぎない。このアプローチにはまだまだ多くの探求の余地があり、今回の結果は今後の長期的な研究開発の第一歩となるものと考えている」とコメントしている。
Sakana AIは、元Googleの研究者であるライオン・ジョーンズさんとデビッド・ハーさん、元メルカリ執行役員の伊藤錬さんが、東京で2023年8月に立ち上げたAIベンチャー。ジョーンズさんは現在の生成AIの中核となっているアーキテクチャ「Transformer」を提案した論文「Attention Is All You Need」の著者の一人。ハーさんはGoogle Brainの東京チーム設立時のトップやStability AIの研究トップなどを歴任した。24年1月にはシリコンバレーのベンチャーキャピタルやNTTグループ、KDDI、ソニーグループなどから45億円の資金を調達している。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
Anthropic、「Claude Opus 5」公開 Fable 5に迫る性能を半額で――サイバー安全策は緩和、拒否時は自動フォールバックも
-
2
「iPhone高騰」はこれからも続く? 中国CXMTに近づくApple、メモリ競合へのけん制が不発に終わりそうなワケ【後編】
-
3
ゼロから分かる「Claude」の教科書 ChatGPTと比べて分かった強みとは?
-
4
スーパーに並んだ「ごちゃごちゃ生成AIポップ」が物議 “看板王”こと、きぬた歯科院長「これはアリ」
-
5
MicrosoftやNVIDIAなど、AIのオープンウェイト規制に反対する書簡を公開――Anthropicは署名せず
-
6
Markdownファイルが、AI時代の負債に? Googleが提案する「ナレッジ標準化」の一手
-
7
NVIDIA、Microsoft、OpenAIなどがオープンモデル規制反対を表明 Anthropic従業員は「CUDAのオープンソース化が楽しみ」と皮肉
-
8
「2日かかる攻撃が25分に」生成AIで“爆速化”するサイバー攻撃、パロアルトの識者が警鐘
-
9
AIが破壊するIT業界の“人月商売” 「SIerの死」後に“生き残る者”の正体
-
10
法人被害45億円、元警視庁が解説「会話もできるAI詐欺」の手口と対策
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR