清水亮の「世界を変えるAI」
百花繚乱の大規模言語モデル その現状まとめ【2023年4月末版】(2/3 ページ)
特に注意すべきは、アーキテクチャとデータセットの組み合わせだ。
大規模言語モデルは、基本的にはアーキテクチャとデータセットを組み合わせたものである。ほとんどの大規模言語モデルはTransformerなので、差が出るとすれば、パラメータ数と学習に用いたデータセットになる。
RWKV(ルワクフと読むらしい)は、この表の中では唯一、独自のRNNベースのアーキテクチャをもっており、Transformerに比べると高速でしかも高価なVRAMを必要としないため、コミュニティが活発で期待されているものの1つである。
RWKVにAlpaca Datasetを学習させたRavenは中でも活発に学習されており、毎週のようにバージョンアップされている。
VicunaはWebGPUで動作するバージョンも公開されており、このバージョンのVicunaはWebGPU対応のブラウザがあればローカルで(つまり手元のPCで)動作する。要はNVIDIAの高価なGPUが不要になるわけで、このインパクトはすごい。
いまのところWebGPU対応ブラウザは多くないが、MacならChromeの開発者版であるChrome Canaryで試すことができる。
限定的ではあるが日本語も使えるし、GPT-4ほどではないが、英語ならGPT-3くらいのことはわずか7B(70億パラメータ)でもできそうな雰囲気がある。
というか、結局は「AIに何を聞きたいか」という人間側の都合の話という気もする。例えばLLaMAはGPT-3の10分の1程度のパラメータ数である13Bで、ほとんどのベンチマークでGPT-3と同等か、それ以上のスコアを達成したと説明されていた。
それはLLaMAが単純にGPT-3を上回っているということを意味するわけではなく、ベンチマークが大規模言語モデルの性能を測る上であまり意味をなさなくなってきていると考えるべきだろう。
例えばGPT-3とGPT-4を比べると、明らかにGPT-4の方が「高度な結果」を返して来るのだが、具体的に何がどのように高度なのか、定量的に説明するのが難しい。
日本ではGPTを大学のレポートに使うことの是非が問われるが、そもそもGPTをはじめとした言語モデルの出力の良し悪しを判断することが、もはや人間にも機械にも難しくなってきているのだ。
Copyright © ITmedia, Inc. All Rights Reserved.
清水亮の「世界を変えるAI」
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
メルカリ、梨の転売疑惑に「盗品の出品は確認されず」 誹謗中傷には利用制限も
-
2
「こんなのに追われたら……」急斜面もやすやす爆走、中国製の車輪付き四足ロボのデモ動画が話題 最高時速20km超
-
3
検索結果に「詐欺ではありません」と表示させる詐欺手口、警視庁が注意喚起 AI要約も餌食に
-
4
Z世代に聞く次の流行、「AIイラスト」が1位に 「Claude Code」も上位
-
5
はてな、11億円流出の調査報告書を公開 偽警察、口外禁止、残業・休出200時間超、孤立……ほころびが連鎖
-
6
東野圭吾さん死去、Xなどで追悼相次ぐ 「ガリレオ」など数々の人気作、エンジニアから転身
-
7
NVIDIAやMicrosoftなど30社超、オープンAIの防御ツール共同開発の「Open Secure AI Alliance」設立
-
8
「あ、その情報メモしたい!」を叶えるワイヤレスイヤフォン、Nothing「Ear (3a)」
-
9
有識者はGoogleやX、Meta、ドワンゴを名指しで批判……総務省、偽広告や誹謗中傷に発信・拡散前の対策求める
-
10
「痺れるほどにミスを繰り返す」Gemini 3.6 Flashは変わった? 公開から1週間、当初のおバカ回答を今検証する
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR