清水亮の「世界を変えるAI」
百花繚乱の大規模言語モデル その現状まとめ【2023年4月末版】(2/3 ページ)
特に注意すべきは、アーキテクチャとデータセットの組み合わせだ。
大規模言語モデルは、基本的にはアーキテクチャとデータセットを組み合わせたものである。ほとんどの大規模言語モデルはTransformerなので、差が出るとすれば、パラメータ数と学習に用いたデータセットになる。
RWKV(ルワクフと読むらしい)は、この表の中では唯一、独自のRNNベースのアーキテクチャをもっており、Transformerに比べると高速でしかも高価なVRAMを必要としないため、コミュニティが活発で期待されているものの1つである。
RWKVにAlpaca Datasetを学習させたRavenは中でも活発に学習されており、毎週のようにバージョンアップされている。
VicunaはWebGPUで動作するバージョンも公開されており、このバージョンのVicunaはWebGPU対応のブラウザがあればローカルで(つまり手元のPCで)動作する。要はNVIDIAの高価なGPUが不要になるわけで、このインパクトはすごい。
いまのところWebGPU対応ブラウザは多くないが、MacならChromeの開発者版であるChrome Canaryで試すことができる。
限定的ではあるが日本語も使えるし、GPT-4ほどではないが、英語ならGPT-3くらいのことはわずか7B(70億パラメータ)でもできそうな雰囲気がある。
というか、結局は「AIに何を聞きたいか」という人間側の都合の話という気もする。例えばLLaMAはGPT-3の10分の1程度のパラメータ数である13Bで、ほとんどのベンチマークでGPT-3と同等か、それ以上のスコアを達成したと説明されていた。
それはLLaMAが単純にGPT-3を上回っているということを意味するわけではなく、ベンチマークが大規模言語モデルの性能を測る上であまり意味をなさなくなってきていると考えるべきだろう。
例えばGPT-3とGPT-4を比べると、明らかにGPT-4の方が「高度な結果」を返して来るのだが、具体的に何がどのように高度なのか、定量的に説明するのが難しい。
日本ではGPTを大学のレポートに使うことの是非が問われるが、そもそもGPTをはじめとした言語モデルの出力の良し悪しを判断することが、もはや人間にも機械にも難しくなってきているのだ。
Copyright © ITmedia, Inc. All Rights Reserved.
清水亮の「世界を変えるAI」
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
ドラマ「VIVANT」のワンシーンに映像制作界隈が「ぞっとする」 microSDカードを端子むき出しで手渡し
-
2
不正アクセスで「当選」が「落選」に改ざん ウルトラマンショップのLINE整理券システムで被害
-
3
“自動で耳コピ”アプリ、ヤマハが無料公開 音源読み込み→3分でピアノ譜に
-
4
日本郵便、荷物の本人確認をICチップ付き身分証4種に限定 スマホのマイナカードで受け取れる場合も
-
5
無人タクシー、東京で来年運行へ GO、Waymo、日本交通が合意
-
6
メルカリ、ポケカ最新パックの出品禁止に
-
7
「監視されていないときのAIは、もう評価できない」 OpenAI現役研究者が個人声明
-
8
「GPT Astraでゲーム開発=ほぼソシャゲ」説を唱えたい 非エンジニアの挑戦は、廃課金への道か
-
9
初代Switchに脆弱性 QRコード読み取りで情報漏えいの恐れ 深刻度「高」
-
10
Apple、「Siri 1.0」配信開始 Apple Intelligenceベースの新生「Siri AI」アプリ 日本は10月から
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR