Innovative Tech(AI+)
米Appleの独自AI「Apple Intelligence」の技術詳細 基盤モデルや学習データなどを解説(3/3 ページ)
機械ではなく“人間”がモデルの精度を評価
Appleは、モデルのベンチマークには人間による評価を用いている。これは、機械的な指標よりも、ユーザーの満足度により強く相関すると考えられるためだ。評価は、汎用的な基盤モデルと、タスク特化型のアダプターの両方で行われている。
例えば、要約タスクの評価では、実際の製品を想定した多様な入力データを用意し、アダプター適用後のモデルが生成した要約を人間が採点。その際、要約の品質だけでなく、重要な情報の欠落がないかなども確認している。その結果、要約のアダプターモデルは、ベースラインモデルよりも高品質な要約を生成することを確認した。
続けて、オンデバイスモデルとサーバベースモデルの一般的な能力も評価する。一般的なモデルの能力をテストするために、プロンプトの包括的な評価セット(質問応答、コーディング、数学的推論、書き換えなど)を使用する。
提案モデルをオープンソースモデル(Phi-3、Gemma、Mistral、DBRX)や同等サイズの商用モデル(GPT-3.5-Turbo、GPT-4-Turbo)と比較した結果、提案モデルは、多くの比較可能な競合モデルよりも人間の評価者に好まれた。
具体的には、約30億のパラメータを持つオンデバイスモデルが、Phi-3-mini、Mistral-7B、Gemma-7Bを含む大規模モデルを上回り、サーバモデルではDBRX-Instruct、Mixtral-8x22B、GPT-3.5-Turboと比較して好成績を収めた。
また、有害なコンテンツ、機密トピック、事実性に関するモデルのパフォーマンスをテストするための評価セットでも、オンデバイスモデルとサーバモデルの両方で高い堅牢性を示し、オープンソースモデルや商用モデルよりも低い違反率を達成した。
さらに、Instruction-Following Eval(IFEval)ベンチマークを使用して、同等のサイズのモデルと命令に従う能力を比較した結果、オンデバイスモデルとサーバモデルの両方が、同等のサイズのオープンソースモデルや商用モデルよりも詳細な命令に従うことを示した。
Appleは近日中に、さらなる詳細なモデルセットを共有する予定としている。
Copyright © ITmedia, Inc. All Rights Reserved.
Innovative Tech(AI+)
2019年の開始以来、多様な最新論文を取り上げている連載「Innovative Tech」。ここではその“AI編”として、人工知能に特化し、世界中の興味深い論文を独自視点で厳選、解説する。執筆は研究論文メディア「Seamless」(シームレス)を主宰し、日課として数多くの論文に目を通す山下氏が担当。イラストや漫画は、同メディア所属のアーティスト・おね氏が手掛けている。
この記事の著者
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
「FDE」は常駐SEのすげ替えなのか “人月商売の死”を打破したい国内SIer、打開策は意外なところに?
-
2
引退した人型ロボ、“溶けた鋼の海”に沈む アーノルド・シュワルツェネッガー氏が提案 米企業が動画公開
-
3
総額2.3兆円、千葉市に巨大な「AIデータセンター」建設へ 発電大手JERA参画の“ドリームチーム”、勝機どうつかむ?
-
4
「まず、その業務なくせない?」 野村不動産HDが経理DXで「年間9000時間」を生み出した“引き算”の考え方
-
5
「AIを使えば早くできるでしょ」と言われがち――エンジニアを困らせる"勘違い"の正体とは?
-
6
国産AI「LLM-jp-4」ベースのAIモデル、KDDI傘下のELYZAが無料公開
-
7
Rails作者DHH「Pencils Down、もう手でコードは書かない」 それでもソフトウェア開発の未来は明るい理由
-
8
「Gemini 4 Argon」とは 性能評価にみるAstra/Fable/Opusとの違い 一般提供は年内?
-
9
Autodesk、FusionなどのAI機能を発表 設計作業の自動化や設計資産の再利用を支援
-
10
「システムプロンプト陳腐化」をどう防ぐか AWSの試行錯誤に見る「自社AIエージェント」運用のポイント
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR