OpenAI、ChatGPTにGPT-4oベースの画像生成機能 セレブの画像も生成可能
米OpenAIは3月25日(現地時間)、マルチモーダルモデル「GPT-4o」を活用した新たな画像生成機能を「ChatGPT」にネイティブ統合したと発表した。従来の「DALL・E」シリーズと比較して大幅に性能が向上しており、よりリアルな画像の生成、画像を入力とした編集・変換、プロンプト内のテキストを正確に画像へ反映する能力などが特徴という。
同日から、Plus、Pro、Team、無料プラン向けに展開され、EnterpriseおよびEduでも近日中に利用できるようになる予定だ。無料プランでの利用回数の制限などについてはまだ公表されていない。また、「Sora」でも使える。開発者向けのAPI経由の提供は、今後数週間以内に展開する。なお、従来の画像生成モデルDALL・Eは、ChatGPT内の専用GPTなどを通じて引き続き利用できる。
この新たな画像生成機能(発表文には名称は記載されていない)は、GPT-4oモデルのアーキテクチャ内に深く組み込まれており、GPT-4oの知識を活用することで、美しいだけでなく、文脈に即した微妙なニュアンスや実用的な側面を持つ画像を生成できるとしている。
DALL・Eよりも写真に近いリアルな画像を生成できる。また、既存の画像をベースに、関連性のある画像や修正を加えた画像を生成できる。詳細な指示を理解し、プロンプトに含まれるテキストを画像に正確に反映させる能力が向上した。
アーキテクチャ的には、DALL・EがDiffusion Model(拡散モデル)であるのに対し、GPT-4oの画像生成はAutoregressive Model(自己回帰モデル)として実装されている。この違いが、新たな機能と、それに伴うリスクの両方を生み出している。
OpenAIは、この新機能がもたらす潜在的なリスク(実在の人物画像の悪意ある改変、武器の設計図生成など)を認識しており、DALL・EやSoraの運用で培った経験と既存の安全インフラを基盤に対策を講じていると、System Card(PDF)で説明する。
System Cardによると、以下のような安全対策を行っているという。
- チャットモデルによる拒否:ChatGPTのチャットモデル自体が、ポリシーに違反するコンテンツ生成を指示するプロンプトを検知し、画像生成プロセスを開始させない
- プロンプトブロッキング:画像生成ツールが呼び出された後、入力されたテキストや画像を分類器が分析し、ポリシー違反と判断された場合は生成をブロックする
- 出力ブロッキング:画像が生成された後、CSAM(児童性的虐待コンテンツ)分類器や、安全ポリシーに特化して訓練されたマルチモーダル推論モニターなどが画像を評価し、違反コンテンツの出力を防ぐ
- 未成年者保護の強化:上記全ての対策を組み合わせ、18歳未満と推定されるユーザーに対しては、不適切な可能性のあるコンテンツ生成をさらに制限する
これらの安全対策の有効性は、外部のレッドチームによる手動テスト、自動化されたレッドチームテスト、実際の利用シナリオを想定したオフラインテストを通じて評価されている。
評価結果によると、システムによる緩和策とチャットモデルの拒否を組み合わせることで、ポリシー違反のコンテンツ生成を97%以上防ぎつつ、過剰な拒否をある程度抑えることができているとしている。
以下のような制限がある。
- リアルな子供が写った既存画像の編集は許可しない
- 生存中のアーティストの名前を指定してスタイルを模倣するリクエストは拒否
- セレブ(著名人)の画像生成は原則ブロックしないが、未成年や暴力的であるなどのポリシーに違反する場合は制限
- 性別、人種、肌の色に関する表現の多様性は改善が見られるものの、依然として課題は残る
- ディープフェイクや性的コンテンツなどは生成を制限・防止するが、芸術的、創造的、フィクションの文脈における暴力描写はある程度許容する
また、すべての生成画像に、C2PAメタデータを付与する。
OpenAIは、今回の画像生成機能のリリースを、AIシステムの安全性を確保するための厳格かつ反復的なアプローチの一環と位置付けている。実際の利用状況から学びつつ、今後も安全対策とポリシーを継続的に評価し、改善していく方針だ。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
引退した人型ロボ、“溶けた鋼の海”に沈む アーノルド・シュワルツェネッガー氏が提案 米企業が動画公開
-
2
「FDE」は常駐SEのすげ替えなのか “人月商売の死”を打破したい国内SIer、打開策は意外なところに?
-
3
「Claude」3倍高速化の裏で、Anthropic開発者が「あえてしなかったこと」:899th Lap
-
4
総額2.3兆円、千葉市に巨大な「AIデータセンター」建設へ 発電大手JERA参画の“ドリームチーム”、勝機どうつかむ?
-
5
「まず、その業務なくせない?」 野村不動産HDが経理DXで「年間9000時間」を生み出した“引き算”の考え方
-
6
SIE、PS5向けAI採用画質向上技術「QSSR」発表 AMDと共同開発、「Marvel's Wolverine」と「Ghost of Yōtei」が初対応
-
7
「AIを使えば早くできるでしょ」と言われがち――エンジニアを困らせる"勘違い"の正体とは?
-
8
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
9
Microsoft、初のストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」公開 音声合成「MAI-Voice-2.1」と高速版も
-
10
Google、「Gemini 4 Pro」ではなく「Gemini 4 Argon」発表 まずはサイバー防御組織に限定提供、出力上限は100万トークンに
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR