ChatGPTの「画像生成」、どう進化? 開発者に聞く “文字化け解消”の秘訣(1/2 ページ)
画像生成AIにおける「パラダイムシフト(従来の考え方や価値観が大きく変化すること)になる」――米OpenAIの画像生成AI「ChatGPT Images 2.0」について、開発に携わった同社リサーチャーのハタ・ケンジ氏はこのように胸を張る。
ChatGPT Images 2.0は、OpenAIが4月21日に発表したAIモデル。前世代から複数の性能を強化し、AIモデルの性能をユーザーが評価するWebサイト「Arena」(旧:LMArena)では、米Googleの画像生成AI「Nano Banana 2」を上回るスコアを獲得したという。ハタ氏に進化のポイントなどを聞いた。
ハタ氏がまず挙げるのが、文字を画像として出力する「テキストレンダリング」性能の強化だ。日本語などローマ字以外の文字体系にも対応しており、細かい文字も乱れなく生成できるようにした。
OpenAIの画像生成AIで初めて「Thinking機能」を備えたことも特徴だ。同機能は、出力の前に計画を立てることで、複雑なタスクに対応できるもの。Web検索でリアルタイムの情報を参照したり、1つの指示から複数枚の画像を生成したりできる。
ハタ氏によると、生成画像を自ら見直して再出力する機能も持つという。「画像を生成し、その画像が正しいかどうか(AIモデル自身が)チェックする。もしAIモデルが画像を正しくないと考えれば、もう一度同じ作業を繰り返す」(ハタ氏)
デモでは、英語で書かれた架空のメニュー表の画像を日本語表記にして見せた。Thinking機能により、画像内のテキストを読み込み、翻訳してから元の位置に戻すという複雑な作業ができるという。
「日光市(栃木県)を歩いているカップルの少しノスタルジックな画像を生成してください」と指示して出力した画像も披露した。ライティングや物の質感など「それほど長いプロンプトではないのに、細部に注意が払われている」(ハタ氏)とアピールした。
なお、安全性についても対策したとハタ氏。出力結果には、データの来歴情報を管理する「C2PA」などを組み込んでおり、AI生成であることを識別できるようにしているという。AIを活用したモニタリングもしており、OpenAIのポリシーに違反する場合には対応するとした。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
現役組み込みエンジニアがAIを業務利用して分かったこと――期待と限界と現実解
-
2
無料で読めるAIエージェントの実践ガイド、Googleが公開 基礎から本番実装まで学べる
-
3
なぜ「相場の半額」にできた? 「ヒューマノイド界のトヨタ」目指すZEALSの“したたか”な戦略
-
4
フィジカルAIとヒューマノイドの可能性、PFNの見立てとトヨタのアプローチ
-
5
「社内情報をAIに食わせればいい」だけでは足りない、情報検索精度向上の鉄則
-
6
「AIに原始人っぽく話すとトークン65%削減」は本当か? JetBrainsが検証してみた
-
7
「MicrosoftよりGoogle」で6億円削減も? 舞鶴市、千代田区が明かすIT刷新とAI活用の成功法則
-
8
メルカリが明かす「Claude Code全社展開」「シャドーAI対策」を支える仕組み
-
9
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
10
話題の職種「FDE」、実際何をやってるの? OpenAIの現役2人に聞いた
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR