ChatGPTのImages 2.0モデルはテキスト生成に優れている
ほんの数年前までは、人間が作成した画像とAIが生成した画像を見分けるのは比較的簡単でした。当時、画像生成モデルにメキシコ料理店のメニューを作成させると、「エンチュイタ」や「チュリロス」、「バート」、「マルガータ」といった、奇妙な架空の料理が頻繁に生成されていました。
今日、最新のChatGPT Images 2.0モデルにメキシコ料理のメニューを作成するよう依頼すると、実際のレストランですぐに使えるようなものが生成され、客が不自然さを感じることはまずないだろう。(とはいえ、13.50ドルのセビチェには、魚の品質について疑問を抱く人もいるかもしれないが)。

画像提供:ChatGPT Images 2.0
比較のために、2年前にDALL-E 3から受け取った結果を以下に示します。(当時、ChatGPTには画像生成機能がありませんでした):

画像提供:Microsoft Designer (DALL-E 3)
これまで、AI画像生成ツールは文字の描画に大きな課題を抱えていました。これは主に、ランダムなノイズから画像を再構築する拡散モデルに依存していたためです。
「拡散モデルは……与えられた入力を再構築しているのです」と、Lesan AIの創業者兼CEOであるAsmelash Teka Hadgu氏は2024年にTechCrunchに説明しました。「画像上のテキストはごくわずかな要素に過ぎないと見なせるため、画像生成モデルはより多くのピクセルを占める視覚パターンの学習を優先するのです。」
それ以来、研究者たちは自己回帰モデルなど、画像生成に対する他のアプローチを調査してきた。これらのモデルは、画像がどのように見えるべきかを段階的に予測し、大規模言語モデル(LLM)とより類似した働きをする。
残念ながら、OpenAIは今週の記者会見において、ChatGPT Images 2.0を支える具体的なモデルアーキテクチャに関する質問への回答を控えた。
しかし同社は、新モデルが「思考能力」を備えていることを明らかにした。これにより、ウェブ検索、単一のプロンプトからの複数画像生成、自身の出力結果の検証が可能となる。これらの機能により、Images 2.0は様々なサイズのマーケティング資料や、複数コマの漫画を生成できるようになった。
またOpenAIは、Images 2.0が日本語、韓国語、ヒンディー語、ベンガル語を含む非ラテン文字のレンダリングをより的確に処理できると述べています。モデルの知識は2025年12月時点のものであり、ごく最近の出来事に関連する画像を生成する際の精度に影響を与える可能性があります。
「Images 2.0は、画像生成において前例のないレベルの詳細さと正確さを実現します。より複雑なシーンを構想できるだけでなく、そのビジョンを効果的に具現化することも可能です。指示を正確に遵守し、要求された詳細を維持するとともに、小さなテキスト、アイコン、UIコンポーネント、複雑な構図、微妙なスタイルのニュアンスなど、他の画像モデルにとってしばしば課題となる細かな要素を、最大2Kの解像度でレンダリングします」と、OpenAIはプレスリリースで述べています。
こうした高度な機能により、画像生成はChatGPTにテキストで質問するほど瞬時ではありません。しかし、複数コマの漫画のような複雑なものを生成する場合でも、所要時間は数分程度です。
火曜日から、すべてのChatGPTおよびCodexユーザーがImages 2.0を利用できるようになり、有料サブスクライバーはより高度な出力を生成できるようになります。同社はまた、gpt-image-2 APIをリリースする予定で、価格は希望する出力品質と解像度に基づいて設定されます。
関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
関連特集おすすめ
コメント (0)
0/500
ほんの数年前までは、人間が作成した画像とAIが生成した画像を見分けるのは比較的簡単でした。当時、画像生成モデルにメキシコ料理店のメニューを作成させると、「エンチュイタ」や「チュリロス」、「バート」、「マルガータ」といった、奇妙な架空の料理が頻繁に生成されていました。
今日、最新のChatGPT Images 2.0モデルにメキシコ料理のメニューを作成するよう依頼すると、実際のレストランですぐに使えるようなものが生成され、客が不自然さを感じることはまずないだろう。(とはいえ、13.50ドルのセビチェには、魚の品質について疑問を抱く人もいるかもしれないが)。

画像提供:ChatGPT Images 2.0
比較のために、2年前にDALL-E 3から受け取った結果を以下に示します。(当時、ChatGPTには画像生成機能がありませんでした):

画像提供:Microsoft Designer (DALL-E 3)
これまで、AI画像生成ツールは文字の描画に大きな課題を抱えていました。これは主に、ランダムなノイズから画像を再構築する拡散モデルに依存していたためです。
「拡散モデルは……与えられた入力を再構築しているのです」と、Lesan AIの創業者兼CEOであるAsmelash Teka Hadgu氏は2024年にTechCrunchに説明しました。「画像上のテキストはごくわずかな要素に過ぎないと見なせるため、画像生成モデルはより多くのピクセルを占める視覚パターンの学習を優先するのです。」
それ以来、研究者たちは自己回帰モデルなど、画像生成に対する他のアプローチを調査してきた。これらのモデルは、画像がどのように見えるべきかを段階的に予測し、大規模言語モデル(LLM)とより類似した働きをする。
残念ながら、OpenAIは今週の記者会見において、ChatGPT Images 2.0を支える具体的なモデルアーキテクチャに関する質問への回答を控えた。
しかし同社は、新モデルが「思考能力」を備えていることを明らかにした。これにより、ウェブ検索、単一のプロンプトからの複数画像生成、自身の出力結果の検証が可能となる。これらの機能により、Images 2.0は様々なサイズのマーケティング資料や、複数コマの漫画を生成できるようになった。
またOpenAIは、Images 2.0が日本語、韓国語、ヒンディー語、ベンガル語を含む非ラテン文字のレンダリングをより的確に処理できると述べています。モデルの知識は2025年12月時点のものであり、ごく最近の出来事に関連する画像を生成する際の精度に影響を与える可能性があります。
「Images 2.0は、画像生成において前例のないレベルの詳細さと正確さを実現します。より複雑なシーンを構想できるだけでなく、そのビジョンを効果的に具現化することも可能です。指示を正確に遵守し、要求された詳細を維持するとともに、小さなテキスト、アイコン、UIコンポーネント、複雑な構図、微妙なスタイルのニュアンスなど、他の画像モデルにとってしばしば課題となる細かな要素を、最大2Kの解像度でレンダリングします」と、OpenAIはプレスリリースで述べています。
こうした高度な機能により、画像生成はChatGPTにテキストで質問するほど瞬時ではありません。しかし、複数コマの漫画のような複雑なものを生成する場合でも、所要時間は数分程度です。
火曜日から、すべてのChatGPTおよびCodexユーザーがImages 2.0を利用できるようになり、有料サブスクライバーはより高度な出力を生成できるようになります。同社はまた、gpt-image-2 APIをリリースする予定で、価格は希望する出力品質と解像度に基づいて設定されます。
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ





家






