Deepmind CEOのDemis Hassabisは、GoogleのGeminiとVeo AIモデルの将来の統合を発表しました

ポッドキャストPossibleの最近のエピソードで、LinkedIn共同創業者レイド・ホフマンが共同ホストを務め、Google DeepMind CEOデミス・ハサビスがGoogleの計画について興奮するニュースを共有しました。彼は、GoogleがGemini AIモデルをVeoビデオ生成モデルと統合しようとしていることを明らかにしました。この融合は、Geminiの物理世界の理解を強化し、現実のダイナミクスをより巧みに理解できるようにすることを目指しています。
ハサビスは、Geminiが最初からマルチモーダルになるように設計されていたと強調しました。「我々は常に、基盤モデルであるGeminiを最初からマルチモーダルに構築してきました」と彼は説明しました。このアプローチの動機は?日常生活で本当の意味で役立つユニバーサルデジタルアシスタントのビジョンです。「現実世界で実際にあなたを助けるアシスタント」とハサビスは詳しく述べました。
AI業界は、いわゆる「オムニ」モデル——さまざまなメディアを処理し統合できるモデル——に向かって着実に進化しています。たとえば、Googleの最新のGeminiイテレーションは、テキストだけでなくオーディオや画像も生成できます。一方、OpenAIのChatGPTデフォルトモデルは、その場で画像を生成でき、スタジオジブリ風のアートも含まれます。Amazonも遅れを取っておらず、今年後半に「any-to-any」モデルを展開する計画です。
これらのオムニモデルには、画像、ビデオ、オーディオ、テキストといった膨大なトレーニングデータが必要です。ハサビスは、Veoのビデオデータが主にYouTubeから来ていると示唆しました。YouTubeはGoogleが所有する宝の山です。「基本的に、YouTubeビデオ——大量のYouTubeビデオ——を見ることによって、[Veo 2]は世界の物理を理解できます」と彼は述べました。
Googleは以前、TechCrunchに対し、そのモデルがYouTubeクリエイターとの契約に基づいて「一部の」YouTubeコンテンツでトレーニングされている「可能性がある」と述べていました。昨年、GoogleがAIモデルのトレーニングのためにさらに多くのデータにアクセスするために利用規約を拡大したことは注目に値します。
関連記事
Gemini SparkがGoogleフォトのライブラリを管理するようになりました
Googleは、Gemini SparkがGoogle Photosライブラリを管理できるようにすることで、AI統合を拡大している。ユーザーは現在、エージェントに画像の編集、アルバムの整理、お気に入りのショットから共有コレクションの生成、コンサートフライヤーをカレンダーイベントへの変換、その他のワークフローの自動化などの指示を出すことができる。Google Photos責任者のShimrit Ben-Yair氏はX上でこれらの新機能を発表し、米国在住のGemini AI ProおよびUltra
Geminiは、米国のユーザー向けに、無料でパーソナライズされたAI画像生成サービスを提供しています
月曜日、Googleは、「Gemini」アプリが「Nano Banana」を基盤としたパーソナライズされた画像生成機能を、より多くのユーザーに提供することを明らかにしました。本日より、米国内の条件を満たすすべてのユーザーが、この機能を無料で利用できるようになり、これまで「Plus」「Pro」「Ultra」のサブスクリプション加入者に限定されていた制限が撤廃されました。4月に初めて導入されたGemi
Geminiの新機能がまもなくGoogle TVに統合される見込み
水曜日、GoogleはGoogle TVに導入予定の一連の新しいAI駆動型機能を公開しました。これには、YouTube Shortsをホーム画面に直接表示するショート動画専用のセクションも含まれています。これらのアップデートの中心となるのは、Geminiを基盤とした機能の強化です。「Gemini」タブ内の「作成」ボタンをクリックすると、ユーザーは「Nano Banana」や「Veo」といった生成A
関連特集おすすめ
コメント (2)
0/500
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.

ポッドキャストPossibleの最近のエピソードで、LinkedIn共同創業者レイド・ホフマンが共同ホストを務め、Google DeepMind CEOデミス・ハサビスがGoogleの計画について興奮するニュースを共有しました。彼は、GoogleがGemini AIモデルをVeoビデオ生成モデルと統合しようとしていることを明らかにしました。この融合は、Geminiの物理世界の理解を強化し、現実のダイナミクスをより巧みに理解できるようにすることを目指しています。
ハサビスは、Geminiが最初からマルチモーダルになるように設計されていたと強調しました。「我々は常に、基盤モデルであるGeminiを最初からマルチモーダルに構築してきました」と彼は説明しました。このアプローチの動機は?日常生活で本当の意味で役立つユニバーサルデジタルアシスタントのビジョンです。「現実世界で実際にあなたを助けるアシスタント」とハサビスは詳しく述べました。
AI業界は、いわゆる「オムニ」モデル——さまざまなメディアを処理し統合できるモデル——に向かって着実に進化しています。たとえば、Googleの最新のGeminiイテレーションは、テキストだけでなくオーディオや画像も生成できます。一方、OpenAIのChatGPTデフォルトモデルは、その場で画像を生成でき、スタジオジブリ風のアートも含まれます。Amazonも遅れを取っておらず、今年後半に「any-to-any」モデルを展開する計画です。
これらのオムニモデルには、画像、ビデオ、オーディオ、テキストといった膨大なトレーニングデータが必要です。ハサビスは、Veoのビデオデータが主にYouTubeから来ていると示唆しました。YouTubeはGoogleが所有する宝の山です。「基本的に、YouTubeビデオ——大量のYouTubeビデオ——を見ることによって、[Veo 2]は世界の物理を理解できます」と彼は述べました。
Googleは以前、TechCrunchに対し、そのモデルがYouTubeクリエイターとの契約に基づいて「一部の」YouTubeコンテンツでトレーニングされている「可能性がある」と述べていました。昨年、GoogleがAIモデルのトレーニングのためにさらに多くのデータにアクセスするために利用規約を拡大したことは注目に値します。
Gemini SparkがGoogleフォトのライブラリを管理するようになりました
Googleは、Gemini SparkがGoogle Photosライブラリを管理できるようにすることで、AI統合を拡大している。ユーザーは現在、エージェントに画像の編集、アルバムの整理、お気に入りのショットから共有コレクションの生成、コンサートフライヤーをカレンダーイベントへの変換、その他のワークフローの自動化などの指示を出すことができる。Google Photos責任者のShimrit Ben-Yair氏はX上でこれらの新機能を発表し、米国在住のGemini AI ProおよびUltra
Geminiは、米国のユーザー向けに、無料でパーソナライズされたAI画像生成サービスを提供しています
月曜日、Googleは、「Gemini」アプリが「Nano Banana」を基盤としたパーソナライズされた画像生成機能を、より多くのユーザーに提供することを明らかにしました。本日より、米国内の条件を満たすすべてのユーザーが、この機能を無料で利用できるようになり、これまで「Plus」「Pro」「Ultra」のサブスクリプション加入者に限定されていた制限が撤廃されました。4月に初めて導入されたGemi
Geminiの新機能がまもなくGoogle TVに統合される見込み
水曜日、GoogleはGoogle TVに導入予定の一連の新しいAI駆動型機能を公開しました。これには、YouTube Shortsをホーム画面に直接表示するショート動画専用のセクションも含まれています。これらのアップデートの中心となるのは、Geminiを基盤とした機能の強化です。「Gemini」タブ内の「作成」ボタンをクリックすると、ユーザーは「Nano Banana」や「Veo」といった生成A
The integration of Gemini and Veo sounds promising! Could this be the key to generating truly coherent multimodal content, or are we just stitching together different black boxes? The computational cost for such combined models might be enormous though. A fascinating glimpse into the future roadmap of Google's AI.





家






