マイクロソフト、軽量なマルチモーダルAIモデル「Phi-4-Vision」をオープンソース化
マイクロソフトは、最新のマルチモーダル推論モデル「Phi-4-reasoning-vision-15B」を正式にオープンソース化しました。150億のパラメータを持つこのモデルは、高性能と低コストの理想的なバランスを実現しています。その軽量なアーキテクチャにより、リソースが限られた環境において複雑な視覚タスクに取り組むための、魅力的な新たな選択肢となっています。
精選されたデータで駆動する「コンパクトなパワーハウス」
数兆トークンで学習された一般的な業界モデルとは異なり、「Phi-4-reasoning-vision」はわずか2,000億のマルチモーダルトークンを使用して開発されました。開発チームは、オープンソースデータの厳格なクリーニング、ターゲットを絞った合成データの生成、そして計算推論を強化するために数学的コンテンツを増やすなど、ドメイン固有のデータ比率を慎重に調整することで、データ品質を最優先しました。このアプローチにより、科学的推論や画面上の要素の特定といったタスクにおいて優れた性能を発揮します。

革新的なハイブリッド推論戦略
このモデルの重要な革新点は、「ハイブリッド推論経路」の設計にあります:
知覚タスク:画像キャプションやOCRのような単純なタスクでは、モデルはデフォルトで直接回答モードとなり、速度と低レイテンシを最適化します。
推論タスク:数式や科学的な図表の解釈といった複雑な論理に直面した場合、回答の正確性を確保するために、構造化された思考連鎖(CoT)プロセスを自動的に起動します。
ユーザーは特定のトリガーフレーズを使用してこれら2つのモードを手動で切り替えることもでき、さまざまなアプリケーションのニーズに合わせてモデルの動作を適応させることができます。
SigLIP-2動的解像度エンコーダーを統合することで、本モデルは高解像度のスクリーンショット内の微細な詳細を認識することに優れています。この機能により、デジタルインターフェース上のボタン、入力フィールド、その他の要素を正確に識別し、操作できるコンピュータ利用エージェント(CUA)を開発するための理想的な基盤となります。
Phi-4-reasoning-vision-15Bは現在、主要なオープンソースプラットフォームで利用可能です。マイクロソフトは、このコンパクトなモデルが、マルチモーダル領域において「より小さく、より高速」であることが「より高性能」を意味し得ることを実証し、空間知能およびリアルタイム対話型技術の普及を促進すると期待しています。
関連記事
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
関連特集おすすめ
コメント (1)
0/500
マイクロソフトは、最新のマルチモーダル推論モデル「Phi-4-reasoning-vision-15B」を正式にオープンソース化しました。150億のパラメータを持つこのモデルは、高性能と低コストの理想的なバランスを実現しています。その軽量なアーキテクチャにより、リソースが限られた環境において複雑な視覚タスクに取り組むための、魅力的な新たな選択肢となっています。
精選されたデータで駆動する「コンパクトなパワーハウス」
数兆トークンで学習された一般的な業界モデルとは異なり、「Phi-4-reasoning-vision」はわずか2,000億のマルチモーダルトークンを使用して開発されました。開発チームは、オープンソースデータの厳格なクリーニング、ターゲットを絞った合成データの生成、そして計算推論を強化するために数学的コンテンツを増やすなど、ドメイン固有のデータ比率を慎重に調整することで、データ品質を最優先しました。このアプローチにより、科学的推論や画面上の要素の特定といったタスクにおいて優れた性能を発揮します。

革新的なハイブリッド推論戦略
このモデルの重要な革新点は、「ハイブリッド推論経路」の設計にあります:
知覚タスク:画像キャプションやOCRのような単純なタスクでは、モデルはデフォルトで直接回答モードとなり、速度と低レイテンシを最適化します。
推論タスク:数式や科学的な図表の解釈といった複雑な論理に直面した場合、回答の正確性を確保するために、構造化された思考連鎖(CoT)プロセスを自動的に起動します。
ユーザーは特定のトリガーフレーズを使用してこれら2つのモードを手動で切り替えることもでき、さまざまなアプリケーションのニーズに合わせてモデルの動作を適応させることができます。
SigLIP-2動的解像度エンコーダーを統合することで、本モデルは高解像度のスクリーンショット内の微細な詳細を認識することに優れています。この機能により、デジタルインターフェース上のボタン、入力フィールド、その他の要素を正確に識別し、操作できるコンピュータ利用エージェント(CUA)を開発するための理想的な基盤となります。
Phi-4-reasoning-vision-15Bは現在、主要なオープンソースプラットフォームで利用可能です。マイクロソフトは、このコンパクトなモデルが、マルチモーダル領域において「より小さく、より高速」であることが「より高性能」を意味し得ることを実証し、空間知能およびリアルタイム対話型技術の普及を促進すると期待しています。
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A





家






