DoubaoがAIビジョン性能で世界トップに躍り出て、Googleのモデルを上回る
2026年4月にSuperCLUE-VLMが発表した最新の評価報告書によると、中国におけるマルチモーダル視覚・言語モデルの分野では著しい進展が見られた。 世界トップクラスの大規模モデル17種を徹底的に評価した結果、中国のAI開発者たちが著しい進歩を遂げていることが明らかになった。これらのモデルは、中国語コンテンツの解釈に優れているだけでなく、あらゆる評価指標において国際的なトップモデルを上回る性能を示している。
ランキングのトップはByteDanceが占め、複数の国内モデルが上位にランクインしている。
評価結果によると、ByteDanceの「Doubao-Seed-2.0-Pro-260215」は90.66点を獲得し、総合ランキングで首位を獲得した。 このスコアは、これまで有力な候補と見なされていたGoogleの「Gemini-3.1-Pro-Preview」(89.35点)を上回った。 さらに、アリババの「Qwen3.5」シリーズ、SenseTimeの「SenseNova」、Zhipuの「GLM」といった他の国内モデルも極めて優れたパフォーマンスを発揮し、トップグループに確固たる地位を築いた。 対照的に、OpenAIのGPT-5.4やX.AIのGrokといった海外の著名なモデルは、今回の中国のマルチモーダル評価において中位に甘んじました。

3つの主要分野にわたる詳細な評価、高度な基礎認知能力の証明
評価フレームワークは包括的であり、基礎認知、視覚的推論、視覚的応用の3つの主要分野を網羅していた。評価には、一般的な物体認識、グラフ分析、医療画像診断など、25種類のシナリオが含まれていた。 国内モデルは特に「基礎認知」と「データ分析」のカテゴリーで優れた成績を収め、一貫して90点以上のスコアを記録した。これは、技術的な成熟度の高さと、中国語の文脈への強い適応力を反映している。
専門分野では課題が残るも、産業・医療分野の推論が今後の重点領域として特定された
総合的にはトップを走っているものの、評価データからは、国内モデルに依然として改善が必要な分野も浮き彫りになった。産業検査や高精度医療画像診断といった高度に専門化された視覚推論タスクでは、これらのモデルは世界のトップクラスに遅れをとっており、特定のシナリオによっては得点にかなりのばらつきが見られる。
業界の専門家たちは、こうした最近のランキング変動が、中国のマルチモーダルAI開発にとって重要な転換点になると見ている。中国国内の大規模モデルは、中国語コンテンツを深く理解し応用する能力において確固たる競争優位性を確立しており、国際的な大手企業と競い合い、さらにはこの分野で主導的な役割を果たすことのできる新たな時代の幕開けを告げている。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500
2026年4月にSuperCLUE-VLMが発表した最新の評価報告書によると、中国におけるマルチモーダル視覚・言語モデルの分野では著しい進展が見られた。 世界トップクラスの大規模モデル17種を徹底的に評価した結果、中国のAI開発者たちが著しい進歩を遂げていることが明らかになった。これらのモデルは、中国語コンテンツの解釈に優れているだけでなく、あらゆる評価指標において国際的なトップモデルを上回る性能を示している。
ランキングのトップはByteDanceが占め、複数の国内モデルが上位にランクインしている。
評価結果によると、ByteDanceの「Doubao-Seed-2.0-Pro-260215」は90.66点を獲得し、総合ランキングで首位を獲得した。 このスコアは、これまで有力な候補と見なされていたGoogleの「Gemini-3.1-Pro-Preview」(89.35点)を上回った。 さらに、アリババの「Qwen3.5」シリーズ、SenseTimeの「SenseNova」、Zhipuの「GLM」といった他の国内モデルも極めて優れたパフォーマンスを発揮し、トップグループに確固たる地位を築いた。 対照的に、OpenAIのGPT-5.4やX.AIのGrokといった海外の著名なモデルは、今回の中国のマルチモーダル評価において中位に甘んじました。

3つの主要分野にわたる詳細な評価、高度な基礎認知能力の証明
評価フレームワークは包括的であり、基礎認知、視覚的推論、視覚的応用の3つの主要分野を網羅していた。評価には、一般的な物体認識、グラフ分析、医療画像診断など、25種類のシナリオが含まれていた。 国内モデルは特に「基礎認知」と「データ分析」のカテゴリーで優れた成績を収め、一貫して90点以上のスコアを記録した。これは、技術的な成熟度の高さと、中国語の文脈への強い適応力を反映している。
専門分野では課題が残るも、産業・医療分野の推論が今後の重点領域として特定された
総合的にはトップを走っているものの、評価データからは、国内モデルに依然として改善が必要な分野も浮き彫りになった。産業検査や高精度医療画像診断といった高度に専門化された視覚推論タスクでは、これらのモデルは世界のトップクラスに遅れをとっており、特定のシナリオによっては得点にかなりのばらつきが見られる。
業界の専門家たちは、こうした最近のランキング変動が、中国のマルチモーダルAI開発にとって重要な転換点になると見ている。中国国内の大規模モデルは、中国語コンテンツを深く理解し応用する能力において確固たる競争優位性を確立しており、国際的な大手企業と競い合い、さらにはこの分野で主導的な役割を果たすことのできる新たな時代の幕開けを告げている。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






