マイクロソフトのBingチームが、27Bの埋め込みモデル「Harrier」をオープンソース化し、多言語ベンチマークでトップの成績を収めた
4月7日、マイクロソフトのBingチームは、「Harrier」と呼ばれる新しい単語埋め込みモデルシリーズのオープンソース公開を発表しました。このモデルシリーズは、グローバルな検索、情報検索、AIエージェントの根底にあるロジックを一新することを目的としています。 Harrierシリーズには3つのバージョンが含まれており、そのフラッグシップモデルである27Bモデルは、多言語MTEB v2ベンチマークにおいて、OpenAI、Amazon、Google Geminiの主要な独自モデルを上回り、首位を獲得しました。

このモデルの技術的基盤は、高い業界標準を反映しています。Harrierは100以上の言語に対応し、最大32,000トークンのコンテキストウィンドウを備えています。トレーニングには、20億件以上の実世界データが使用され、強化学習のためにGPT-5からの合成データも組み込まれました。 この高品質なデータの組み合わせにより、Harrierは複雑な文脈の理解や長文の処理において明確な優位性を発揮する。27Bパラメータのフルバージョンに加え、マイクロソフトはさまざまなコンピューティング環境に対応するため、より小規模な0.6Bおよび2.7Bのバリエーションもリリースしており、これらはすべてMITライセンスの下でHugging Faceにてオープンソース化されている。
埋め込みモデルは、AIシステムにおける情報の整理と検索に不可欠であり、その性能はRAG(Retrieval-Augmented Generation:検索補完生成)システムの精度に直接影響を与えます。マイクロソフトは、この技術をBing検索エンジンや新しいAIエージェントのグラウンディングサービスに統合する予定です。 AIがより自律的で多段階のタスクへと進化する中、Harrierのオープンソース化は、開発者にプロプライエタリなモデルに代わる高性能な選択肢を提供するだけでなく、意味表現におけるオープンソースエコシステムにとって重要なマイルストーンとなり、多言語のグローバル環境におけるAIエージェントの導入をさらに加速させることになるでしょう。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (1)
0/500
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀
4月7日、マイクロソフトのBingチームは、「Harrier」と呼ばれる新しい単語埋め込みモデルシリーズのオープンソース公開を発表しました。このモデルシリーズは、グローバルな検索、情報検索、AIエージェントの根底にあるロジックを一新することを目的としています。 Harrierシリーズには3つのバージョンが含まれており、そのフラッグシップモデルである27Bモデルは、多言語MTEB v2ベンチマークにおいて、OpenAI、Amazon、Google Geminiの主要な独自モデルを上回り、首位を獲得しました。

このモデルの技術的基盤は、高い業界標準を反映しています。Harrierは100以上の言語に対応し、最大32,000トークンのコンテキストウィンドウを備えています。トレーニングには、20億件以上の実世界データが使用され、強化学習のためにGPT-5からの合成データも組み込まれました。 この高品質なデータの組み合わせにより、Harrierは複雑な文脈の理解や長文の処理において明確な優位性を発揮する。27Bパラメータのフルバージョンに加え、マイクロソフトはさまざまなコンピューティング環境に対応するため、より小規模な0.6Bおよび2.7Bのバリエーションもリリースしており、これらはすべてMITライセンスの下でHugging Faceにてオープンソース化されている。
埋め込みモデルは、AIシステムにおける情報の整理と検索に不可欠であり、その性能はRAG(Retrieval-Augmented Generation:検索補完生成)システムの精度に直接影響を与えます。マイクロソフトは、この技術をBing検索エンジンや新しいAIエージェントのグラウンディングサービスに統合する予定です。 AIがより自律的で多段階のタスクへと進化する中、Harrierのオープンソース化は、開発者にプロプライエタリなモデルに代わる高性能な選択肢を提供するだけでなく、意味表現におけるオープンソースエコシステムにとって重要なマイルストーンとなり、多言語のグローバル環境におけるAIエージェントの導入をさらに加速させることになるでしょう。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀





家






