15億ドルの新ルーターモデルが93%の精度を達成、高額な再トレーニングコストを排除
Katanemo Labs の研究者が、ユーザからのクエリを最も適切な大規模言語モデル(LLM)にインテリジェントに誘導するために設計された高度なルーティングモデルとフレームワーク Arch-Router を発表しました。
複数の LLM を活用する製品を開発している企業にとって、Arch-Rolver は中心的なジレンマである、柔軟性に欠けるロジックや更新が必要なたびに高価な再トレーニングに依存することなく、各リクエストをタスクに最適なモデルに自動的にルーティングする方法に取り組んでいます。
LLMルーティングの課題
利用可能なLLMの種類が増えるにつれて、開発者は単一モデル構成から、コードの生成、テキストの要約、画像の編集など、特殊な機能に対して異なるモデルの能力を利用するマルチモデルアーキテクチャに移行しつつあります。
LLMルーティングは、このようなシステムの構築と実行に不可欠な技術となっており、各ユーザークエリを、その処理に最も適したモデルに導くインテリジェントなトラフィックディレクタの役割を果たしている。
現在のルーティング・アプローチは、一般的に2つの主要なグループに分類される。タスク・ベースのルーティングは、あらかじめ定義されたタスク・カテゴリーに従ってクエリを割り当てるものであり、パフォーマンス・ベースのルーティングは、費用と出力品質の間の最良のトレードオフを追求するものである。
しかし、タスクベースのシステムは、ユーザーの意図があいまいであったり、会話の過程で変化したりする場合、特に複数回にわたる対話の場合、しばしば失敗する。一方、パフォーマンス・ベースのルーティングは、静的なベンチマーク結果を優先する傾向があり、実際のユーザーの好みを見落としたり、コストのかかる再トレーニングを行わずに新しいモデルへの適応が遅れることが多い。
Katanemo Labsの研究者が論文で述べているように、より深い問題は、「既存のルーティング手法には、実世界のアプリケーションにおいて実用的な限界がある」ということだ。大半はベンチマークの性能に最適化されているが、主観的な評価基準によって導かれる人間の嗜好は無視されている」。
研究チームは、"主観的な人間の判断を反映し、より高い透明性を提供し、モデルとアプリケーションの両方が進化しても容易に調整可能な "ルーティングシステムの重要性を強調している。
プリファレンスに沿ったルーティングのための新しいフレームワーク
これらの問題を克服するため、研究者たちは、ユーザーの好みに基づいて、入力されたクエリをルーティングルールに適合させる「プリファレンス・アラインド・ルーティング」フレームワークを開発した。
このシステムでは、ユーザーは2階層構造の "Domain-Action Taxonomy "を通じて、自然言語を使ってルーティングポリシーを定義する。この構造は、人々が自然にタスクを記述する方法を反映している。"法律 "や "金融 "といった大まかなカテゴリー(Domain)から始まり、"要約 "や "コーディング "といった特定のタスク(Action)へと掘り下げていく。
そして、各ポリシーが優先モデルにマッピングされ、開発者はベンチマーク指標だけでなく、実用的な要件に基づいてルーティングを選択できるようになる。論文によれば、"この分類法は、ユーザーが明確に定義され、構造化されたルーティングポリシーを作成するためのメンタルモデルとして機能する"。
ルーティングの手順は2段階に分かれている。第一に、嗜好に沿ったルーターモデルが、ユーザーのクエリーを利用可能な全てのポリシーと並べて評価し、最適なものを選択する。次に、選択されたポリシーと割り当てられたLLMをマッピング関数で接続する。
モデルを選択するロジックはポリシーの定義から分離されているため、開発者はルーティング・ルールを編集するだけでモデルを追加、削除、更新することができます。この分離により、モデルやアプリケーションが常に変化する本番環境に必要な柔軟性が実現される。

プリファレンスに沿ったルーティングフレームワーク Source: arXiv ポリシーの選択はArch-Routerによって行われます。Arch-Routerは、プリファレンスアウェアルーティングに最適化されたコンパクトな15億パラメータの言語モデルです。Arch-Routerはユーザのクエリとポリシーの説明の完全なリストを入力として受け取り、最適なポリシーの識別子を出力する。
ポリシーが入力に含まれているため、システムは推論中に新しいルートや更新されたルートに適応することができます。この生成的な戦略により、Arch-Routerは事前に訓練された理解を活用してクエリとポリシーの両方の意味を解釈し、完全な会話履歴を一度に分析することができます。
プロンプトに長大なポリシー・リストを含める際によく懸念されるのは、待ち時間が長くなるリスクだ。しかし、チームはArch-Routerを高効率に構築した。「広範なルーティング・ポリシーを使用しても、Arch-Routerのコンテキスト・ウィンドウを拡張しても、レイテンシにはほとんど影響しません」と、論文の共著者でKatanemo Labsの創設者/CEOであるSalman Paracha氏は言う。Arch-Routerは、"image_editing "や "document_creation "のような短いポリシー名しか出力しません。
Arch-Routerの動作
Arch-Routerを作成するために、チームは43,000のサンプルからなる入念に組み立てられたデータセットを使って、Qwen 2.5モデルの1.5Bパラメータバリアントを微調整した。そして、会話AIシステムをテストするために設計された4つの公開データセットで、OpenAI、Anthropic、Googleの主要な独自モデルとベンチマークを行った。
その結果、Arch-Routerは93.17%というトップの総合ルーティングスコアを達成し、他のすべてのモデル(トップクラスのプロプライエタリモデルを含む)を平均7.71%上回った。Arch-Routerの優位性は長時間の会話でより明らかになり、複数のやりとりにわたってコンテキストを維持する優れた能力が示されました。

Arch-Routerと他のモデルの比較 出典:ArXiv 実世界での使用において、この方法論はすでに複数の場面で応用されているとパラチャ氏は指摘する。例えば、オープンソースのコーディングプラットフォームでは、開発者はArch-Routerを利用して、「コード設計」、「コード理解」、「コード生成」といったワークフローのさまざまな部分を、それぞれのステップに最も効果的なLLMに導いている。同様に、組織はドキュメント作成タスクをClaude 3.7 Sonnetのようなモデルにルーティングする一方で、画像編集リクエストをGemini 2.5 Proに送ることができる。
このシステムはまた、"ユーザーがテキストの要約から事実に関する質問への回答まで、様々な活動を行う様々な分野のパーソナルアシスタントにも適しています "とParacha氏は説明し、"このような状況において、Arch-Routerは製品チームがユーザーの全体的な体験を統合し、向上させるのに役立ちます "と付け加えた。
このフレームワークは、Katanemo LabsのAIネイティブなエージェント用プロキシサーバーであるArchに組み込まれており、きめ細かいトラフィック管理ルールの実装をサポートしている。例えば、新しいLLMを追加する場合、チームは特定のポリシーの下でトラフィックのごく一部を新しいモデルにルーティングし、内部分析を使ってそのパフォーマンスを検証した後、自信を持ってすべてのトラフィックを移行させることができる。同社はまた、企業の開発者がこのワークフローをさらにスムーズに行えるよう、評価プラットフォームとのツールの統合にも取り組んでいる。
Arch-Routerの中核にあるのは、企業がバラバラのAI実装から脱却するのを支援することだ。「Arch-Router、そしてArchプラットフォーム全体は、開発者や企業が断片的なLLMの使用から、統一されたポリシーで管理されたシステムへと進化することを可能にします」とParacha氏は述べる。"ユーザーが幅広いタスクを実行するとき、私たちのプラットフォームは、タスクとモデルの多様性をまとまりのあるエクスペリエンスに変換し、最終的な製品をシームレスで直感的なものにします。"
関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
関連特集おすすめ
コメント (1)
0/500
Katanemo Labs の研究者が、ユーザからのクエリを最も適切な大規模言語モデル(LLM)にインテリジェントに誘導するために設計された高度なルーティングモデルとフレームワーク Arch-Router を発表しました。
複数の LLM を活用する製品を開発している企業にとって、Arch-Rolver は中心的なジレンマである、柔軟性に欠けるロジックや更新が必要なたびに高価な再トレーニングに依存することなく、各リクエストをタスクに最適なモデルに自動的にルーティングする方法に取り組んでいます。
LLMルーティングの課題
利用可能なLLMの種類が増えるにつれて、開発者は単一モデル構成から、コードの生成、テキストの要約、画像の編集など、特殊な機能に対して異なるモデルの能力を利用するマルチモデルアーキテクチャに移行しつつあります。
LLMルーティングは、このようなシステムの構築と実行に不可欠な技術となっており、各ユーザークエリを、その処理に最も適したモデルに導くインテリジェントなトラフィックディレクタの役割を果たしている。
現在のルーティング・アプローチは、一般的に2つの主要なグループに分類される。タスク・ベースのルーティングは、あらかじめ定義されたタスク・カテゴリーに従ってクエリを割り当てるものであり、パフォーマンス・ベースのルーティングは、費用と出力品質の間の最良のトレードオフを追求するものである。
しかし、タスクベースのシステムは、ユーザーの意図があいまいであったり、会話の過程で変化したりする場合、特に複数回にわたる対話の場合、しばしば失敗する。一方、パフォーマンス・ベースのルーティングは、静的なベンチマーク結果を優先する傾向があり、実際のユーザーの好みを見落としたり、コストのかかる再トレーニングを行わずに新しいモデルへの適応が遅れることが多い。
Katanemo Labsの研究者が論文で述べているように、より深い問題は、「既存のルーティング手法には、実世界のアプリケーションにおいて実用的な限界がある」ということだ。大半はベンチマークの性能に最適化されているが、主観的な評価基準によって導かれる人間の嗜好は無視されている」。
研究チームは、"主観的な人間の判断を反映し、より高い透明性を提供し、モデルとアプリケーションの両方が進化しても容易に調整可能な "ルーティングシステムの重要性を強調している。
プリファレンスに沿ったルーティングのための新しいフレームワーク
これらの問題を克服するため、研究者たちは、ユーザーの好みに基づいて、入力されたクエリをルーティングルールに適合させる「プリファレンス・アラインド・ルーティング」フレームワークを開発した。
このシステムでは、ユーザーは2階層構造の "Domain-Action Taxonomy "を通じて、自然言語を使ってルーティングポリシーを定義する。この構造は、人々が自然にタスクを記述する方法を反映している。"法律 "や "金融 "といった大まかなカテゴリー(Domain)から始まり、"要約 "や "コーディング "といった特定のタスク(Action)へと掘り下げていく。
そして、各ポリシーが優先モデルにマッピングされ、開発者はベンチマーク指標だけでなく、実用的な要件に基づいてルーティングを選択できるようになる。論文によれば、"この分類法は、ユーザーが明確に定義され、構造化されたルーティングポリシーを作成するためのメンタルモデルとして機能する"。
ルーティングの手順は2段階に分かれている。第一に、嗜好に沿ったルーターモデルが、ユーザーのクエリーを利用可能な全てのポリシーと並べて評価し、最適なものを選択する。次に、選択されたポリシーと割り当てられたLLMをマッピング関数で接続する。
モデルを選択するロジックはポリシーの定義から分離されているため、開発者はルーティング・ルールを編集するだけでモデルを追加、削除、更新することができます。この分離により、モデルやアプリケーションが常に変化する本番環境に必要な柔軟性が実現される。

ポリシーの選択はArch-Routerによって行われます。Arch-Routerは、プリファレンスアウェアルーティングに最適化されたコンパクトな15億パラメータの言語モデルです。Arch-Routerはユーザのクエリとポリシーの説明の完全なリストを入力として受け取り、最適なポリシーの識別子を出力する。
ポリシーが入力に含まれているため、システムは推論中に新しいルートや更新されたルートに適応することができます。この生成的な戦略により、Arch-Routerは事前に訓練された理解を活用してクエリとポリシーの両方の意味を解釈し、完全な会話履歴を一度に分析することができます。
プロンプトに長大なポリシー・リストを含める際によく懸念されるのは、待ち時間が長くなるリスクだ。しかし、チームはArch-Routerを高効率に構築した。「広範なルーティング・ポリシーを使用しても、Arch-Routerのコンテキスト・ウィンドウを拡張しても、レイテンシにはほとんど影響しません」と、論文の共著者でKatanemo Labsの創設者/CEOであるSalman Paracha氏は言う。Arch-Routerは、"image_editing "や "document_creation "のような短いポリシー名しか出力しません。
Arch-Routerの動作
Arch-Routerを作成するために、チームは43,000のサンプルからなる入念に組み立てられたデータセットを使って、Qwen 2.5モデルの1.5Bパラメータバリアントを微調整した。そして、会話AIシステムをテストするために設計された4つの公開データセットで、OpenAI、Anthropic、Googleの主要な独自モデルとベンチマークを行った。
その結果、Arch-Routerは93.17%というトップの総合ルーティングスコアを達成し、他のすべてのモデル(トップクラスのプロプライエタリモデルを含む)を平均7.71%上回った。Arch-Routerの優位性は長時間の会話でより明らかになり、複数のやりとりにわたってコンテキストを維持する優れた能力が示されました。

実世界での使用において、この方法論はすでに複数の場面で応用されているとパラチャ氏は指摘する。例えば、オープンソースのコーディングプラットフォームでは、開発者はArch-Routerを利用して、「コード設計」、「コード理解」、「コード生成」といったワークフローのさまざまな部分を、それぞれのステップに最も効果的なLLMに導いている。同様に、組織はドキュメント作成タスクをClaude 3.7 Sonnetのようなモデルにルーティングする一方で、画像編集リクエストをGemini 2.5 Proに送ることができる。
このシステムはまた、"ユーザーがテキストの要約から事実に関する質問への回答まで、様々な活動を行う様々な分野のパーソナルアシスタントにも適しています "とParacha氏は説明し、"このような状況において、Arch-Routerは製品チームがユーザーの全体的な体験を統合し、向上させるのに役立ちます "と付け加えた。
このフレームワークは、Katanemo LabsのAIネイティブなエージェント用プロキシサーバーであるArchに組み込まれており、きめ細かいトラフィック管理ルールの実装をサポートしている。例えば、新しいLLMを追加する場合、チームは特定のポリシーの下でトラフィックのごく一部を新しいモデルにルーティングし、内部分析を使ってそのパフォーマンスを検証した後、自信を持ってすべてのトラフィックを移行させることができる。同社はまた、企業の開発者がこのワークフローをさらにスムーズに行えるよう、評価プラットフォームとのツールの統合にも取り組んでいる。
Arch-Routerの中核にあるのは、企業がバラバラのAI実装から脱却するのを支援することだ。「Arch-Router、そしてArchプラットフォーム全体は、開発者や企業が断片的なLLMの使用から、統一されたポリシーで管理されたシステムへと進化することを可能にします」とParacha氏は述べる。"ユーザーが幅広いタスクを実行するとき、私たちのプラットフォームは、タスクとモデルの多様性をまとまりのあるエクスペリエンスに変換し、最終的な製品をシームレスで直感的なものにします。"
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ





家






