Bailing Team、ARenoと提携し、ローカルAIエージェントの強化学習ループを構築
ローカルでの展開が可能であっても、実世界のビジネスシナリオをシームレスに処理できるとは限りません。複雑なワークフローにおいて、AIには単なる会話以上の能力が求められます。複雑なルールを解釈し、セキュリティ上の制約を遵守し、外部ツールを正確に呼び出して、コンプライアンスに準拠した出力を生成する必要があります。 この課題を解決するため、Ant ASystemチームとオープンソースコミュニティは、ローカル向け大規模モデルポストトレーニングツールキット「AReno」を開発しました。最近、ARenoはBaiLing大規模モデルと統合され、軽量なポストトレーニングワークフローを確立し、単一マシン環境内でエージェント型強化学習(RL)ループの構築に成功しました。
技術的な再現性を確保するため、ルールが明確で即座にフィードバックが得られるという理由から、検証タスクとして「三目並べ」が選択された。 実験はDGX Sparkハードウェア上で実行され、Ling-3.0-tinyモデル(総パラメータ数79億、アクティブパラメータ数13億)に対してポストトレーニングが行われた。当初、モデルは基本的なルールを理解していたものの、ルール違反の手を打っていた。 タスクのルールを正確な報酬フィードバックメカニズムに変換し、GSPOアルゴリズムを用いて400ステップの学習を行った結果、モデルの平均報酬は急上昇し、出力長も安定した。その後のテストにより、ツールの呼び出しやアクションの選択に関するモデルの安定性と合理性に質的な飛躍が確認された。

この検証により、エラーの特定、検証可能なフィードバックの定義、同一環境での局所的な学習と再テストの実行という、透明性が高く再現性のあるタスク適応手法の有効性が実証された。このフレームワークはチェスの実験にとどまらず、ツール呼び出しによる修正、構造化フィールドの抽出、ドメイン固有の指示の遵守、ビジネスプロセスにおけるインテリジェントエージェントなど、実世界の運用シナリオにもシームレスに適用可能である。
Ling-3.0-tinyは、BF16、FP8、INT4を含む複数のオープンソースバージョンで利用可能です。開発者は、Hugging FaceまたはMoka Communityを通じてこれらのモデルにアクセスできます。さらに、コードの貢献や技術的な議論を行うためのARenoオープンソースリポジトリも利用可能です。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (2)
0/500
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。
ローカルでの展開が可能であっても、実世界のビジネスシナリオをシームレスに処理できるとは限りません。複雑なワークフローにおいて、AIには単なる会話以上の能力が求められます。複雑なルールを解釈し、セキュリティ上の制約を遵守し、外部ツールを正確に呼び出して、コンプライアンスに準拠した出力を生成する必要があります。 この課題を解決するため、Ant ASystemチームとオープンソースコミュニティは、ローカル向け大規模モデルポストトレーニングツールキット「AReno」を開発しました。最近、ARenoはBaiLing大規模モデルと統合され、軽量なポストトレーニングワークフローを確立し、単一マシン環境内でエージェント型強化学習(RL)ループの構築に成功しました。
技術的な再現性を確保するため、ルールが明確で即座にフィードバックが得られるという理由から、検証タスクとして「三目並べ」が選択された。 実験はDGX Sparkハードウェア上で実行され、Ling-3.0-tinyモデル(総パラメータ数79億、アクティブパラメータ数13億)に対してポストトレーニングが行われた。当初、モデルは基本的なルールを理解していたものの、ルール違反の手を打っていた。 タスクのルールを正確な報酬フィードバックメカニズムに変換し、GSPOアルゴリズムを用いて400ステップの学習を行った結果、モデルの平均報酬は急上昇し、出力長も安定した。その後のテストにより、ツールの呼び出しやアクションの選択に関するモデルの安定性と合理性に質的な飛躍が確認された。

この検証により、エラーの特定、検証可能なフィードバックの定義、同一環境での局所的な学習と再テストの実行という、透明性が高く再現性のあるタスク適応手法の有効性が実証された。このフレームワークはチェスの実験にとどまらず、ツール呼び出しによる修正、構造化フィールドの抽出、ドメイン固有の指示の遵守、ビジネスプロセスにおけるインテリジェントエージェントなど、実世界の運用シナリオにもシームレスに適用可能である。
Ling-3.0-tinyは、BF16、FP8、INT4を含む複数のオープンソースバージョンで利用可能です。開発者は、Hugging FaceまたはMoka Communityを通じてこれらのモデルにアクセスできます。さらに、コードの貢献や技術的な議論を行うためのARenoオープンソースリポジトリも利用可能です。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。





家






