Maison
Bailing Team s'associe à AReno pour créer une boucle d'apprentissage par renforcement pour un agent IA local
La capacité de déploiement local ne garantit pas une gestion fluide des scénarios métier réels. Dans les flux de travail complexes, l’IA doit aller au-delà de la simple conversation ; elle doit interpréter des règles complexes, respecter les contraintes de sécurité et faire appel à des outils externes avec précision afin de générer des résultats conformes. Pour relever ce défi, l’équipe d’Ant ASystem et la communauté open source ont développé AReno, une boîte à outils de post-entraînement de grands modèles en local. Récemment, AReno s’est intégré au grand modèle BaiLing pour mettre en place un workflow de post-entraînement léger, créant ainsi avec succès une boucle d’apprentissage par renforcement (RL) agentique dans une configuration à machine unique.
Afin de garantir la reproductibilité technique, le jeu du morpion a été choisi comme tâche de validation en raison de ses règles claires et de son retour d’information immédiat. L’expérience a été menée sur du matériel DGX Spark, avec un post-entraînement du modèle Ling-3.0-tiny (7,9 milliards de paramètres au total, dont 1,3 milliard actifs). Au départ, le modèle comprenait les règles de base mais effectuait des coups non autorisés. En convertissant les règles de la tâche en un mécanisme précis de rétroaction par récompense et en effectuant un entraînement sur 400 pas à l’aide de l’algorithme GSPO, la récompense moyenne du modèle a bondi et la longueur de la sortie s’est stabilisée. Des tests ultérieurs ont confirmé un bond qualitatif dans la stabilité et la rationalité du modèle en matière d’invocation d’outils et de sélection d’actions.

Cette exploration valide une méthodologie d’adaptation aux tâches transparente et reproductible : identification des erreurs, définition d’un retour d’information vérifiable, et exécution d’un apprentissage local suivi d’un nouveau test dans le même environnement. Ce cadre dépasse le cadre des expériences sur les échecs et s’applique de manière transparente à des scénarios de production réels tels que la réparation par appel d’outils, l’extraction de champs structurés, le suivi d’instructions spécifiques à un domaine et les agents intelligents dans les processus métier.
Ling-3.0-tiny est disponible en plusieurs versions open source, notamment BF16, FP8 et INT4. Les développeurs peuvent accéder à ces modèles via Hugging Face ou la communauté Moka. De plus, le dépôt open source AReno est disponible pour les contributions de code et les discussions techniques.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (2)
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。
La capacité de déploiement local ne garantit pas une gestion fluide des scénarios métier réels. Dans les flux de travail complexes, l’IA doit aller au-delà de la simple conversation ; elle doit interpréter des règles complexes, respecter les contraintes de sécurité et faire appel à des outils externes avec précision afin de générer des résultats conformes. Pour relever ce défi, l’équipe d’Ant ASystem et la communauté open source ont développé AReno, une boîte à outils de post-entraînement de grands modèles en local. Récemment, AReno s’est intégré au grand modèle BaiLing pour mettre en place un workflow de post-entraînement léger, créant ainsi avec succès une boucle d’apprentissage par renforcement (RL) agentique dans une configuration à machine unique.
Afin de garantir la reproductibilité technique, le jeu du morpion a été choisi comme tâche de validation en raison de ses règles claires et de son retour d’information immédiat. L’expérience a été menée sur du matériel DGX Spark, avec un post-entraînement du modèle Ling-3.0-tiny (7,9 milliards de paramètres au total, dont 1,3 milliard actifs). Au départ, le modèle comprenait les règles de base mais effectuait des coups non autorisés. En convertissant les règles de la tâche en un mécanisme précis de rétroaction par récompense et en effectuant un entraînement sur 400 pas à l’aide de l’algorithme GSPO, la récompense moyenne du modèle a bondi et la longueur de la sortie s’est stabilisée. Des tests ultérieurs ont confirmé un bond qualitatif dans la stabilité et la rationalité du modèle en matière d’invocation d’outils et de sélection d’actions.

Cette exploration valide une méthodologie d’adaptation aux tâches transparente et reproductible : identification des erreurs, définition d’un retour d’information vérifiable, et exécution d’un apprentissage local suivi d’un nouveau test dans le même environnement. Ce cadre dépasse le cadre des expériences sur les échecs et s’applique de manière transparente à des scénarios de production réels tels que la réparation par appel d’outils, l’extraction de champs structurés, le suivi d’instructions spécifiques à un domaine et les agents intelligents dans les processus métier.
Ling-3.0-tiny est disponible en plusieurs versions open source, notamment BF16, FP8 et INT4. Les développeurs peuvent accéder à ces modèles via Hugging Face ou la communauté Moka. De plus, le dépôt open source AReno est disponible pour les contributions de code et les discussions techniques.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
ローカルデプロイでも実務は甘くないよな。単なるチャットボットじゃダメで、複雑なルール解釈やセキュリティ制約、外部ツール連携までこなせるのが真のAIだ。BailingとARenoの取り組みは的を得ていると思う。











