Maison
AReaL 2.0 Open Source : infrastructure d'apprentissage par renforcement pour des agents auto-évolutifs grâce à l'utilisation
Le 2 juillet, le projet AReaL, une infrastructure open source dédiée à l'apprentissage par renforcement, a officiellement lancé sa version 2.0. AReaL est conçu pour combler le fossé entre l'entraînement des modèles fondamentaux et les applications modernes basées sur des agents, en offrant un soutien efficace à l'entraînement par renforcement pour les scénarios impliquant des agents.
La nouvelle version AReaL 2.0 cible les agents opérant dans des environnements professionnels réels, en fournissant une infrastructure système qui permet un apprentissage continu pendant que les agents sont en service. Grâce à AReaL 2.0, les processus d’interaction générés par les agents lorsqu’ils accomplissent des tâches réelles peuvent être enregistrés, organisés et intégrés dans les cycles d’entraînement suivants. Ces processus servent à affiner en continu les modèles sous-jacents, ce qui permet aux agents de gagner en efficacité tout en restant sûrs et contrôlables.
Actuellement, les agents font leur entrée dans de véritables environnements de production : ils écrivent du code, recherchent des informations et font appel à des outils pour accomplir des tâches de plus en plus complexes au sein des systèmes d’entreprise. Cependant, un problème est apparu : les agents travaillent quotidiennement, mais tirent rarement parti de leurs expériences pour progresser.
Dans des scénarios professionnels réels, les agents génèrent une grande quantité d’expériences précieuses : quelles tâches ont été bien exécutées, où les appels d’outils ont échoué, pourquoi les utilisateurs étaient insatisfaits et si une certaine décision s’est avérée erronée. Pourtant, ces informations sont principalement stockées dans des journaux, ce qui rend difficile leur transformation, de manière stable et sécurisée, en une nouvelle étape d’amélioration des capacités.
AReaL 2.0 vise à résoudre le problème de la poursuite du développement des agents après leur déploiement. Les développeurs n’ont pas besoin de redévelopper les agents ; il leur suffit d’acheminer les requêtes que les agents envoient normalement à de grands modèles via le point de terminaison d’inférence unifié d’AReaL 2.0 pour les intégrer au processus d’apprentissage par renforcement en ligne.

Figure : Schéma de l’architecture d’apprentissage par renforcement en ligne (Online RL) d’AReaL 2.0
Prenons l’exemple de l’agent Hermes. Hermes continue de recevoir des tâches, de planifier des actions et d’appeler des modèles comme d’habitude. AReaL 2.0 enregistre les principaux processus d’interaction lorsque Hermes accomplit ses tâches en arrière-plan et utilise ces trajectoires réelles, combinées aux signaux de rétroaction ou de récompense après l’achèvement des tâches, pour l’entraînement ultérieur. Les développeurs peuvent également remplacer Hermes par leur propre agent et leur propre environnement de tâches, en utilisant la même approche pour mettre en place un processus d’apprentissage par renforcement en ligne pour les agents.
Cela signifie que l’amélioration des capacités d’un agent ne repose plus uniquement sur des données construites manuellement, un apprentissage hors ligne et un redéploiement. Les conversations à plusieurs tours, les appels d’outils, les résultats d’exécution et les signaux de retour d’expérience issus de tâches réelles peuvent tous devenir des données d’apprentissage pour les modèles.
Ce point est particulièrement important dans les scénarios d’entreprise. Les agents intégrés aux flux de travail d’entreprise sont confrontés à des tâches réelles, complexes et en constante évolution : les dépôts de code peuvent être mis à jour, les processus métier peuvent changer, les besoins des utilisateurs peuvent évoluer, et les outils et systèmes peuvent également changer. Si les capacités d’un agent sont figées une fois celui-ci déployé, il aura du mal à s’adapter à l’environnement réel au fil du temps. AReaL 2.0 vise à combler le chaînon manquant entre « être capable d’utiliser des outils » et « être capable d’apprendre à partir de cette utilisation ».
Parallèlement, l’apprentissage continu dans des scénarios métier réels ne peut se limiter à une simple « collecte de données et à un réentraînement ». Les agents pouvant accéder au code, aux informations clients, aux bases de connaissances de l’entreprise et aux systèmes internes, le pipeline de formation doit prendre en compte des exigences telles que le contrôle d’accès, l’anonymisation des données, l’isolation et l’audit. AReaL 2.0 intègre dans la conception de son système un mécanisme de proxy de données pour les traces des agents, ce qui permet de gérer et d’utiliser les données de tâches réelles de manière plus sécurisée et contrôlable lorsqu’elles sont intégrées au processus d’entraînement.
L’équipe AReaL a souligné dans son rapport technique que le principal goulot d’étranglement pour les agents auto-évolutifs ne réside pas seulement dans la puissance du modèle ou dans le caractère avancé de l’algorithme d’apprentissage par renforcement, mais dans l’absence d’une infrastructure d’apprentissage par renforcement en ligne au service d’agents réels. AReaL 2.0 est une mise à niveau architecturale destinée à la prochaine génération d’applications d’agents : elle relie les services d’agents, les traces de tâches réelles, la gouvernance des données et l’entraînement par apprentissage par renforcement en ligne, offrant ainsi aux agents les fondements techniques pratiques nécessaires pour continuer à apprendre après leur déploiement.
Dans une perspective à plus long terme, AReaL 2.0 met en avant le paradigme d’évolution de la prochaine génération d’applications d’agents : les agents ne sont plus des outils formés et déployés une seule fois, mais acquièrent en continu des retours d’expérience dans des environnements réels, transformant à la fois leurs succès et leurs échecs en expérience, et améliorant sans cesse leurs capacités dans un cadre sécurisé.
Le projet AReaL a été lancé en 2024 par des équipes comprenant notamment Ant Group, l’université Tsinghua et l’université des sciences et technologies de Hong Kong. En mai 2026, AReaL a officiellement quitté le programme d’incubation Ant InclusionAI pour devenir une communauté open source indépendante, rejoignant le projet « PyTorch Foundation Ecosystem » et s’intégrant ainsi davantage à l’écosystème dominant des infrastructures d’apprentissage par renforcement.
À mesure que la communauté se développe de manière indépendante, AReaL continue de bénéficier de la participation et du soutien de partenaires industriels et de l’écosystème open source, notamment l’équipe Huawei Cloud et MindLab. À l’avenir, AReaL continuera à se développer dans des domaines tels que l’apprentissage par renforcement en ligne, l’évaluation automatisée et la formation d’agents multimodaux, en collaborant avec la communauté pour faire progresser le développement d’écosystèmes d’agents auto-évolutifs.
À l’heure actuelle, le rapport technique et le code d’AReaL 2.0 ont été mis en open source.
· Dépôt GitHub : https://github.com/areal-project/AReaL
· Rapport technique : https://arxiv.org/abs/2607.01120
Article connexe
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
Recommandations de sujets spéciaux liés
commentaires (0)
Le 2 juillet, le projet AReaL, une infrastructure open source dédiée à l'apprentissage par renforcement, a officiellement lancé sa version 2.0. AReaL est conçu pour combler le fossé entre l'entraînement des modèles fondamentaux et les applications modernes basées sur des agents, en offrant un soutien efficace à l'entraînement par renforcement pour les scénarios impliquant des agents.
La nouvelle version AReaL 2.0 cible les agents opérant dans des environnements professionnels réels, en fournissant une infrastructure système qui permet un apprentissage continu pendant que les agents sont en service. Grâce à AReaL 2.0, les processus d’interaction générés par les agents lorsqu’ils accomplissent des tâches réelles peuvent être enregistrés, organisés et intégrés dans les cycles d’entraînement suivants. Ces processus servent à affiner en continu les modèles sous-jacents, ce qui permet aux agents de gagner en efficacité tout en restant sûrs et contrôlables.
Actuellement, les agents font leur entrée dans de véritables environnements de production : ils écrivent du code, recherchent des informations et font appel à des outils pour accomplir des tâches de plus en plus complexes au sein des systèmes d’entreprise. Cependant, un problème est apparu : les agents travaillent quotidiennement, mais tirent rarement parti de leurs expériences pour progresser.
Dans des scénarios professionnels réels, les agents génèrent une grande quantité d’expériences précieuses : quelles tâches ont été bien exécutées, où les appels d’outils ont échoué, pourquoi les utilisateurs étaient insatisfaits et si une certaine décision s’est avérée erronée. Pourtant, ces informations sont principalement stockées dans des journaux, ce qui rend difficile leur transformation, de manière stable et sécurisée, en une nouvelle étape d’amélioration des capacités.
AReaL 2.0 vise à résoudre le problème de la poursuite du développement des agents après leur déploiement. Les développeurs n’ont pas besoin de redévelopper les agents ; il leur suffit d’acheminer les requêtes que les agents envoient normalement à de grands modèles via le point de terminaison d’inférence unifié d’AReaL 2.0 pour les intégrer au processus d’apprentissage par renforcement en ligne.

Figure : Schéma de l’architecture d’apprentissage par renforcement en ligne (Online RL) d’AReaL 2.0
Prenons l’exemple de l’agent Hermes. Hermes continue de recevoir des tâches, de planifier des actions et d’appeler des modèles comme d’habitude. AReaL 2.0 enregistre les principaux processus d’interaction lorsque Hermes accomplit ses tâches en arrière-plan et utilise ces trajectoires réelles, combinées aux signaux de rétroaction ou de récompense après l’achèvement des tâches, pour l’entraînement ultérieur. Les développeurs peuvent également remplacer Hermes par leur propre agent et leur propre environnement de tâches, en utilisant la même approche pour mettre en place un processus d’apprentissage par renforcement en ligne pour les agents.
Cela signifie que l’amélioration des capacités d’un agent ne repose plus uniquement sur des données construites manuellement, un apprentissage hors ligne et un redéploiement. Les conversations à plusieurs tours, les appels d’outils, les résultats d’exécution et les signaux de retour d’expérience issus de tâches réelles peuvent tous devenir des données d’apprentissage pour les modèles.
Ce point est particulièrement important dans les scénarios d’entreprise. Les agents intégrés aux flux de travail d’entreprise sont confrontés à des tâches réelles, complexes et en constante évolution : les dépôts de code peuvent être mis à jour, les processus métier peuvent changer, les besoins des utilisateurs peuvent évoluer, et les outils et systèmes peuvent également changer. Si les capacités d’un agent sont figées une fois celui-ci déployé, il aura du mal à s’adapter à l’environnement réel au fil du temps. AReaL 2.0 vise à combler le chaînon manquant entre « être capable d’utiliser des outils » et « être capable d’apprendre à partir de cette utilisation ».
Parallèlement, l’apprentissage continu dans des scénarios métier réels ne peut se limiter à une simple « collecte de données et à un réentraînement ». Les agents pouvant accéder au code, aux informations clients, aux bases de connaissances de l’entreprise et aux systèmes internes, le pipeline de formation doit prendre en compte des exigences telles que le contrôle d’accès, l’anonymisation des données, l’isolation et l’audit. AReaL 2.0 intègre dans la conception de son système un mécanisme de proxy de données pour les traces des agents, ce qui permet de gérer et d’utiliser les données de tâches réelles de manière plus sécurisée et contrôlable lorsqu’elles sont intégrées au processus d’entraînement.
L’équipe AReaL a souligné dans son rapport technique que le principal goulot d’étranglement pour les agents auto-évolutifs ne réside pas seulement dans la puissance du modèle ou dans le caractère avancé de l’algorithme d’apprentissage par renforcement, mais dans l’absence d’une infrastructure d’apprentissage par renforcement en ligne au service d’agents réels. AReaL 2.0 est une mise à niveau architecturale destinée à la prochaine génération d’applications d’agents : elle relie les services d’agents, les traces de tâches réelles, la gouvernance des données et l’entraînement par apprentissage par renforcement en ligne, offrant ainsi aux agents les fondements techniques pratiques nécessaires pour continuer à apprendre après leur déploiement.
Dans une perspective à plus long terme, AReaL 2.0 met en avant le paradigme d’évolution de la prochaine génération d’applications d’agents : les agents ne sont plus des outils formés et déployés une seule fois, mais acquièrent en continu des retours d’expérience dans des environnements réels, transformant à la fois leurs succès et leurs échecs en expérience, et améliorant sans cesse leurs capacités dans un cadre sécurisé.
Le projet AReaL a été lancé en 2024 par des équipes comprenant notamment Ant Group, l’université Tsinghua et l’université des sciences et technologies de Hong Kong. En mai 2026, AReaL a officiellement quitté le programme d’incubation Ant InclusionAI pour devenir une communauté open source indépendante, rejoignant le projet « PyTorch Foundation Ecosystem » et s’intégrant ainsi davantage à l’écosystème dominant des infrastructures d’apprentissage par renforcement.
À mesure que la communauté se développe de manière indépendante, AReaL continue de bénéficier de la participation et du soutien de partenaires industriels et de l’écosystème open source, notamment l’équipe Huawei Cloud et MindLab. À l’avenir, AReaL continuera à se développer dans des domaines tels que l’apprentissage par renforcement en ligne, l’évaluation automatisée et la formation d’agents multimodaux, en collaborant avec la communauté pour faire progresser le développement d’écosystèmes d’agents auto-évolutifs.
À l’heure actuelle, le rapport technique et le code d’AReaL 2.0 ont été mis en open source.
· Dépôt GitHub : https://github.com/areal-project/AReaL
· Rapport technique : https://arxiv.org/abs/2607.01120
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte











