Maison
Microsoft dévoile un outil permettant aux développeurs de créer des tests de comportement d'IA à partir de descriptions textuelles
Les chercheurs et les laboratoires spécialisés dans l’IA ont réalisé des progrès significatifs dans l’évaluation des modèles d’IA en matière de sécurité, de conformité, de flagornerie et d’alignement. Cependant, les entreprises et les développeurs sont désormais confrontés à un défi spécifique : s’assurer que leurs systèmes d’IA se comportent exactement comme prévu pour leur produit ou service particulier.
Pour simplifier ce processus de test, Microsoft a dévoilé mardi ASSERT, acronyme de « Adaptive Spec-driven Scoring for Evaluation and Regression Testing » (notation adaptative basée sur les spécifications pour les tests d’évaluation et de régression).
Selon Microsoft, ce framework open source facilite l’évaluation du comportement d’une IA spécifique à une application. Il utilise l’IA pour convertir des descriptions de haut niveau, rédigées en langage naturel, d’objectifs, de politiques ou de comportements attendus en tests complets et notés pouvant être examinés.
ASSERT accepte des descriptions en langage clair du comportement et des politiques attendus d’un modèle d’IA, puis les transforme en un ensemble structuré de comportements acceptables et inacceptables. Il génère des scénarios de problèmes et des cas de test, les exécute sur le système cible et attribue une note aux résultats. Le framework enregistre également les chemins empruntés par le système d’IA, y compris les actions intermédiaires et les appels d’outils, ce qui permet aux développeurs d’identifier où se produisent les défaillances.
Les développeurs peuvent également fournir le contexte du système, les outils et les contraintes afin de personnaliser davantage la portée des évaluations.
Par exemple, un développeur pourrait spécifier qu’un agent IA dédié à la recherche documentaire ne doit pas envoyer d’e-mails à des personnes extérieures à l’entreprise, doit limiter l’accès aux informations confidentielles aux cadres dirigeants et doit fournir des résumés concis tout en tenant compte du contexte antérieur. ASSERT utilise ensuite ces règles pour générer des cas de test qui vérifient en continu si le système les respecte.

Crédits image :Microsoft
Selon Microsoft, ce cadre comble une lacune que les évaluations plus larges et plus générales ne peuvent pas combler lorsque les modèles d’IA sont destinés à se comporter selon des modalités déterminées par le contexte, les politiques et les outils d’une application ou d’un produit.
« L’une des leçons que nous avons tirées est que les évaluations sont absolument essentielles pour prendre de bonnes décisions », a déclaré Sarah Bird, directrice des produits pour l’IA responsable chez Microsoft. « Car si vous ne comprenez pas le comportement du système d’IA, il est très difficile de savoir s’il répond aux exigences de votre organisation […] Nous avons constaté que si vous voulez vraiment un système fiable, vous devez évaluer un nombre bien plus important de dimensions spécifiques à l’application. »
Mme Bird a précisé qu’ASSERT peut être utilisé pour évaluer les systèmes pendant leur développement, après leur déploiement, ainsi que pour une surveillance continue.
Ce lancement intervient dans un contexte d’évolution progressive mais de plus en plus marquée du secteur de l’IA. À mesure que les modèles gagnent en performances, les chercheurs se concentrent sur les tests reproductibles et les contrôles de régression. HELM de Stanford, AILuminate de MLCommons et des groupes d’évaluation tels que METR déploient actuellement des benchmarks pour mesurer le comportement des modèles dans différentes conditions.
Article connexe
Microsoft met fin à ses outils d'IA ayant échoué et consolide les applications Copilot
Il y a deux ans, Microsoft qualifiait l’intelligence artificielle de « changement générationnel » dans le domaine technologique, qu’elle s’efforçait de diriger. Aujourd’hui, l’entreprise consolide ses applications grand public et professionnelles sou
Microsoft formerait ses commerciaux à sous-enchérir ses concurrents OpenAI et Anthropic
Microsoft s’apprêterait à renforcer son service commercial afin d’intensifier la concurrence contre ses principaux rivaux dans le secteur de l’intelligence artificielle.Selon un rapport de Bloomberg, des dirigeants ont tenu une session stratégique i
Cela pourrait-il marquer le début d’une crise pour les économies de jetons ?
Microsoft a récemment procédé à d’importantes modifications des tarifs de GitHub Copilot, des changements si significatifs qu’un utilisateur de Reddit a qualifié la situation au sein de son entreprise de « Tokenpocalypse ».Dans le dernier épisode du
Recommandations de sujets spéciaux liés
commentaires (0)
Les chercheurs et les laboratoires spécialisés dans l’IA ont réalisé des progrès significatifs dans l’évaluation des modèles d’IA en matière de sécurité, de conformité, de flagornerie et d’alignement. Cependant, les entreprises et les développeurs sont désormais confrontés à un défi spécifique : s’assurer que leurs systèmes d’IA se comportent exactement comme prévu pour leur produit ou service particulier.
Pour simplifier ce processus de test, Microsoft a dévoilé mardi ASSERT, acronyme de « Adaptive Spec-driven Scoring for Evaluation and Regression Testing » (notation adaptative basée sur les spécifications pour les tests d’évaluation et de régression).
Selon Microsoft, ce framework open source facilite l’évaluation du comportement d’une IA spécifique à une application. Il utilise l’IA pour convertir des descriptions de haut niveau, rédigées en langage naturel, d’objectifs, de politiques ou de comportements attendus en tests complets et notés pouvant être examinés.
ASSERT accepte des descriptions en langage clair du comportement et des politiques attendus d’un modèle d’IA, puis les transforme en un ensemble structuré de comportements acceptables et inacceptables. Il génère des scénarios de problèmes et des cas de test, les exécute sur le système cible et attribue une note aux résultats. Le framework enregistre également les chemins empruntés par le système d’IA, y compris les actions intermédiaires et les appels d’outils, ce qui permet aux développeurs d’identifier où se produisent les défaillances.
Les développeurs peuvent également fournir le contexte du système, les outils et les contraintes afin de personnaliser davantage la portée des évaluations.
Par exemple, un développeur pourrait spécifier qu’un agent IA dédié à la recherche documentaire ne doit pas envoyer d’e-mails à des personnes extérieures à l’entreprise, doit limiter l’accès aux informations confidentielles aux cadres dirigeants et doit fournir des résumés concis tout en tenant compte du contexte antérieur. ASSERT utilise ensuite ces règles pour générer des cas de test qui vérifient en continu si le système les respecte.

Crédits image :Microsoft
Selon Microsoft, ce cadre comble une lacune que les évaluations plus larges et plus générales ne peuvent pas combler lorsque les modèles d’IA sont destinés à se comporter selon des modalités déterminées par le contexte, les politiques et les outils d’une application ou d’un produit.
« L’une des leçons que nous avons tirées est que les évaluations sont absolument essentielles pour prendre de bonnes décisions », a déclaré Sarah Bird, directrice des produits pour l’IA responsable chez Microsoft. « Car si vous ne comprenez pas le comportement du système d’IA, il est très difficile de savoir s’il répond aux exigences de votre organisation […] Nous avons constaté que si vous voulez vraiment un système fiable, vous devez évaluer un nombre bien plus important de dimensions spécifiques à l’application. »
Mme Bird a précisé qu’ASSERT peut être utilisé pour évaluer les systèmes pendant leur développement, après leur déploiement, ainsi que pour une surveillance continue.
Ce lancement intervient dans un contexte d’évolution progressive mais de plus en plus marquée du secteur de l’IA. À mesure que les modèles gagnent en performances, les chercheurs se concentrent sur les tests reproductibles et les contrôles de régression. HELM de Stanford, AILuminate de MLCommons et des groupes d’évaluation tels que METR déploient actuellement des benchmarks pour mesurer le comportement des modèles dans différentes conditions.
Microsoft met fin à ses outils d'IA ayant échoué et consolide les applications Copilot
Il y a deux ans, Microsoft qualifiait l’intelligence artificielle de « changement générationnel » dans le domaine technologique, qu’elle s’efforçait de diriger. Aujourd’hui, l’entreprise consolide ses applications grand public et professionnelles sou
Microsoft formerait ses commerciaux à sous-enchérir ses concurrents OpenAI et Anthropic
Microsoft s’apprêterait à renforcer son service commercial afin d’intensifier la concurrence contre ses principaux rivaux dans le secteur de l’intelligence artificielle.Selon un rapport de Bloomberg, des dirigeants ont tenu une session stratégique i
Cela pourrait-il marquer le début d’une crise pour les économies de jetons ?
Microsoft a récemment procédé à d’importantes modifications des tarifs de GitHub Copilot, des changements si significatifs qu’un utilisateur de Reddit a qualifié la situation au sein de son entreprise de « Tokenpocalypse ».Dans le dernier épisode du











