Maison
Tongyi Lab dévoile son algorithme FIPO : les performances d'inférence du modèle de 32 milliards de paramètres surpassent celles d'o1-mini

L'équipe « Intelligent Computing » du Tongyi Lab a dévoilé aujourd'hui un nouvel algorithme de post-entraînement destiné aux grands modèles linguistiques : le FIPO (Future-KL Influenced Policy Optimization). Cet algorithme introduit un mécanisme novateur appelé « Future-KL » qui résout efficacement le problème technique courant de la « stagnation de la longueur d’inférence » dans l’apprentissage par renforcement pur (Pure RL).
Lors de l’entraînement au raisonnement sur des textes longs et à l’alignement logique complexe, l’apprentissage par renforcement traditionnel ne parvient souvent pas à identifier avec précision les points de décision clés dans des séquences étendues. L’algorithme FIPO, développé par l’équipe de Tongyi, applique une répartition différenciée des récompenses aux tokens clés, encourageant ainsi le modèle à adopter une approche plus prospective lors de la génération de la chaîne de pensée (CoT).
Les résultats expérimentaux indiquent que, dans un cadre d’apprentissage par renforcement pur avec un modèle de l’ordre de 32 milliards de paramètres, le modèle utilisant l’algorithme FIPO a déjà surpassé des modèles de taille similaire tels que DeepSeek-Zero-MATH et o1-mini d’OpenAI, ce qui représente une avancée significative dans les capacités de raisonnement logique et de calcul mathématique des grands modèles nationaux.
Actuellement, la concurrence entre les grands modèles passe de l’échelle de pré-entraînement à l’alignement profond au moment de l’inférence. La publication de FIPO offre non seulement une nouvelle façon d’évaluer la qualité des « processus de réflexion » dans les modèles de raisonnement logique, mais elle signale également que la communauté open source et les principaux laboratoires nationaux tracent progressivement une voie technologique indépendante dans leur quête de modèles de raisonnement de classe mondiale.
Article connexe
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
Recommandations de sujets spéciaux liés
commentaires (0)

L'équipe « Intelligent Computing » du Tongyi Lab a dévoilé aujourd'hui un nouvel algorithme de post-entraînement destiné aux grands modèles linguistiques : le FIPO (Future-KL Influenced Policy Optimization). Cet algorithme introduit un mécanisme novateur appelé « Future-KL » qui résout efficacement le problème technique courant de la « stagnation de la longueur d’inférence » dans l’apprentissage par renforcement pur (Pure RL).
Lors de l’entraînement au raisonnement sur des textes longs et à l’alignement logique complexe, l’apprentissage par renforcement traditionnel ne parvient souvent pas à identifier avec précision les points de décision clés dans des séquences étendues. L’algorithme FIPO, développé par l’équipe de Tongyi, applique une répartition différenciée des récompenses aux tokens clés, encourageant ainsi le modèle à adopter une approche plus prospective lors de la génération de la chaîne de pensée (CoT).
Les résultats expérimentaux indiquent que, dans un cadre d’apprentissage par renforcement pur avec un modèle de l’ordre de 32 milliards de paramètres, le modèle utilisant l’algorithme FIPO a déjà surpassé des modèles de taille similaire tels que DeepSeek-Zero-MATH et o1-mini d’OpenAI, ce qui représente une avancée significative dans les capacités de raisonnement logique et de calcul mathématique des grands modèles nationaux.
Actuellement, la concurrence entre les grands modèles passe de l’échelle de pré-entraînement à l’alignement profond au moment de l’inférence. La publication de FIPO offre non seulement une nouvelle façon d’évaluer la qualité des « processus de réflexion » dans les modèles de raisonnement logique, mais elle signale également que la communauté open source et les principaux laboratoires nationaux tracent progressivement une voie technologique indépendante dans leur quête de modèles de raisonnement de classe mondiale.
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à











