Maison
GLM-5.3 publié par Zhipu : 740 milliards de paramètres inchangés, performance améliorée de 50 % grâce à des approches de programmation post-entraînement
Zhipu a officiellement lancé GLM-5.3 le 14 août, conservant le compte de 74 milliards de paramètres de son prédécesseur, GLM-5.2, tout en sautant la mise à jour supposée à un billion de paramètres, qui pourrait être réservée à GLM-5.5. Grâce à des techniques avancées de post-entraînement, Zhipu a amélioré les performances de GLM-5.3 de 50 % par rapport à la génération précédente, lui assurant les meilleurs classements parmi les modèles open-source actuels sur plusieurs benchmarks grand public. Ses capacités de codage et d'agent rivalisent avec Claude Opus 4.8, dépassant les autres modèles nationaux en efficacité de programmation.
Les améliorations clés des benchmarks mettent en évidence les capacités accrues du modèle. Sur Terminal-Bench 3.0, qui évalue l'accomplissement de tâches complexes dans des environnements terminal réels, le score est passé de 4,6 à 28,3. Dans DeepSWE v1.1, axé sur l'ingénierie logicielle à long terme et la modification continue du code, les performances sont passées de 46,2 à 66,9. Sur Agents’ Last Exam, couvrant divers scénarios professionnels avec un accent sur la collaboration inter-outils et les tâches à long terme, le score est passé de 23,8 à 28,5. De plus, GLM-5.3 a obtenu 1 769 points dans GDPval-AA v2, qui couvre 44 professions et évalue le travail de haute valeur ajoutée, démontrant une forte exécution de tâches professionnelles fondée sur des compétences en programmation. Dans l'ensemble, le modèle montre des avancées significatives dans l'ingénierie logicielle complexe, les opérations terminal et les tâches d'agent plus larges dans le monde réel.

La preuve la plus convaincante provient du Z.ai Code Bench propriétaire de Zhipu, une suite d'évaluation qui place le modèle dans un environnement de développement local réel pour exécuter des tâches de bout en bout selon divers modes de raisonnement, simulant de près l'expérience d'utilisation d'un Agent de Codage. Les résultats indiquent que GLM-5.3 atteint un équilibre optimal entre efficacité et efficacité des tokens : en mode High, il a atteint un taux de précision de 31,4 %, dépassant le mode maximum de Claude Opus 4.8 (29,5 %), tout en utilisant seulement environ 50 000 tokens par tâche en moyenne, comparé aux 120 000 tokens d'Opus 4.8. Cela démontre que GLM-5.3 peut accomplir des tâches identiques avec un chemin d'exécution nettement plus court.

En ce qui concerne la disponibilité du produit, GLM-5.3 est désormais accessible sur l'outil de codage officiel de Zhipu, ZCode, et sur l'outil de productivité AutoClaw, et est ouvert à tous les utilisateurs et abonnés du plan GLM Coding. Les plateformes de codage tierces, y compris TraeWork, TraeCode, Kousi, WorkBuddy, CodeBuddy, Qoder, QwenWork, CatPaw, JoyCode et OpenCode, ont également accordé un accès anticipé. L'API sera bientôt lancée, et les poids complets du modèle seront open-sourcés dans un délai de deux semaines suivant les améliorations de sécurité nécessaires. La stratégie de Zhipu consiste à limiter les capacités d'attaque potentielles du modèle tout en préservant sa valeur défensive. À 13h00 aujourd'hui, les quotas pour tous les utilisateurs du plan GLM Coding ont été réinitialisés, et les statistiques d'utilisation dans le backend reflètent désormais des limites restaurées pour tout le monde.
Article connexe
Tesollo lance une introduction en bourse dans le cadre du développement d’une main humanoïde
Tesello conçoit des mains robotiques à haut degré de liberté compatibles avec toutes les plateformes humanoïdes. | Crédit : TesolloL’innovant dans le domaine des mains robotiques, Tesollo Inc., a officiellement lancé les préparatifs d’une introductio
Prentis, nouveau laboratoire d’IA cofondé par Reid Hoffman et Mark Pincus, en pourparlers pour lever 100 millions de dollars
Prentis, un laboratoire de recherche en intelligence artificielle émergent spécialisé dans les modèles d’utilisation des ordinateurs et cofondé par l’entrepreneur à succès Ritankar Das aux côtés de vétérans de l’industrie technologique Reid Hoffman e
AIR lève 50 millions de dollars pour aider les entreprises à vérifier les compétences et les modules complémentaires utilisés par les agents d’IA
À mesure que les organisations accordent de plus en plus d’accès aux agents d’IA à leurs systèmes internes, une nouvelle chaîne d’approvisionnement logicielle émerge autour des outils sur lesquels ces agents s’appuient : compétences, plugins, serveur
Recommandations de sujets spéciaux liés
commentaires (0)
Zhipu a officiellement lancé GLM-5.3 le 14 août, conservant le compte de 74 milliards de paramètres de son prédécesseur, GLM-5.2, tout en sautant la mise à jour supposée à un billion de paramètres, qui pourrait être réservée à GLM-5.5. Grâce à des techniques avancées de post-entraînement, Zhipu a amélioré les performances de GLM-5.3 de 50 % par rapport à la génération précédente, lui assurant les meilleurs classements parmi les modèles open-source actuels sur plusieurs benchmarks grand public. Ses capacités de codage et d'agent rivalisent avec Claude Opus 4.8, dépassant les autres modèles nationaux en efficacité de programmation.
Les améliorations clés des benchmarks mettent en évidence les capacités accrues du modèle. Sur Terminal-Bench 3.0, qui évalue l'accomplissement de tâches complexes dans des environnements terminal réels, le score est passé de 4,6 à 28,3. Dans DeepSWE v1.1, axé sur l'ingénierie logicielle à long terme et la modification continue du code, les performances sont passées de 46,2 à 66,9. Sur Agents’ Last Exam, couvrant divers scénarios professionnels avec un accent sur la collaboration inter-outils et les tâches à long terme, le score est passé de 23,8 à 28,5. De plus, GLM-5.3 a obtenu 1 769 points dans GDPval-AA v2, qui couvre 44 professions et évalue le travail de haute valeur ajoutée, démontrant une forte exécution de tâches professionnelles fondée sur des compétences en programmation. Dans l'ensemble, le modèle montre des avancées significatives dans l'ingénierie logicielle complexe, les opérations terminal et les tâches d'agent plus larges dans le monde réel.

La preuve la plus convaincante provient du Z.ai Code Bench propriétaire de Zhipu, une suite d'évaluation qui place le modèle dans un environnement de développement local réel pour exécuter des tâches de bout en bout selon divers modes de raisonnement, simulant de près l'expérience d'utilisation d'un Agent de Codage. Les résultats indiquent que GLM-5.3 atteint un équilibre optimal entre efficacité et efficacité des tokens : en mode High, il a atteint un taux de précision de 31,4 %, dépassant le mode maximum de Claude Opus 4.8 (29,5 %), tout en utilisant seulement environ 50 000 tokens par tâche en moyenne, comparé aux 120 000 tokens d'Opus 4.8. Cela démontre que GLM-5.3 peut accomplir des tâches identiques avec un chemin d'exécution nettement plus court.

En ce qui concerne la disponibilité du produit, GLM-5.3 est désormais accessible sur l'outil de codage officiel de Zhipu, ZCode, et sur l'outil de productivité AutoClaw, et est ouvert à tous les utilisateurs et abonnés du plan GLM Coding. Les plateformes de codage tierces, y compris TraeWork, TraeCode, Kousi, WorkBuddy, CodeBuddy, Qoder, QwenWork, CatPaw, JoyCode et OpenCode, ont également accordé un accès anticipé. L'API sera bientôt lancée, et les poids complets du modèle seront open-sourcés dans un délai de deux semaines suivant les améliorations de sécurité nécessaires. La stratégie de Zhipu consiste à limiter les capacités d'attaque potentielles du modèle tout en préservant sa valeur défensive. À 13h00 aujourd'hui, les quotas pour tous les utilisateurs du plan GLM Coding ont été réinitialisés, et les statistiques d'utilisation dans le backend reflètent désormais des limites restaurées pour tout le monde.
Tesollo lance une introduction en bourse dans le cadre du développement d’une main humanoïde
Tesello conçoit des mains robotiques à haut degré de liberté compatibles avec toutes les plateformes humanoïdes. | Crédit : TesolloL’innovant dans le domaine des mains robotiques, Tesollo Inc., a officiellement lancé les préparatifs d’une introductio
Prentis, nouveau laboratoire d’IA cofondé par Reid Hoffman et Mark Pincus, en pourparlers pour lever 100 millions de dollars
Prentis, un laboratoire de recherche en intelligence artificielle émergent spécialisé dans les modèles d’utilisation des ordinateurs et cofondé par l’entrepreneur à succès Ritankar Das aux côtés de vétérans de l’industrie technologique Reid Hoffman e
AIR lève 50 millions de dollars pour aider les entreprises à vérifier les compétences et les modules complémentaires utilisés par les agents d’IA
À mesure que les organisations accordent de plus en plus d’accès aux agents d’IA à leurs systèmes internes, une nouvelle chaîne d’approvisionnement logicielle émerge autour des outils sur lesquels ces agents s’appuient : compétences, plugins, serveur











