Zhipu lance le modèle de codage multimodal GLM-5V-Turbo
Le 2 avril, Zhipu a officiellement lancé le GLM-5V-Turbo, un modèle de base multimodal conçu pour la programmation visuelle. Il ne se contente pas d’écrire du code : il est également capable de « comprendre » le monde, élargissant ainsi la perception des agents IA du simple texte aux esquisses de conception complexes et aux interfaces web.

Principales avancées : voir des images, écrire du code
En tant que modèle de base de codage multimodal natif, GLM-5V-Turbo intègre profondément les capacités visuelles et de programmation :
Perception multidimensionnelle : il comprend nativement les images, les vidéos, les esquisses de conception et les mises en page complexes de documents, tout en prenant en charge des outils visuels tels que les cadres, les captures d’écran et la lecture de pages web.
Vision étendue : grâce à une fenêtre contextuelle étendue à 200 000 caractères, il gère sans effort les grands projets d’ingénierie ou les longs documents techniques.
Performances de pointe : dans les benchmarks clés tels que le codage multimodal et GUI Agent, ce modèle surpasse les produits similaires malgré une taille réduite.

Scénarios types : de l’esquisse au produit final en quelques secondes
Avec GLM-5V-Turbo, les développeurs bénéficient d’un flux de travail sans précédent :
Réplication du front-end : il suffit d’envoyer une capture d’écran ou un enregistrement d’écran d’une ébauche de conception — le modèle saisit la mise en page, la palette de couleurs et la logique d’interaction, puis génère un projet front-end directement exécutable.
Exploration autonome de l’interface graphique : associé à des frameworks tels que Claude Code, il parcourt les sites web, démêle les structures de navigation et rassemble des éléments à la manière d’un humain, permettant ainsi une réplication visuelle complète du site.
Édition interactive : prend en charge l’ajout, la suppression ou la modification de modules, de styles ou de mises en page par le biais d’une conversation, permettant ainsi l’itération visuelle du code.
Renforcer les capacités de « Lobster » : AutoClaw bénéficie d’une mise à niveau visuelle
Après l’intégration de ce modèle à AutoClaw (Lobster), l’agent développé en interne par Zhipu, le « lobster » — auparavant limité au texte — acquiert désormais de véritables capacités visuelles. Par exemple, il peut directement comprendre les graphiques en courbe K, interpréter des graphiques complexes dans des rapports financiers et effectuer une collecte de données multicanal en moins de 60 secondes, en produisant des rapports d’analyse professionnels comprenant à la fois du texte et des images.
Aperçu du secteur : la programmation n’est plus une boîte noire
Avec la sortie de GLM-5V-Turbo, Zhipu
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
Le 2 avril,

Principales avancées : voir des images, écrire du code
En tant que modèle de base de codage multimodal natif, GLM-5V-Turbo intègre profondément les capacités visuelles et de programmation :
Perception multidimensionnelle : il comprend nativement les images, les vidéos, les esquisses de conception et les mises en page complexes de documents, tout en prenant en charge des outils visuels tels que les cadres, les captures d’écran et la lecture de pages web.
Vision étendue : grâce à une fenêtre contextuelle étendue à 200 000 caractères, il gère sans effort les grands projets d’ingénierie ou les longs documents techniques.
Performances de pointe : dans les benchmarks clés tels que le codage multimodal et GUI Agent, ce modèle surpasse les produits similaires malgré une taille réduite.

Scénarios types : de l’esquisse au produit final en quelques secondes
Avec GLM-5V-Turbo, les développeurs bénéficient d’un flux de travail sans précédent :
Réplication du front-end : il suffit d’envoyer une capture d’écran ou un enregistrement d’écran d’une ébauche de conception — le modèle saisit la mise en page, la palette de couleurs et la logique d’interaction, puis génère un projet front-end directement exécutable.
Exploration autonome de l’interface graphique : associé à des frameworks tels que Claude Code, il parcourt les sites web, démêle les structures de navigation et rassemble des éléments à la manière d’un humain, permettant ainsi une réplication visuelle complète du site.
Édition interactive : prend en charge l’ajout, la suppression ou la modification de modules, de styles ou de mises en page par le biais d’une conversation, permettant ainsi l’itération visuelle du code.
Renforcer les capacités de « Lobster » : AutoClaw bénéficie d’une mise à niveau visuelle
Après l’intégration de ce modèle à AutoClaw (Lobster), l’agent développé en interne par Zhipu, le « lobster » — auparavant limité au texte — acquiert désormais de véritables capacités visuelles. Par exemple, il peut directement comprendre les graphiques en courbe K, interpréter des graphiques complexes dans des rapports financiers et effectuer une collecte de données multicanal en moins de 60 secondes, en produisant des rapports d’analyse professionnels comprenant à la fois du texte et des images.
Aperçu du secteur : la programmation n’est plus une boîte noire
Avec la sortie de GLM-5V-Turbo,
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter





Maison






