Maison
L'attaque de réduction des dimensions du modèle 1.3B de MiniCPM-V 4.6 redéfinit la technologie multimodale en périphérie
Le 11 mai, Mingshi Intelligence s'est associée à l'université de Tsinghua et à la communauté open source OpenBMB pour dévoiler le nouveau modèle multimodal de grande envergure destiné à la périphérie , le MiniCPM-V4.6. Malgré sa taille compacte — seulement 1,3 milliard de paramètres —, ce modèle léger repousse les limites des modèles plus volumineux grâce à une densité intelligente exceptionnelle et à une adaptabilité multiplateforme, accélérant ainsi le déploiement concret de l’IA en périphérie.

1. Performances de pointe : 1,3 milliard de paramètres pour des résultats exceptionnels
MiniCPM-V4.6 se décline en deux versions — « Instruct » et « Thinking » — qui font toutes deux preuve d’une capacité de raisonnement et de compréhension impressionnante dans divers tests de performance, par rapport à des modèles de taille similaire.
Leadership mondial : dans le classement Artificial Analysis (AA), MiniCPM-V4.6 a obtenu un score impressionnant de 13 points, surpassant largement ses concurrents de taille similaire (par exemple, le Qwen3.5-0.8B d’Alibaba et le Gemma4-E2B-it de Google) tout en égalant presque les performances de modèles plus volumineux comme le Qwen3.5-2B. Cela établit une nouvelle référence pour les modèles à 1 milliard de paramètres.
Capacités avancées : De la compréhension générale image-texte et du raisonnement mathématique complexe en sciences, technologie, ingénierie et mathématiques (STEM) à la reconnaissance optique de caractères (OCR) de documents exigeants et à la compréhension temporelle des vidéos, le modèle fait preuve d’une grande intelligence. La version « Thinking », en particulier, excelle dans le raisonnement multi-images et la suppression des hallucinations.
2. Percée en matière d’efficacité : une densité intelligente extrême en périphérie
Pour pallier les contraintes de mémoire liées au déploiement en périphérie, MiniCPM-V4.6 a été profondément optimisé en termes de vitesse d’inférence et d’efficacité des ressources.
Faible empreinte mémoire : les besoins en mémoire sont réduits à seulement 6 Go, ce qui permet un fonctionnement fluide sur les smartphones, PC et appareils domestiques connectés courants.
Efficacité de l’inférence : grâce à la technologie vLLM, le débit d’inférence est 1,5 fois supérieur à celui des concurrents. Lors du traitement d’une image ultra-haute définition de 3 136² à la périphérie, la latence de la première réponse n’est que de 75,7 ms, soit 2,2 fois plus rapide que les modèles concurrents.
Débit : un seul GPU permet de générer du texte à un rythme de 7 013 tokens par seconde et peut traiter des images de 1 344² à une cadence de 54,79 images par seconde, démontrant ainsi une efficacité remarquable.
3. Technologie de base : LLaVA-UHD v4 minimise la surcharge
La conception allégée du modèle est rendue possible par LLaVA-UHD v4, développé conjointement par Mingshi Intelligence et l’université de Tsinghua.
Refonte de l’encodage : grâce à un module d’encodage d’images ViT repensé et à un module de compression superficielle, la surcharge liée à l’encodage des images est réduite de 50 % et les opérations en virgule flottante haute résolution de 55,8 %.
Compression hybride : elle introduit une compression hybride de jetons 4×/16× qui permet de basculer de manière flexible entre les modes « performance d’abord » et « vitesse d’abord ». Cette technologie a été validée dans le modèle de recommandation OneRec de Kuaishou, qui gère un trafic massif.
4. Déploiement dans l’écosystème : du laboratoire à l’industrie
La publication en open source de MiniCPM-V4.6 marque une étape importante tant sur le plan technique que pour l’écosystème.
Développement simplifié : elle s’intègre de manière transparente à des frameworks de réglage fin tels que ms-swift et LLaMA-Factory, permettant un réglage fin à grande échelle sur un seul GPU RTX 4090.
Prise en charge multiplateforme : compatible avec vLLM, Ollama et d’autres frameworks majeurs, il propose des versions de test pour iOS, Android et HarmonyOS, étendant ainsi l’IA à une gamme plus large de matériels.
Impact concret : cette série de modèles est déjà déployée dans les secteurs de l’automobile, de l’informatique, de la maison connectée et de l’inspection industrielle, avec des partenaires tels que Lenovo, Geely, SAIC Volkswagen, Xiaomi et OPPO.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
Le 11 mai, Mingshi Intelligence s'est associée à l'université de Tsinghua et à la communauté open source OpenBMB pour dévoiler le nouveau modèle multimodal de grande envergure destiné à la périphérie , le MiniCPM-V4.6. Malgré sa taille compacte — seulement 1,3 milliard de paramètres —, ce modèle léger repousse les limites des modèles plus volumineux grâce à une densité intelligente exceptionnelle et à une adaptabilité multiplateforme, accélérant ainsi le déploiement concret de l’IA en périphérie.

1. Performances de pointe : 1,3 milliard de paramètres pour des résultats exceptionnels
MiniCPM-V4.6 se décline en deux versions — « Instruct » et « Thinking » — qui font toutes deux preuve d’une capacité de raisonnement et de compréhension impressionnante dans divers tests de performance, par rapport à des modèles de taille similaire.
Leadership mondial : dans le classement Artificial Analysis (AA), MiniCPM-V4.6 a obtenu un score impressionnant de 13 points, surpassant largement ses concurrents de taille similaire (par exemple, le Qwen3.5-0.8B d’Alibaba et le Gemma4-E2B-it de Google) tout en égalant presque les performances de modèles plus volumineux comme le Qwen3.5-2B. Cela établit une nouvelle référence pour les modèles à 1 milliard de paramètres.
Capacités avancées : De la compréhension générale image-texte et du raisonnement mathématique complexe en sciences, technologie, ingénierie et mathématiques (STEM) à la reconnaissance optique de caractères (OCR) de documents exigeants et à la compréhension temporelle des vidéos, le modèle fait preuve d’une grande intelligence. La version « Thinking », en particulier, excelle dans le raisonnement multi-images et la suppression des hallucinations.
2. Percée en matière d’efficacité : une densité intelligente extrême en périphérie
Pour pallier les contraintes de mémoire liées au déploiement en périphérie, MiniCPM-V4.6 a été profondément optimisé en termes de vitesse d’inférence et d’efficacité des ressources.
Faible empreinte mémoire : les besoins en mémoire sont réduits à seulement 6 Go, ce qui permet un fonctionnement fluide sur les smartphones, PC et appareils domestiques connectés courants.
Efficacité de l’inférence : grâce à la technologie vLLM, le débit d’inférence est 1,5 fois supérieur à celui des concurrents. Lors du traitement d’une image ultra-haute définition de 3 136² à la périphérie, la latence de la première réponse n’est que de 75,7 ms, soit 2,2 fois plus rapide que les modèles concurrents.
Débit : un seul GPU permet de générer du texte à un rythme de 7 013 tokens par seconde et peut traiter des images de 1 344² à une cadence de 54,79 images par seconde, démontrant ainsi une efficacité remarquable.
3. Technologie de base : LLaVA-UHD v4 minimise la surcharge
La conception allégée du modèle est rendue possible par LLaVA-UHD v4, développé conjointement par Mingshi Intelligence et l’université de Tsinghua.
Refonte de l’encodage : grâce à un module d’encodage d’images ViT repensé et à un module de compression superficielle, la surcharge liée à l’encodage des images est réduite de 50 % et les opérations en virgule flottante haute résolution de 55,8 %.
Compression hybride : elle introduit une compression hybride de jetons 4×/16× qui permet de basculer de manière flexible entre les modes « performance d’abord » et « vitesse d’abord ». Cette technologie a été validée dans le modèle de recommandation OneRec de Kuaishou, qui gère un trafic massif.
4. Déploiement dans l’écosystème : du laboratoire à l’industrie
La publication en open source de MiniCPM-V4.6 marque une étape importante tant sur le plan technique que pour l’écosystème.
Développement simplifié : elle s’intègre de manière transparente à des frameworks de réglage fin tels que ms-swift et LLaMA-Factory, permettant un réglage fin à grande échelle sur un seul GPU RTX 4090.
Prise en charge multiplateforme : compatible avec vLLM, Ollama et d’autres frameworks majeurs, il propose des versions de test pour iOS, Android et HarmonyOS, étendant ainsi l’IA à une gamme plus large de matériels.
Impact concret : cette série de modèles est déjà déployée dans les secteurs de l’automobile, de l’informatique, de la maison connectée et de l’inspection industrielle, avec des partenaires tels que Lenovo, Geely, SAIC Volkswagen, Xiaomi et OPPO.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











