Maison
Apple et LM Studio dévoilent un partenariat révolutionnaire alors que quatre studios utilisant des Mac déploient des modèles de grande envergure comportant des billions de paramètres

Démonstration révolutionnaire à la WWDC : exécution d'un modèle d'IA à un billion de paramètres sur du matériel Apple
Lors de la récente WWDC, la plateforme logicielle d’IA LM Studio s’est associée à Apple pour présenter une avancée révolutionnaire dans le domaine de l’intelligence artificielle. L’équipe a réussi à faire fonctionner le modèle phare de Moonshot AI, Kimi K2.6, à l’aide d’un cluster de quatre Mac Studio. Cette démonstration a clairement illustré les capacités considérables de l’architecture Apple Silicon en matière de traitement de modèles d’IA à très grande échelle.
Le modèle Kimi K2.6 s’articule autour d’une architecture MoE avancée, comportant au total jusqu’à un billion de paramètres. Bien que le système dynamique de planification expert du modèle réduise la charge de calcul lors de l’inférence en n’activant qu’environ 32 milliards de paramètres à la fois, le chargement du modèle dans son intégralité pose néanmoins un défi considérable en termes de mémoire. Lorsqu’il est traité en précision FP16, il nécessite environ 2 To de mémoire. Dans les configurations classiques de centres de données, répondre à cette exigence implique généralement l’utilisation de clusters de serveurs équipés de 8 à 16 GPU haut de gamme, ce qui peut coûter des millions de dollars.
Pourtant, la démonstration a surmonté cette limitation grâce à une solution technique innovante. Les quatre Mac Studio équipés de puces M3 Ultra ont été connectés via des interfaces Thunderbolt 5, tirant parti de la technologie RDMA-over-Thunderbolt disponible dans les dernières versions de macOS. Cette approche a permis un partage direct de la mémoire entre les appareils, fusionnant ainsi efficacement leurs 2 To de mémoire unifiée en un seul pool de mémoire logique. De ce fait, le modèle à un trillion de paramètres a pu être chargé sans problème. Lors de la démonstration en direct, le cluster a affiché d’excellentes performances, générant environ 28 jetons par seconde tout en consommant bien moins d’énergie que les centres de calcul traditionnels basés sur des GPU.
Parallèlement à cette démonstration, LM Studio a également présenté LM Link dans le cadre de cette collaboration. Reposant sur l’architecture VPN maillée Tailscale Mesh, cet outil permet aux utilisateurs d’accéder en toute sécurité au cluster Mac Studio local depuis n’importe où, via des connexions chiffrées de bout en bout. Les utilisateurs peuvent exploiter la puissance de calcul du cluster pour effectuer des inférences à l’aide d’un MacBook ou d’un iPhone, sans avoir besoin d’être physiquement présents auprès de l’appareil hôte. Toutes les données sensibles restent traitées localement au sein d’une boucle sécurisée, ce qui évite tout transfert via des serveurs cloud tiers.
Cette démonstration n’était pas seulement une vitrine technique ; elle a également envoyé un message clair au secteur. Apple Silicon, avec sa conception à mémoire unifiée et ses fonctionnalités efficaces de connectivité multi-appareils, s’impose comme une option viable pour le déploiement de modèles d’IA de grande envergure. Pour les organisations qui doivent exécuter fréquemment et à long terme des tâches d’inférence sur des modèles volumineux, cette solution élimine les coûts élevés associés aux services cloud en les remplaçant par des investissements matériels, ce qui se traduit par des économies significatives au fil du temps.
À mesure que les performances des clusters matériels grand public continuent de s’améliorer, les obstacles à l’adoption des technologies d’IA s’amenuisent encore davantage. Cette avancée suggère que la source de l’innovation de pointe en matière d’IA ne se limitera plus à une poignée de géants technologiques disposant d’importantes installations de supercalcul. Un paysage informatique décentralisé devrait offrir de nouvelles opportunités de développement dans un avenir proche.
Article connexe
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte
Recommandations de sujets spéciaux liés
commentaires (0)

Démonstration révolutionnaire à la WWDC : exécution d'un modèle d'IA à un billion de paramètres sur du matériel Apple
Lors de la récente WWDC, la plateforme logicielle d’IA LM Studio s’est associée à Apple pour présenter une avancée révolutionnaire dans le domaine de l’intelligence artificielle. L’équipe a réussi à faire fonctionner le modèle phare de Moonshot AI, Kimi K2.6, à l’aide d’un cluster de quatre Mac Studio. Cette démonstration a clairement illustré les capacités considérables de l’architecture Apple Silicon en matière de traitement de modèles d’IA à très grande échelle.
Le modèle Kimi K2.6 s’articule autour d’une architecture MoE avancée, comportant au total jusqu’à un billion de paramètres. Bien que le système dynamique de planification expert du modèle réduise la charge de calcul lors de l’inférence en n’activant qu’environ 32 milliards de paramètres à la fois, le chargement du modèle dans son intégralité pose néanmoins un défi considérable en termes de mémoire. Lorsqu’il est traité en précision FP16, il nécessite environ 2 To de mémoire. Dans les configurations classiques de centres de données, répondre à cette exigence implique généralement l’utilisation de clusters de serveurs équipés de 8 à 16 GPU haut de gamme, ce qui peut coûter des millions de dollars.
Pourtant, la démonstration a surmonté cette limitation grâce à une solution technique innovante. Les quatre Mac Studio équipés de puces M3 Ultra ont été connectés via des interfaces Thunderbolt 5, tirant parti de la technologie RDMA-over-Thunderbolt disponible dans les dernières versions de macOS. Cette approche a permis un partage direct de la mémoire entre les appareils, fusionnant ainsi efficacement leurs 2 To de mémoire unifiée en un seul pool de mémoire logique. De ce fait, le modèle à un trillion de paramètres a pu être chargé sans problème. Lors de la démonstration en direct, le cluster a affiché d’excellentes performances, générant environ 28 jetons par seconde tout en consommant bien moins d’énergie que les centres de calcul traditionnels basés sur des GPU.
Parallèlement à cette démonstration, LM Studio a également présenté LM Link dans le cadre de cette collaboration. Reposant sur l’architecture VPN maillée Tailscale Mesh, cet outil permet aux utilisateurs d’accéder en toute sécurité au cluster Mac Studio local depuis n’importe où, via des connexions chiffrées de bout en bout. Les utilisateurs peuvent exploiter la puissance de calcul du cluster pour effectuer des inférences à l’aide d’un MacBook ou d’un iPhone, sans avoir besoin d’être physiquement présents auprès de l’appareil hôte. Toutes les données sensibles restent traitées localement au sein d’une boucle sécurisée, ce qui évite tout transfert via des serveurs cloud tiers.
Cette démonstration n’était pas seulement une vitrine technique ; elle a également envoyé un message clair au secteur. Apple Silicon, avec sa conception à mémoire unifiée et ses fonctionnalités efficaces de connectivité multi-appareils, s’impose comme une option viable pour le déploiement de modèles d’IA de grande envergure. Pour les organisations qui doivent exécuter fréquemment et à long terme des tâches d’inférence sur des modèles volumineux, cette solution élimine les coûts élevés associés aux services cloud en les remplaçant par des investissements matériels, ce qui se traduit par des économies significatives au fil du temps.
À mesure que les performances des clusters matériels grand public continuent de s’améliorer, les obstacles à l’adoption des technologies d’IA s’amenuisent encore davantage. Cette avancée suggère que la source de l’innovation de pointe en matière d’IA ne se limitera plus à une poignée de géants technologiques disposant d’importantes installations de supercalcul. Un paysage informatique décentralisé devrait offrir de nouvelles opportunités de développement dans un avenir proche.
Slackbot devient un agent d'IA
Slackbot, l’assistant automatisé intégré à la plateforme de messagerie d’entreprise Slack de Salesforce, évolue vers un agent d’intelligence artificielle. Le CTO de Salesforce, Parker Harris, envisage qu’il atteigne une notoriété virale comparable à
ByteDance renforce les incitations à l’IA centrale alors que Doubao bondit de 14,6 %
ByteDance a récemment organisé une réunion d’information sur l’évaluation de DouBao afin de dévoiler de nouvelles politiques d’incitation pour le personnel impliqué dans la division DouBao. Le prix d’exercice des actions DouBao a été relevé de 14,85
MiniMax dévoile un programme d’équipe 10x pour encourager les experts mondiaux en intelligence artificielle
MiniMax (Xiyu Technology), le laboratoire d’intelligence artificielle générale, a officiellement lancé « 10x Team », une initiative mondiale de collaboration avec des talents. Ce programme vise à recruter des experts de premier plan dans divers secte











