Microsoft met en open source Phi-4-Vision, un modèle d'IA multimodal léger
Microsoft a officiellement mis en open source son dernier modèle de raisonnement multimodal, Phi-4-reasoning-vision-15B. Avec ses 15 milliards de paramètres, ce modèle offre un équilibre idéal entre hautes performances et faible coût. Son architecture légère en fait une nouvelle option très intéressante pour traiter des tâches visuelles complexes dans des environnements aux ressources limitées.
Une « petite bombe » alimentée par des données raffinées
Contrairement aux modèles industriels classiques entraînés sur des milliers de milliards de tokens, Phi-4-reasoning-vision a été développé en utilisant seulement 200 milliards de tokens multimodaux. L'équipe a donné la priorité à la qualité des données en procédant à un nettoyage rigoureux des données open source, en générant des données synthétiques ciblées et en calibrant soigneusement les ratios de données spécifiques à chaque domaine — par exemple en augmentant le contenu mathématique pour renforcer le raisonnement computationnel. Cette approche permet d'obtenir d'excellentes performances dans le raisonnement scientifique et les tâches de localisation d'éléments à l'écran.

Une stratégie de raisonnement hybride innovante
Une innovation clé de ce modèle réside dans la conception de son « parcours de raisonnement hybride » :
Tâches de perception : pour les tâches simples telles que la légende d'images ou la reconnaissance optique de caractères (OCR), le modèle passe par défaut en mode de réponse directe, optimisé pour la vitesse et une latence réduite.
Tâches de raisonnement : lorsqu'il est confronté à une logique complexe, telle que l'interprétation de formules mathématiques ou de graphiques scientifiques, il engage automatiquement un processus structuré de chaîne de pensée (CoT) pour garantir la précision de la réponse.
Les utilisateurs peuvent également basculer manuellement entre ces deux modes à l'aide de phrases déclencheuses spécifiques, adaptant ainsi le comportement du modèle aux différents besoins des applications.
Grâce à l'intégration de l'encodeur à résolution dynamique SigLIP-2, le modèle excelle dans la perception des détails fins au sein de captures d'écran haute résolution. Cette capacité en fait une base idéale pour le développement d'agents d'utilisation informatique (CUA), capables d'identifier avec précision et d'interagir avec les boutons, les champs et autres éléments des interfaces numériques.
Phi-4-reasoning-vision-15B est désormais disponible sur les principales plateformes open source. Microsoft estime que ce modèle compact démontrera comment « plus petit et plus rapide » peut également signifier « plus performant » dans le domaine multimodal, contribuant ainsi à faire progresser l'adoption de l'intelligence spatiale et des technologies interactives en temps réel.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (1)
Microsoft a officiellement mis en open source son dernier modèle de raisonnement multimodal, Phi-4-reasoning-vision-15B. Avec ses 15 milliards de paramètres, ce modèle offre un équilibre idéal entre hautes performances et faible coût. Son architecture légère en fait une nouvelle option très intéressante pour traiter des tâches visuelles complexes dans des environnements aux ressources limitées.
Une « petite bombe » alimentée par des données raffinées
Contrairement aux modèles industriels classiques entraînés sur des milliers de milliards de tokens, Phi-4-reasoning-vision a été développé en utilisant seulement 200 milliards de tokens multimodaux. L'équipe a donné la priorité à la qualité des données en procédant à un nettoyage rigoureux des données open source, en générant des données synthétiques ciblées et en calibrant soigneusement les ratios de données spécifiques à chaque domaine — par exemple en augmentant le contenu mathématique pour renforcer le raisonnement computationnel. Cette approche permet d'obtenir d'excellentes performances dans le raisonnement scientifique et les tâches de localisation d'éléments à l'écran.

Une stratégie de raisonnement hybride innovante
Une innovation clé de ce modèle réside dans la conception de son « parcours de raisonnement hybride » :
Tâches de perception : pour les tâches simples telles que la légende d'images ou la reconnaissance optique de caractères (OCR), le modèle passe par défaut en mode de réponse directe, optimisé pour la vitesse et une latence réduite.
Tâches de raisonnement : lorsqu'il est confronté à une logique complexe, telle que l'interprétation de formules mathématiques ou de graphiques scientifiques, il engage automatiquement un processus structuré de chaîne de pensée (CoT) pour garantir la précision de la réponse.
Les utilisateurs peuvent également basculer manuellement entre ces deux modes à l'aide de phrases déclencheuses spécifiques, adaptant ainsi le comportement du modèle aux différents besoins des applications.
Grâce à l'intégration de l'encodeur à résolution dynamique SigLIP-2, le modèle excelle dans la perception des détails fins au sein de captures d'écran haute résolution. Cette capacité en fait une base idéale pour le développement d'agents d'utilisation informatique (CUA), capables d'identifier avec précision et d'interagir avec les boutons, les champs et autres éléments des interfaces numériques.
Phi-4-reasoning-vision-15B est désormais disponible sur les principales plateformes open source. Microsoft estime que ce modèle compact démontrera comment « plus petit et plus rapide » peut également signifier « plus performant » dans le domaine multimodal, contribuant ainsi à faire progresser l'adoption de l'intelligence spatiale et des technologies interactives en temps réel.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter





Maison






