Microsoft publica en código abierto Phi-4-Vision, un modelo ligero de IA multimodal
Microsoft ha publicado oficialmente en código abierto su último modelo de razonamiento multimodal, Phi-4-reasoning-vision-15B. Con 15 000 millones de parámetros, este modelo logra un equilibrio ideal entre alto rendimiento y bajo coste. Su arquitectura ligera lo convierte en una nueva opción muy interesante para abordar tareas visuales complejas en entornos con recursos limitados.
Una «potencia compacta» impulsada por datos refinados
A diferencia de los modelos típicos del sector, entrenados con billones de tokens, Phi-4-reasoning-vision se desarrolló utilizando solo 200 000 millones de tokens multimodales. El equipo dio prioridad a la calidad de los datos mediante una rigurosa limpieza de los datos de código abierto, la generación de datos sintéticos específicos y la calibración cuidadosa de las proporciones de datos específicos del dominio, como el aumento del contenido matemático para potenciar el razonamiento computacional. Este enfoque permite un rendimiento excelente en el razonamiento científico y en las tareas de localización de elementos en pantalla.

Estrategia innovadora de razonamiento híbrido
Una innovación clave de este modelo es su diseño de «vía de razonamiento híbrida»:
Tareas de percepción: para tareas sencillas como la subtitulación de imágenes o el OCR, el modelo utiliza por defecto un modo de respuesta directa, optimizado para la velocidad y una menor latencia.
Tareas de razonamiento: cuando se enfrenta a una lógica compleja, como la interpretación de fórmulas matemáticas o gráficos científicos, activa automáticamente un proceso estructurado de cadena de pensamiento (CoT) para garantizar la precisión de la respuesta.
Los usuarios también pueden cambiar manualmente entre estos dos modos utilizando frases de activación específicas, adaptando el comportamiento del modelo a las diferentes necesidades de la aplicación.
Al integrar el codificador de resolución dinámica SigLIP-2, el modelo destaca en la percepción de detalles finos dentro de capturas de pantalla de alta resolución. Esta capacidad lo posiciona como una base ideal para desarrollar Agentes de Uso Informático (CUA), que pueden identificar con precisión e interactuar con botones, campos y otros elementos en interfaces digitales.
Phi-4-reasoning-vision-15B ya está disponible en las principales plataformas de código abierto. Microsoft prevé que este modelo compacto demostrará cómo «más pequeño y más rápido» también puede significar «más capaz» en el ámbito multimodal, lo que contribuirá a impulsar la adopción de la inteligencia espacial y las tecnologías interactivas en tiempo real.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Microsoft ha publicado oficialmente en código abierto su último modelo de razonamiento multimodal, Phi-4-reasoning-vision-15B. Con 15 000 millones de parámetros, este modelo logra un equilibrio ideal entre alto rendimiento y bajo coste. Su arquitectura ligera lo convierte en una nueva opción muy interesante para abordar tareas visuales complejas en entornos con recursos limitados.
Una «potencia compacta» impulsada por datos refinados
A diferencia de los modelos típicos del sector, entrenados con billones de tokens, Phi-4-reasoning-vision se desarrolló utilizando solo 200 000 millones de tokens multimodales. El equipo dio prioridad a la calidad de los datos mediante una rigurosa limpieza de los datos de código abierto, la generación de datos sintéticos específicos y la calibración cuidadosa de las proporciones de datos específicos del dominio, como el aumento del contenido matemático para potenciar el razonamiento computacional. Este enfoque permite un rendimiento excelente en el razonamiento científico y en las tareas de localización de elementos en pantalla.

Estrategia innovadora de razonamiento híbrido
Una innovación clave de este modelo es su diseño de «vía de razonamiento híbrida»:
Tareas de percepción: para tareas sencillas como la subtitulación de imágenes o el OCR, el modelo utiliza por defecto un modo de respuesta directa, optimizado para la velocidad y una menor latencia.
Tareas de razonamiento: cuando se enfrenta a una lógica compleja, como la interpretación de fórmulas matemáticas o gráficos científicos, activa automáticamente un proceso estructurado de cadena de pensamiento (CoT) para garantizar la precisión de la respuesta.
Los usuarios también pueden cambiar manualmente entre estos dos modos utilizando frases de activación específicas, adaptando el comportamiento del modelo a las diferentes necesidades de la aplicación.
Al integrar el codificador de resolución dinámica SigLIP-2, el modelo destaca en la percepción de detalles finos dentro de capturas de pantalla de alta resolución. Esta capacidad lo posiciona como una base ideal para desarrollar Agentes de Uso Informático (CUA), que pueden identificar con precisión e interactuar con botones, campos y otros elementos en interfaces digitales.
Phi-4-reasoning-vision-15B ya está disponible en las principales plataformas de código abierto. Microsoft prevé que este modelo compacto demostrará cómo «más pequeño y más rápido» también puede significar «más capaz» en el ámbito multimodal, lo que contribuirá a impulsar la adopción de la inteligencia espacial y las tecnologías interactivas en tiempo real.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr





Hogar






