Hogar
El ataque de reducción de dimensiones del modelo 1.3B de MiniCPM-V 4.6 redefine la tecnología multimodal de vanguardia
El 11 de mayo, Mingshi Intelligence se asoció con la Universidad de Tsinghua y la comunidad de código abierto OpenBMB para presentar el nuevo modelo multimodal de gran tamaño para el borde de red MiniCPM-V4.6. A pesar de su tamaño compacto —solo 1.3 mil millones de parámetros—, este modelo ligero supera los límites de los modelos más grandes gracias a su excepcional densidad inteligente y su adaptabilidad multiplataforma, lo que acelera la implantación en el mundo real de la IA en el borde de la red.

1. Rendimiento máximo: 1.3B de parámetros ofrecen resultados excepcionales
MiniCPM-V4.6 está disponible en dos versiones —Instruct y Thinking—; ambas demuestran una capacidad de razonamiento y comprensión impresionantes en diversas pruebas de rendimiento en comparación con modelos de tamaño similar.
Liderazgo mundial: en la clasificación de Artificial Analysis (AA), MiniCPM-V4.6 obtuvo una impresionante puntuación de 13 puntos, superando con creces a rivales de tamaño similar (por ejemplo, el Qwen3.5-0.8B de Alibaba y el Gemma4-E2B-it de Google), al tiempo que casi igualaba el rendimiento de modelos más grandes como el Qwen3.5-2B. Esto establece un nuevo punto de referencia para los modelos de 1B de parámetros.
Capacidades avanzadas: Desde la comprensión general de imágenes y texto y el razonamiento matemático complejo en el ámbito de las ciencias, la tecnología y las matemáticas (STEM), hasta el exigente reconocimiento óptico de caracteres (OCR) en documentos y la comprensión temporal de vídeos, el modelo muestra una gran inteligencia. La versión «Thinking», en particular, destaca en el razonamiento con múltiples imágenes y la supresión de alucinaciones.
2. Avance en eficiencia: densidad inteligente extrema en el borde
Para hacer frente a las limitaciones de memoria en el despliegue en el borde, MiniCPM-V4.6 se ha optimizado en profundidad para mejorar la velocidad de inferencia y la eficiencia de los recursos.
Bajo consumo de memoria: los requisitos de memoria se reducen a tan solo 6 GB, lo que permite un funcionamiento fluido en smartphones, ordenadores personales y dispositivos domésticos inteligentes convencionales.
Eficiencia en la inferencia: gracias a la tecnología vLLM, el rendimiento de la inferencia es 1,5 veces superior al de la competencia. Al procesar una imagen de ultra alta definición de 3136² en el borde, la latencia de la primera respuesta es de tan solo 75,7 ms, lo que supone una velocidad 2,2 veces superior a la de los modelos de la competencia.
Rendimiento: una sola GPU genera texto a un ritmo de 7 013 tokens por segundo y puede procesar imágenes de 1 344² a una velocidad de 54,79 imágenes por segundo, lo que demuestra una eficiencia extraordinaria.
3. Tecnología principal: LLaVA-UHD v4 minimiza la sobrecarga
El diseño ligero del modelo es posible gracias a LLaVA-UHD v4, desarrollado conjuntamente por Mingshi Intelligence y la Universidad de Tsinghua.
Rediseño de la codificación: gracias a un módulo renovado de codificación de imágenes ViT y de compresión superficial, la sobrecarga de la codificación de imágenes se reduce en un 50 % y las operaciones de punto flotante de alta resolución, en un 55,8 %.
Compresión híbrida: introduce una compresión híbrida de tokens 4×/16× que permite alternar de forma flexible entre los modos «rendimiento primero» y «velocidad primero». Esta tecnología ha sido validada en el modelo de recomendación OneRec de Kuaishou, que gestiona un tráfico masivo.
4. Implantación en el ecosistema: del laboratorio a la industria
El lanzamiento en código abierto de MiniCPM-V4.6 supone un hito tanto técnico como para el ecosistema.
Fácil desarrollo: Se integra a la perfección con marcos de ajuste fino como ms-swift y LLaMA-Factory, lo que permite un ajuste fino a gran escala en una sola GPU RTX 4090.
Compatibilidad multiplataforma: compatible con vLLM, Ollama y otros marcos importantes, ofrece versiones de prueba para iOS, Android y HarmonyOS, lo que lleva la IA a una gama más amplia de hardware.
Impacto en el mundo real: La serie de modelos ya se ha implementado en los sectores de la automoción, los ordenadores personales, los hogares inteligentes y la inspección industrial, con socios como Lenovo, Geely, SAIC Volkswagen, Xiaomi y OPPO.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El 11 de mayo, Mingshi Intelligence se asoció con la Universidad de Tsinghua y la comunidad de código abierto OpenBMB para presentar el nuevo modelo multimodal de gran tamaño para el borde de red MiniCPM-V4.6. A pesar de su tamaño compacto —solo 1.3 mil millones de parámetros—, este modelo ligero supera los límites de los modelos más grandes gracias a su excepcional densidad inteligente y su adaptabilidad multiplataforma, lo que acelera la implantación en el mundo real de la IA en el borde de la red.

1. Rendimiento máximo: 1.3B de parámetros ofrecen resultados excepcionales
MiniCPM-V4.6 está disponible en dos versiones —Instruct y Thinking—; ambas demuestran una capacidad de razonamiento y comprensión impresionantes en diversas pruebas de rendimiento en comparación con modelos de tamaño similar.
Liderazgo mundial: en la clasificación de Artificial Analysis (AA), MiniCPM-V4.6 obtuvo una impresionante puntuación de 13 puntos, superando con creces a rivales de tamaño similar (por ejemplo, el Qwen3.5-0.8B de Alibaba y el Gemma4-E2B-it de Google), al tiempo que casi igualaba el rendimiento de modelos más grandes como el Qwen3.5-2B. Esto establece un nuevo punto de referencia para los modelos de 1B de parámetros.
Capacidades avanzadas: Desde la comprensión general de imágenes y texto y el razonamiento matemático complejo en el ámbito de las ciencias, la tecnología y las matemáticas (STEM), hasta el exigente reconocimiento óptico de caracteres (OCR) en documentos y la comprensión temporal de vídeos, el modelo muestra una gran inteligencia. La versión «Thinking», en particular, destaca en el razonamiento con múltiples imágenes y la supresión de alucinaciones.
2. Avance en eficiencia: densidad inteligente extrema en el borde
Para hacer frente a las limitaciones de memoria en el despliegue en el borde, MiniCPM-V4.6 se ha optimizado en profundidad para mejorar la velocidad de inferencia y la eficiencia de los recursos.
Bajo consumo de memoria: los requisitos de memoria se reducen a tan solo 6 GB, lo que permite un funcionamiento fluido en smartphones, ordenadores personales y dispositivos domésticos inteligentes convencionales.
Eficiencia en la inferencia: gracias a la tecnología vLLM, el rendimiento de la inferencia es 1,5 veces superior al de la competencia. Al procesar una imagen de ultra alta definición de 3136² en el borde, la latencia de la primera respuesta es de tan solo 75,7 ms, lo que supone una velocidad 2,2 veces superior a la de los modelos de la competencia.
Rendimiento: una sola GPU genera texto a un ritmo de 7 013 tokens por segundo y puede procesar imágenes de 1 344² a una velocidad de 54,79 imágenes por segundo, lo que demuestra una eficiencia extraordinaria.
3. Tecnología principal: LLaVA-UHD v4 minimiza la sobrecarga
El diseño ligero del modelo es posible gracias a LLaVA-UHD v4, desarrollado conjuntamente por Mingshi Intelligence y la Universidad de Tsinghua.
Rediseño de la codificación: gracias a un módulo renovado de codificación de imágenes ViT y de compresión superficial, la sobrecarga de la codificación de imágenes se reduce en un 50 % y las operaciones de punto flotante de alta resolución, en un 55,8 %.
Compresión híbrida: introduce una compresión híbrida de tokens 4×/16× que permite alternar de forma flexible entre los modos «rendimiento primero» y «velocidad primero». Esta tecnología ha sido validada en el modelo de recomendación OneRec de Kuaishou, que gestiona un tráfico masivo.
4. Implantación en el ecosistema: del laboratorio a la industria
El lanzamiento en código abierto de MiniCPM-V4.6 supone un hito tanto técnico como para el ecosistema.
Fácil desarrollo: Se integra a la perfección con marcos de ajuste fino como ms-swift y LLaMA-Factory, lo que permite un ajuste fino a gran escala en una sola GPU RTX 4090.
Compatibilidad multiplataforma: compatible con vLLM, Ollama y otros marcos importantes, ofrece versiones de prueba para iOS, Android y HarmonyOS, lo que lleva la IA a una gama más amplia de hardware.
Impacto en el mundo real: La serie de modelos ya se ha implementado en los sectores de la automoción, los ordenadores personales, los hogares inteligentes y la inspección industrial, con socios como Lenovo, Geely, SAIC Volkswagen, Xiaomi y OPPO.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











