Hogar
Doubao se sitúa a la cabeza a nivel mundial en rendimiento de visión artificial, superando a los modelos de Google
Según el último informe de evaluación publicado por SuperCLUE-VLM en abril de 2026, se han producido avances significativos en el ámbito de los modelos multimodales de visión y lenguaje en chino. Tras llevar a cabo una evaluación exhaustiva de 17 de los principales modelos a gran escala del mundo, se ha constatado que los desarrolladores nacionales de IA están demostrando un gran progreso. Estos modelos no solo destacan en la interpretación de contenidos en chino, sino que también superan a sus principales homólogos internacionales en todos los parámetros de evaluación.
ByteDance encabeza la clasificación, con varios modelos nacionales situados en los primeros puestos
Los resultados de la evaluación muestran que el modelo «Doubao-Seed-2.0-Pro-260215» de ByteDance obtuvo 90,66 puntos, lo que le valió la primera posición en la clasificación general. Esta puntuación superó a la de «Google Gemini-3.1-Pro-Preview», que hasta entonces se consideraba un fuerte competidor con 89,35 puntos. Además, otros modelos nacionales, como la serie Qwen 3.5 de Alibaba, SenseNova de SenseTime y GLM de Zhipu, también obtuvieron unos resultados excepcionales, consolidándose firmemente entre los líderes. Por el contrario, modelos extranjeros muy conocidos, como el GPT-5.4 de OpenAI y el Grok de X.AI, quedaron en la zona media durante esta evaluación multimodal china.

Evaluación en profundidad en tres áreas clave: evidencia de habilidades cognitivas básicas avanzadas
El marco de evaluación fue exhaustivo y abarcó tres áreas fundamentales: cognición básica, razonamiento visual y aplicación visual. La evaluación incluyó 25 escenarios diferentes, como el reconocimiento general de objetos, el análisis de gráficos y las imágenes médicas. Los modelos nacionales obtuvieron resultados especialmente buenos en las categorías de cognición básica y análisis de datos, alcanzando puntuaciones que superaron de forma constante los 90 puntos, lo que refleja un alto nivel de madurez técnica y una gran adaptabilidad a los contextos en lengua china.
Persisten los retos en campos especializados; el razonamiento industrial y médico se identifican como áreas prioritarias para el futuro
Aunque lideran la clasificación general, los datos de la evaluación también pusieron de relieve áreas en las que los modelos nacionales aún deben mejorar. En tareas de razonamiento visual altamente especializadas, como la inspección industrial y las imágenes médicas de alta precisión, estos modelos se quedan rezagados respecto a los líderes mundiales, y en algunos escenarios específicos se observan variaciones considerables en las puntuaciones.
Los expertos del sector consideran que estos recientes cambios en la clasificación representan un punto de inflexión crucial para el desarrollo de la IA multimodal china. Los modelos nacionales a gran escala han consolidado ya una sólida ventaja competitiva en su capacidad para comprender en profundidad y aplicar contenidos en chino, lo que marca el inicio de una nueva era en la que pueden competir con los gigantes internacionales e incluso asumir un papel de liderazgo en este campo.
Artículo relacionado
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Según el último informe de evaluación publicado por SuperCLUE-VLM en abril de 2026, se han producido avances significativos en el ámbito de los modelos multimodales de visión y lenguaje en chino. Tras llevar a cabo una evaluación exhaustiva de 17 de los principales modelos a gran escala del mundo, se ha constatado que los desarrolladores nacionales de IA están demostrando un gran progreso. Estos modelos no solo destacan en la interpretación de contenidos en chino, sino que también superan a sus principales homólogos internacionales en todos los parámetros de evaluación.
ByteDance encabeza la clasificación, con varios modelos nacionales situados en los primeros puestos
Los resultados de la evaluación muestran que el modelo «Doubao-Seed-2.0-Pro-260215» de ByteDance obtuvo 90,66 puntos, lo que le valió la primera posición en la clasificación general. Esta puntuación superó a la de «Google Gemini-3.1-Pro-Preview», que hasta entonces se consideraba un fuerte competidor con 89,35 puntos. Además, otros modelos nacionales, como la serie Qwen 3.5 de Alibaba, SenseNova de SenseTime y GLM de Zhipu, también obtuvieron unos resultados excepcionales, consolidándose firmemente entre los líderes. Por el contrario, modelos extranjeros muy conocidos, como el GPT-5.4 de OpenAI y el Grok de X.AI, quedaron en la zona media durante esta evaluación multimodal china.

Evaluación en profundidad en tres áreas clave: evidencia de habilidades cognitivas básicas avanzadas
El marco de evaluación fue exhaustivo y abarcó tres áreas fundamentales: cognición básica, razonamiento visual y aplicación visual. La evaluación incluyó 25 escenarios diferentes, como el reconocimiento general de objetos, el análisis de gráficos y las imágenes médicas. Los modelos nacionales obtuvieron resultados especialmente buenos en las categorías de cognición básica y análisis de datos, alcanzando puntuaciones que superaron de forma constante los 90 puntos, lo que refleja un alto nivel de madurez técnica y una gran adaptabilidad a los contextos en lengua china.
Persisten los retos en campos especializados; el razonamiento industrial y médico se identifican como áreas prioritarias para el futuro
Aunque lideran la clasificación general, los datos de la evaluación también pusieron de relieve áreas en las que los modelos nacionales aún deben mejorar. En tareas de razonamiento visual altamente especializadas, como la inspección industrial y las imágenes médicas de alta precisión, estos modelos se quedan rezagados respecto a los líderes mundiales, y en algunos escenarios específicos se observan variaciones considerables en las puntuaciones.
Los expertos del sector consideran que estos recientes cambios en la clasificación representan un punto de inflexión crucial para el desarrollo de la IA multimodal china. Los modelos nacionales a gran escala han consolidado ya una sólida ventaja competitiva en su capacidad para comprender en profundidad y aplicar contenidos en chino, lo que marca el inicio de una nueva era en la que pueden competir con los gigantes internacionales e incluso asumir un papel de liderazgo en este campo.
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t











