Hogar
Apple presenta RubiCap AI para la descripción de imágenes en medio de las preocupaciones sobre su rendimiento
En el campo de la visión artificial, lograr que la IA observe y describa cada detalle de una imagen con una precisión similar a la humana ha sido durante mucho tiempo un reto fundamental. Recientemente, Apple, en colaboración con la Universidad de Wisconsin-Madison, ha presentado oficialmente un novedoso marco de entrenamiento de IA denominado RubiCap .
Este marco está diseñado específicamente para la «descripción densa de imágenes», con el objetivo de capacitar a la IA para captar y expresar con precisión detalles muy específicos —como «una manzana roja sobre la mesa de madera» o «un peatón en la distancia»— en lugar de ofrecer solo resúmenes genéricos.

Aprendizaje por refuerzo con gran impacto: Qwen2.5 actúa como «árbitro»
La generación de subtítulos de imágenes tradicional suele depender de costosas anotaciones humanas o de grandes modelos propensos a la alucinación, lo que da lugar a una calidad de datos inconsistente. El equipo de investigación de Apple abordó este problema con un innovador enfoque de aprendizaje por refuerzo. El sistema utiliza primero GPT-4 y Gemini 1.5 Pro para generar descripciones candidatas. A continuación, Gemini 1.5 Pro refina los criterios de puntuación, mientras que el modelo Qwen2.5 actúa como árbitro, proporcionando puntuaciones y comentarios.
Esta retroalimentación estructurada y precisa permite al modelo de entrenamiento identificar y corregir claramente los errores, logrando una mayor precisión descriptiva incluso con un menor número de parámetros.
La ventaja del modelo compacto: las tasas de alucinación más bajas superan a los modelos de un billón de parámetros
Los modelos de la serie RubiCap (que van de 2 000 a 7 000 millones de parámetros) entrenados en este marco demostraron una eficiencia excepcional en las evaluaciones. Los datos experimentales revelan que el modelo RubiCap de 7000 millones de parámetros obtuvo las mejores puntuaciones en pruebas a ciegas, con una tasa de error de alucinaciones inferior a la de un modelo grande líder de 720 000 millones de parámetros. Sorprendentemente, la versión mini de 3000 millones de parámetros superó incluso a su homólogo de 7000 millones de parámetros en ciertas métricas.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
En el campo de la visión artificial, lograr que la IA observe y describa cada detalle de una imagen con una precisión similar a la humana ha sido durante mucho tiempo un reto fundamental. Recientemente, Apple, en colaboración con la Universidad de Wisconsin-Madison, ha presentado oficialmente un novedoso marco de entrenamiento de IA denominado
Este marco está diseñado específicamente para la «descripción densa de imágenes», con el objetivo de capacitar a la IA para captar y expresar con precisión detalles muy específicos —como «una manzana roja sobre la mesa de madera» o «un peatón en la distancia»— en lugar de ofrecer solo resúmenes genéricos.

Aprendizaje por refuerzo con gran impacto: Qwen2.5 actúa como «árbitro»
La generación de subtítulos de imágenes tradicional suele depender de costosas anotaciones humanas o de grandes modelos propensos a la alucinación, lo que da lugar a una calidad de datos inconsistente. El equipo de investigación de Apple abordó este problema con un innovador enfoque de aprendizaje por refuerzo. El sistema utiliza primero GPT-4 y Gemini 1.5 Pro para generar descripciones candidatas. A continuación, Gemini 1.5 Pro refina los criterios de puntuación, mientras que el modelo Qwen2.5 actúa como árbitro, proporcionando puntuaciones y comentarios.
Esta retroalimentación estructurada y precisa permite al modelo de entrenamiento identificar y corregir claramente los errores, logrando una mayor precisión descriptiva incluso con un menor número de parámetros.
La ventaja del modelo compacto: las tasas de alucinación más bajas superan a los modelos de un billón de parámetros
Los modelos de la serie RubiCap (que van de 2 000 a 7 000 millones de parámetros) entrenados en este marco demostraron una eficiencia excepcional en las evaluaciones. Los datos experimentales revelan que el modelo RubiCap de 7000 millones de parámetros obtuvo las mejores puntuaciones en pruebas a ciegas, con una tasa de error de alucinaciones inferior a la de un modelo grande líder de 720 000 millones de parámetros. Sorprendentemente, la versión mini de 3000 millones de parámetros superó incluso a su homólogo de 7000 millones de parámetros en ciertas métricas.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











