Hogar
Simplificación de la evaluación comparativa de la IA empresarial: El marco RAG de código abierto ofrece métricas de rendimiento científico

Las empresas están invirtiendo importantes recursos en el desarrollo de sistemas de Generación Aumentada de Recuperación (RAG), con el objetivo de crear soluciones empresariales precisas de IA. Pero, ¿hasta qué punto son eficaces estos sistemas en la realidad?
Uno de los principales obstáculos ha sido la falta de normas objetivas de medición de la eficacia de los GAR. Este reto encuentra una posible solución con el lanzamiento hoy de Open RAG Eval, un marco de código abierto desarrollado en colaboración por Vectara y el equipo de investigación del profesor Jimmy Lin en la Universidad de Waterloo.
Open RAG Eval sustituye las comparaciones subjetivas por una metodología rigurosa y cuantificable para evaluar la precisión de la recuperación, la calidad de la generación y los índices de alucinación en las implementaciones de RAG de las empresas.
El marco evalúa el rendimiento del sistema a través de dos categorías métricas principales: métricas de recuperación y de generación. Funciona tanto con la plataforma de Vectara como con soluciones RAG personalizadas, proporcionando a los equipos técnicos datos sistemáticos para identificar oportunidades de optimización.
"La medición precede a la mejora", explicó el profesor Jimmy Lin en una entrevista exclusiva. "Aunque podíamos medir métricas de recuperación de información como NDCG, precisión y recall, la evaluación de la corrección factual seguía siendo esquiva; por eso nos embarcamos en este proyecto".
Por qué la evaluación RAG sigue siendo el obstáculo crítico para la IA empresarial
Vectara fue pionera en la tecnología RAG antes de que se convirtiera en la corriente dominante: se lanzó en octubre de 2022 e introdujo conceptos de "IA fundamentada" en mayo de 2023 para combatir las alucinaciones.
A medida que las implementaciones de la GAR se hacen más complejas -evolucionando de simples preguntas y respuestas a sistemas multiagente-, los retos de la evaluación se intensifican.
"En los entornos agénticos, la evaluación es doblemente crucial", señala Am Awadallah, CEO de Vectara. "Las alucinaciones de las primeras fases se agravan a lo largo de los pasos de procesamiento, lo que puede dar lugar a resultados finales incorrectos".
Metodología Open RAG Eval: Cuantificación de los componentes del sistema
El marco emplea un enfoque de evaluación basado en nuggets que deconstruye las respuestas en elementos fácticos centrales.
Lin describe cómo este método analiza la capacidad de los sistemas para captar y presentar estas pepitas de información esenciales.
Las evaluaciones se basan en cuatro parámetros específicos:
- Detección de alucinaciones: identifica la información sin fundamento en el contenido generado.
- Precisión de las citas: evalúa la calidad de la documentación original.
- Auto nugget - Mide la inclusión de información esencial
- UMBRELA - Proporciona una evaluación exhaustiva del rendimiento del recuperador
El marco examina los flujos de trabajo completos del GAR, revelando cómo los modelos de incrustación, los sistemas de recuperación, las estrategias de fragmentación y los LLM generan resultados de forma colectiva.
Innovación clave: Automatización basada en LLM
El gran avance de Open RAG Eval radica en la automatización de procesos que antes eran manuales mediante una sofisticada integración de LLM.
"La evaluación tradicional se basaba en comparaciones binarias", explicó Lin. "Nuestro enfoque automatizado revoluciona las metodologías de evaluación".
Aunque la evaluación basada en nuggets no es nueva, el marco la implementa a través de LLMs impulsados por Python capaces de identificar hechos y detectar alucinaciones dentro de pipelines de evaluación estructurados.
Posicionamiento del ecosistema de evaluación
En medio de marcos de evaluación de IA en expansión como Yourbench, de Hugging Face, y Agentic Evaluations, de Galileo, Open RAG Eval se centra específicamente en los conductos de RAG en lugar de en los resultados genéricos de LLM.
Basado en la ciencia de la recuperación de la información más que en métodos ad hoc, el marco amplía las contribuciones de código abierto de Vectara, incluido el modelo de evaluación de alucinaciones de Hughes, ampliamente adoptado.
"Lo hemos llamado deliberadamente Open RAG Eval para fomentar la colaboración en todo el sector", subraya Awadallah. "Este marco aborda una necesidad crítica del mercado para la evaluación RAG estandarizada".
Aplicación práctica
Entre los primeros en adoptarlo se encuentra Jeff Hummel, de Anywhere.re, que prevé agilizar los procesos de evaluación gracias a la colaboración de Vectara.
Hummel señaló los desafíos de escalado que implican la complejidad de la infraestructura y la gestión de costes, haciendo hincapié en las capacidades de evaluación comparativa predictiva del marco.
"Sin marcos estandarizados, dependíamos en gran medida de los comentarios subjetivos de los usuarios", reconoció Hummel. "Las métricas objetivas transformarán nuestro enfoque de escalado".
Optimización de las implantaciones de GAR
Open RAG Eval ayuda a los responsables de la toma de decisiones a abordar cuestiones críticas de configuración:
- Enfoques de agrupación por tokens frente a agrupación semántica
- Consideraciones sobre la implementación de la búsqueda híbrida
- Selección de LLM y optimización de avisos
- Umbrales de detección de alucinaciones
El marco permite la optimización iterativa basada en datos, estableciendo líneas de base, probando configuraciones y midiendo las mejoras. Las versiones futuras pueden incluir sugerencias de optimización automatizadas y herramientas de equilibrio coste-rendimiento.
Para empresas con distintos niveles de madurez de IA, Open RAG Eval ofrece estándares de evaluación científica que sustituyen a las conjeturas y las evaluaciones subjetivas, ayudando a evitar costosos errores de implementación a la vez que se avanza en la tecnología RAG.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Las empresas están invirtiendo importantes recursos en el desarrollo de sistemas de Generación Aumentada de Recuperación (RAG), con el objetivo de crear soluciones empresariales precisas de IA. Pero, ¿hasta qué punto son eficaces estos sistemas en la realidad?
Uno de los principales obstáculos ha sido la falta de normas objetivas de medición de la eficacia de los GAR. Este reto encuentra una posible solución con el lanzamiento hoy de Open RAG Eval, un marco de código abierto desarrollado en colaboración por Vectara y el equipo de investigación del profesor Jimmy Lin en la Universidad de Waterloo.
Open RAG Eval sustituye las comparaciones subjetivas por una metodología rigurosa y cuantificable para evaluar la precisión de la recuperación, la calidad de la generación y los índices de alucinación en las implementaciones de RAG de las empresas.
El marco evalúa el rendimiento del sistema a través de dos categorías métricas principales: métricas de recuperación y de generación. Funciona tanto con la plataforma de Vectara como con soluciones RAG personalizadas, proporcionando a los equipos técnicos datos sistemáticos para identificar oportunidades de optimización.
"La medición precede a la mejora", explicó el profesor Jimmy Lin en una entrevista exclusiva. "Aunque podíamos medir métricas de recuperación de información como NDCG, precisión y recall, la evaluación de la corrección factual seguía siendo esquiva; por eso nos embarcamos en este proyecto".
Por qué la evaluación RAG sigue siendo el obstáculo crítico para la IA empresarial
Vectara fue pionera en la tecnología RAG antes de que se convirtiera en la corriente dominante: se lanzó en octubre de 2022 e introdujo conceptos de "IA fundamentada" en mayo de 2023 para combatir las alucinaciones.
A medida que las implementaciones de la GAR se hacen más complejas -evolucionando de simples preguntas y respuestas a sistemas multiagente-, los retos de la evaluación se intensifican.
"En los entornos agénticos, la evaluación es doblemente crucial", señala Am Awadallah, CEO de Vectara. "Las alucinaciones de las primeras fases se agravan a lo largo de los pasos de procesamiento, lo que puede dar lugar a resultados finales incorrectos".
Metodología Open RAG Eval: Cuantificación de los componentes del sistema
El marco emplea un enfoque de evaluación basado en nuggets que deconstruye las respuestas en elementos fácticos centrales.
Lin describe cómo este método analiza la capacidad de los sistemas para captar y presentar estas pepitas de información esenciales.
Las evaluaciones se basan en cuatro parámetros específicos:
- Detección de alucinaciones: identifica la información sin fundamento en el contenido generado.
- Precisión de las citas: evalúa la calidad de la documentación original.
- Auto nugget - Mide la inclusión de información esencial
- UMBRELA - Proporciona una evaluación exhaustiva del rendimiento del recuperador
El marco examina los flujos de trabajo completos del GAR, revelando cómo los modelos de incrustación, los sistemas de recuperación, las estrategias de fragmentación y los LLM generan resultados de forma colectiva.
Innovación clave: Automatización basada en LLM
El gran avance de Open RAG Eval radica en la automatización de procesos que antes eran manuales mediante una sofisticada integración de LLM.
"La evaluación tradicional se basaba en comparaciones binarias", explicó Lin. "Nuestro enfoque automatizado revoluciona las metodologías de evaluación".
Aunque la evaluación basada en nuggets no es nueva, el marco la implementa a través de LLMs impulsados por Python capaces de identificar hechos y detectar alucinaciones dentro de pipelines de evaluación estructurados.
Posicionamiento del ecosistema de evaluación
En medio de marcos de evaluación de IA en expansión como Yourbench, de Hugging Face, y Agentic Evaluations, de Galileo, Open RAG Eval se centra específicamente en los conductos de RAG en lugar de en los resultados genéricos de LLM.
Basado en la ciencia de la recuperación de la información más que en métodos ad hoc, el marco amplía las contribuciones de código abierto de Vectara, incluido el modelo de evaluación de alucinaciones de Hughes, ampliamente adoptado.
"Lo hemos llamado deliberadamente Open RAG Eval para fomentar la colaboración en todo el sector", subraya Awadallah. "Este marco aborda una necesidad crítica del mercado para la evaluación RAG estandarizada".
Aplicación práctica
Entre los primeros en adoptarlo se encuentra Jeff Hummel, de Anywhere.re, que prevé agilizar los procesos de evaluación gracias a la colaboración de Vectara.
Hummel señaló los desafíos de escalado que implican la complejidad de la infraestructura y la gestión de costes, haciendo hincapié en las capacidades de evaluación comparativa predictiva del marco.
"Sin marcos estandarizados, dependíamos en gran medida de los comentarios subjetivos de los usuarios", reconoció Hummel. "Las métricas objetivas transformarán nuestro enfoque de escalado".
Optimización de las implantaciones de GAR
Open RAG Eval ayuda a los responsables de la toma de decisiones a abordar cuestiones críticas de configuración:
- Enfoques de agrupación por tokens frente a agrupación semántica
- Consideraciones sobre la implementación de la búsqueda híbrida
- Selección de LLM y optimización de avisos
- Umbrales de detección de alucinaciones
El marco permite la optimización iterativa basada en datos, estableciendo líneas de base, probando configuraciones y midiendo las mejoras. Las versiones futuras pueden incluir sugerencias de optimización automatizadas y herramientas de equilibrio coste-rendimiento.
Para empresas con distintos niveles de madurez de IA, Open RAG Eval ofrece estándares de evaluación científica que sustituyen a las conjeturas y las evaluaciones subjetivas, ayudando a evitar costosos errores de implementación a la vez que se avanza en la tecnología RAG.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











