вариант
Дом
Новости
Бенчмаркинг корпоративного ИИ упрощен: Рамка RAG с открытым исходным кодом предлагает научные метрики производительности

Бенчмаркинг корпоративного ИИ упрощен: Рамка RAG с открытым исходным кодом предлагает научные метрики производительности

11 ноября 2025 г.
173

Бенчмаркинг корпоративного ИИ упрощен: Рамка RAG с открытым исходным кодом предлагает научные метрики производительности

Компании вкладывают значительные средства в разработку систем Retrieval-Augmented Generation (RAG), стремясь создать точные корпоративные ИИ-решения. Но насколько эффективны эти системы в реальности?

Одним из основных препятствий является отсутствие объективных стандартов измерения эффективности RAG. Эта проблема нашла потенциальное решение благодаря сегодняшнему запуску Open RAG Eval - системы с открытым исходным кодом, разработанной совместно компанией Vectara и исследовательской группой профессора Джимми Лина в Университете Ватерлоо.

Open RAG Eval заменяет субъективные сравнения строгой, измеримой методологией для оценки точности поиска, качества генерации и частоты галлюцинаций в корпоративных реализациях RAG.

Система оценивает производительность системы с помощью двух основных категорий метрик: метрики поиска и метрики генерации. Она работает как с платформой Vectara, так и с пользовательскими решениями RAG, предоставляя техническим командам систематизированные данные для определения возможностей оптимизации.

"Измерения предшествуют улучшениям", - пояснил профессор Джимми Лин в эксклюзивном интервью. "В то время как мы могли измерить такие показатели поиска информации, как NDCG, точность и отзыв, оценка фактической корректности оставалась труднодостижимой, поэтому мы и взялись за этот проект".

Почему оценка RAG остается важнейшим препятствием для корпоративного ИИ

Компания Vectara стала пионером технологии RAG еще до того, как она стала мейнстримом: она начала работать в октябре 2022 года, а в мае 2023 года представила концепции "приземленного ИИ" для борьбы с галлюцинациями.

По мере усложнения реализаций RAG - от простых вопросов и ответов до мультиагентных систем - проблемы с оценкой усиливаются.

"В агентных средах оценка становится вдвойне важнее", - отметил генеральный директор Vectara Ам Авадалла. "Иллюзии на ранних стадиях усугубляются на всех этапах обработки, что может привести к неправильным конечным результатам".

Методология Open RAG Eval: Количественная оценка компонентов системы

В системе используется подход к оценке на основе самородков, который деконструирует ответы на основные фактические элементы.

Лин описывает, как этот метод анализирует способность систем собирать и представлять эти важные информационные элементы.

В основе оценки лежат четыре конкретных показателя:

  1. Обнаружение галлюцинаций - выявление неподтвержденной информации в генерируемом контенте
  2. Точность цитирования - оценка качества исходной документации
  3. Автоматический самородок - измеряет включение важной информации.
  4. UMBRELA - обеспечивает всестороннюю оценку работы ретривера.

Система анализирует все рабочие процессы RAG, показывая, как модели встраивания, поисковые системы, стратегии разбиения на части и LLM совместно создают результаты.

Ключевая инновация: Автоматизация на основе LLM

Прорыв Open RAG Eval заключается в автоматизации ранее ручных процессов за счет сложной интеграции LLM.

"Традиционная оценка основывалась на бинарных сравнениях", - объясняет Лин. "Наш автоматизированный подход революционизирует методологию оценки".

Хотя оценка на основе самородков не нова, фреймворк реализует ее с помощью LLM на базе Python, способных идентифицировать факты и выявлять галлюцинации в рамках структурированных конвейеров оценки.

Позиционирование экосистемы оценки

На фоне развивающихся систем оценки ИИ, таких как Hugging Face's Yourbench и Galileo's Agentic Evaluations, Open RAG Eval фокусируется именно на конвейерах RAG, а не на общих результатах LLM.

Построенная на основе устоявшейся науки об информационном поиске, а не на специальных методах, система расширяет открытый исходный код Vectara, включая широко принятую модель оценки галлюцинаций Хьюза.

"Мы намеренно назвали ее Open RAG Eval, чтобы поощрить сотрудничество в масштабах всей отрасли", - подчеркнул Авадалла. "Эта система удовлетворяет важнейшую потребность рынка в стандартизированной оценке RAG".

Практическая реализация

Среди первых внедрителей - Джефф Хаммел из Anywhere.re, который ожидает упрощения процессов оценки благодаря сотрудничеству с Vectara.

Хаммел отметил проблемы масштабирования, связанные со сложностью инфраструктуры и управлением затратами, подчеркнув при этом возможности предиктивного бенчмаркинга.

"Не имея стандартизированных систем, мы в значительной степени полагались на субъективные отзывы пользователей", - признал Хаммел. "Объективные метрики изменят наш подход к масштабированию".

Оптимизация внедрения RAG

Open RAG Eval помогает лицам, принимающим решения, решать важнейшие вопросы конфигурации:

  • Подходы, основанные на использовании токенов и семантического куска
  • Вопросы реализации гибридного поиска
  • Выбор LLM и оптимизация подсказок
  • Пороги обнаружения галлюцинаций

Фреймворк позволяет проводить итеративную оптимизацию на основе данных - устанавливать базовые значения, тестировать конфигурации и измерять улучшения. В будущих версиях могут появиться автоматические предложения по оптимизации и инструменты балансировки затрат и производительности.

Для предприятий, находящихся на разных уровнях зрелости ИИ, Open RAG Eval предлагает научные стандарты оценки, которые заменяют догадки и субъективные оценки, помогая предотвратить дорогостоящие ошибки при внедрении и одновременно развивая технологию RAG.

Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Анализ данных Лучшие инструменты ИИ для обнаружения аномалий при мониторинге KPI в командах SaaS и электронной коммерции
Лучшие инструменты ИИ для обнаружения аномалий при мониторинге KPI в командах SaaS и электронной коммерции

2026 г. Лучшие новейшие высокооцененные инструменты ИИ для обнаружения аномалий в мониторинге KPI для команд SaaS и электронной коммерции! XIX.AI подготовила мощную, меняющую правила игры коллекцию на основе строгих реальных тестов и еженедельно обновляемых рейтингов. Вы найдете подробные сравнительные данные по бесплатным и платным решениям, которые помогут вам определить обязательное к использованию решение, повышающее производительность и раскрывающее ваш потенциал в области ИИ. Исследуйте сейчас!

10 инструментов
xix.ai
письмо Лучшие генераторы конспектов на базе ИИ для длинных статей, оптимизированных для SEO
Лучшие генераторы конспектов на базе ИИ для длинных статей, оптимизированных для SEO

2026 год: лучшие и самые высокооцененные генераторы конспектов на базе ИИ для длинных SEO-статей, тщательно отобранные XIX.AI. Эти мощные инструменты обеспечивают революционную помощь в быстром создании высококачественного контента, значительно повышая эффективность написания текстов. Ознакомьтесь со сравнением бесплатных и платных версий, а также с результатами реальных тестов и подробными рейтингами, которые помогут вам найти вариант, который обязательно стоит попробовать и который соответствует вашим потребностям. Изучите их прямо сейчас, чтобы раскрыть весь потенциал ИИ.

8 инструментов
xix.ai
Образование и обучение Инструменты на базе искусственного интеллекта для выполнения домашних заданий и подготовки к экзаменам
Инструменты на базе искусственного интеллекта для выполнения домашних заданий и подготовки к экзаменам

2026: лучшие современные инструменты на базе ИИ для выполнения домашних заданий и подготовки к экзаменам! XIX.AI подготовило рейтинг самых эффективных и революционных инструментов, которые помогают учащимся повысить продуктивность, оптимизировать выполнение домашних заданий и сдавать экзамены на «отлично», проходя проверку в реальных условиях. Получите сравнение бесплатных и платных версий, подробные рейтинги и варианты, которые обязательно стоит попробовать, чтобы раскрыть свой потенциал с помощью ИИ. Узнайте больше прямо сейчас!

10 инструментов
xix.ai
Музыкальная композиция Инструменты для создания вокальных демо на основе ИИ для авторов песен, создания хуков, написания тоpline-мелодий и проведения многоязычных черновых сессий
Инструменты для создания вокальных демо на основе ИИ для авторов песен, создания хуков, написания тоpline-мелодий и проведения многоязычных черновых сессий

2026 г. лучшие инструменты для демо-записи вокала на базе ИИ для авторов песен, создателей хуков и команд, работающих с контентом на нескольких языках! XIX.AI подготовил список высокооцененных мощных инструментов, изменивших правила игры, прошедших строгие реальные тесты. Вы найдёте подробные данные сравнения бесплатных и платных версий, комплексные рейтинги и обязательные к использованию варианты, которые помогут повысить эффективность написания и раскрыть ваш творческий потенциал. Исследуйте сейчас, чтобы найти идеальный инструмент для всех ваших задач по созданию контента!

9 инструментов
xix.ai
Бизнес Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса
Лучшие инструменты для анализа конкурентов на основе искусственного интеллекта для малого бизнеса

2026: новейшие, лучшие и самые высокооцененные инструменты для анализа конкурентов на базе ИИ для малого бизнеса! XIX.AI подготовила чрезвычайно мощную подборку, способную кардинально изменить ситуацию на рынке, которая еженедельно обновляется на основе тщательных тестов в реальных условиях и подробных рейтингов. Вы найдете здесь исчерпывающее сравнение бесплатных и платных версий, которое поможет вам определить инструменты, которые обязательно стоит попробовать, чтобы повысить свою продуктивность и получить конкурентное преимущество. Ознакомьтесь с ней прямо сейчас, чтобы найти идеальный инструмент для себя!

9 инструментов
xix.ai
Редактирование изображений Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия
Инструменты ИИ-ретуши в Photoshop для электронной коммерции, одежды, очистки кожи и обеспечения цветового единообразия

2026 Latest Best Photoshop AI retouch tools for ecommerce apparel, skin cleanup, and color consistency! This top-rated curated list features powerful game-changing solutions that help you boost writing efficiency, streamline content creation, and achieve perfect visual results effortlessly. Each tool has undergone real-world tests through weekly updated rankings, complete with free vs paid comparison details. Backed by XIX.AI, it’s the must-try guide for anyone aiming to unlock your AI edge. Explore now!

10 инструментов
xix.ai
Комментарии (0)
0/500
OR