Корпоративный AI-поиск

Как измерять качество RAG-системы

Метрики поиска и ответа: покрытие, релевантность, groundedness, полнота, цитаты, отказ, права и контрольная выборка.

Коротко: RAG нужно оценивать в два слоя: нашёл ли поиск достаточные источники и поддерживает ли сформированный ответ свои утверждения этими источниками. Средняя оценка без классов ошибок скрывает критичные провалы.

Определение

Оценка RAG — воспроизводимая проверка поиска, ответа, цитат, отказа и соблюдения прав на версионируемом наборе вопросов с ожидаемыми источниками.

Когда это важно

Как принять решение

СитуацияЧто проверяемРешение
Источник не найденКорпус, запрос, chunking и ранжированиеИсправлять retrieval
Источник найден, ответ неверенКонтекст, инструкция и генерацияИсправлять answer layer
Оснований нетПорог достаточности и отказТребовать уточнение или отказ

Порядок работы

  1. Набор. Собрать частые, сложные, конфликтные и безответные вопросы.
  2. Ожидания. Указать источники, допустимые ответы и критичные ошибки.
  3. Прогон. Сохранять версию корпуса, модели и конфигурации.
  4. Разбор. Оценить классы ошибок и регрессию после изменений.

Типичные ошибки

Практические рекомендации

Вывод: RAG готов к работе, когда его ошибки измеримы, источники проверяемы, а регрессия видна до пользователя.

Частые вопросы

Какая метрика главная?

Зависит от цены ошибки; часто нужны recall источника и доля поддержанных утверждений.

Можно оценивать LLM?

Да как вспомогательный судья после проверки согласованности с экспертами.

Как тестировать права?

Вопросы прогоняются от ролей с разным доступом, включая попытки получить запрещённый контент.

Следующий шаг

Корпоративный AI-поиск

Построить тестовый контур и принять RAG по измеримым критериям.

Открыть решение
Обсудить задачу