Как оценить самооценочную систему RAG с помощью DeepEval/RAGAS с золотым набором данных?Python

Программы на Python
Anonymous
Как оценить самооценочную систему RAG с помощью DeepEval/RAGAS с золотым набором данных?

Сообщение Anonymous »

Я создал систему самооценки RAG, используя LangChain, ChromaDB, гибридный поиск BM25, переписывание запросов и переоценку перекрестного кодирования, используя LLaMA 3.3 70B через Groq в качестве LLM.
Я пытаюсь оценить ее с помощью DeepEval с золотым набором данных (пары QA, созданные из моих документов). Вот моя текущая настройка:
Стек:
  • RAG: LangChain + ChromaDB + BM25 + реранкер CrossEncoder
  • LLM: Groq (LLaMA 3.3 70B)
  • Оценка Фреймворк: DeepEval v3.9.7
  • Пользовательский LLM для оценки: Gemini 1.5 Flash (через Google GenAI SDK)
  • Золотой набор данных: создан с помощью DeepEval Synthesizer из 25 документов Википедии .txt
  • Метрики: Ответ Релевантность, достоверность, контекстная точность, контекстная запоминание
Что я сделал на данный момент:
  • Создал золотой набор данных с помощью синтезатора DeepEval со специальным модулем внедрения HuggingFace и Gemini в качестве модели критика
  • Создал тестовые примеры, пропустив каждый золотой вопрос через свой реальный конвейер RAG, чтобы получить реальный фактический_вывод и извлекаемый_контекст.
  • Выполнение оценки с использованием функции Assessment() DeepEval с пользовательской моделью Gemini.
Проблемы, с которыми я столкнулся:
  • Время выполнения функции Assessment() DeepEval истекает примерно через 30 минут при параллельном выполнении 8 тестовых случаев с 4 метриками.
  • Случайное получение 500 внутренних ошибок от Gemini API во время оценки.
  • Не уверен, что выполнение оценки один за другим с использованием metric.measure() вместо Assessment() является правильным подходом
Вопросы:
  • Какой рекомендуемый способ запуска оценки DeepEval без превышения таймаутов — следует ли использовать metric.measure() один за другим или есть способ настроить таймаут в Assessment()?
  • Есть ли лучший вариант LLM с открытым исходным кодом или бесплатный LLM для оценки Оцените модель, которая более стабильна, чем Gemini, для показателей DeepEval?
  • Кто-нибудь успешно использовал RAGAS вместо DeepEval для аналогичной установки? Будет ли проще интегрировать?
  • Есть какие-нибудь советы по созданию наборов данных более высокого качества без использования OpenAI (поскольку у меня нет ключа OpenAI)?
Буду признателен за любую помощь. Спасибо!

Вернуться в «Python»