Я пытаюсь оценить ее с помощью DeepEval с золотым набором данных (пары QA, созданные из моих документов). Вот моя текущая настройка:
Стек:
- RAG: LangChain + ChromaDB + BM25 + реранкер CrossEncoder
- LLM: Groq (LLaMA 3.3 70B)
- Оценка Фреймворк: DeepEval v3.9.7
- Пользовательский LLM для оценки: Gemini 1.5 Flash (через Google GenAI SDK)
- Золотой набор данных: создан с помощью DeepEval Synthesizer из 25 документов Википедии .txt
- Метрики: Ответ Релевантность, достоверность, контекстная точность, контекстная запоминание
- Создал золотой набор данных с помощью синтезатора DeepEval со специальным модулем внедрения HuggingFace и Gemini в качестве модели критика
- Создал тестовые примеры, пропустив каждый золотой вопрос через свой реальный конвейер RAG, чтобы получить реальный фактический_вывод и извлекаемый_контекст.
- Выполнение оценки с использованием функции Assessment() DeepEval с пользовательской моделью Gemini.
- Время выполнения функции Assessment() DeepEval истекает примерно через 30 минут при параллельном выполнении 8 тестовых случаев с 4 метриками.
- Случайное получение 500 внутренних ошибок от Gemini API во время оценки.
- Не уверен, что выполнение оценки один за другим с использованием metric.measure() вместо Assessment() является правильным подходом
- Какой рекомендуемый способ запуска оценки DeepEval без превышения таймаутов — следует ли использовать metric.measure() один за другим или есть способ настроить таймаут в Assessment()?
- Есть ли лучший вариант LLM с открытым исходным кодом или бесплатный LLM для оценки Оцените модель, которая более стабильна, чем Gemini, для показателей DeepEval?
- Кто-нибудь успешно использовал RAGAS вместо DeepEval для аналогичной установки? Будет ли проще интегрировать?
- Есть какие-нибудь советы по созданию наборов данных более высокого качества без использования OpenAI (поскольку у меня нет ключа OpenAI)?